olimposec.com
tema

#integridade-de-modelo

2 publicações marcadas com esta tag.

risco médioOS-2026-220 · 2026-08-12
0

Modelos de IA que se retreinam sozinhos em produção quebram a auditoria tradicional — e um provedor desonesto pode esconder isso

O artigo aborda a governança de modelos generativos auto-adaptativos — que atualizam os próprios pesos durante a operação em produção — mostrando que essa prática invalida a premissa de validação pontual usada na gestão tradicional de risco de modelo. Na primeira parte, os autores propõem uma arquitetura de telemetria com cadeia Merkle à prova de adulteração e logging orientado a eventos; na segunda, tratam o cenário em que o próprio provedor do modelo é adversário, formalizando o "Model Hiding Problem" e catalogando seis estratégias distintas para esconder atualizações de aprendizado que deveriam disparar revisão obrigatória, com uma contramedida formal para cada uma.

Fonte ↗
panoramaOS-2026-171 · 2026-08-07
0

Ferramenta detecta, via análise de ativações, quando o treinamento de segurança de um modelo foi removido ou contornado

Pesquisadores apresentam o AMS (Activation-based Model Scanner), que detecta modificações no treinamento de segurança de LLMs medindo a geometria de conceitos relacionados a conteúdo nocivo no espaço de ativações do modelo. Testado em 14 configurações de quatro famílias de modelos abertos (Llama, Gemma, Qwen, Mistral), o AMS classifica corretamente 10 de 14 casos em validação cruzada, e a métrica que ele extrai se correlaciona de forma estatisticamente significativa com o quanto o modelo de fato obedece a pedidos prejudiciais em testes de jailbreak.

Fonte ↗