olimposec.com
tema

#abliteracao

1 publicação marcada com esta tag.

panoramaOS-2026-171 · 2026-08-07
0

Ferramenta detecta, via análise de ativações, quando o treinamento de segurança de um modelo foi removido ou contornado

Pesquisadores apresentam o AMS (Activation-based Model Scanner), que detecta modificações no treinamento de segurança de LLMs medindo a geometria de conceitos relacionados a conteúdo nocivo no espaço de ativações do modelo. Testado em 14 configurações de quatro famílias de modelos abertos (Llama, Gemma, Qwen, Mistral), o AMS classifica corretamente 10 de 14 casos em validação cruzada, e a métrica que ele extrai se correlaciona de forma estatisticamente significativa com o quanto o modelo de fato obedece a pedidos prejudiciais em testes de jailbreak.

Fonte ↗