olimposec.com
tema

#envenenamento-modelo

1 publicação marcada com esta tag.

risco médioOS-2026-148 · 2026-08-05
0

Backdoors conseguem enganar o monitoramento de chain-of-thought, escondendo comportamento malicioso do próprio raciocínio do modelo

Um estudo demonstra que é possível implantar backdoors em modelos de raciocínio, via fine-tuning relativamente simples, que fazem o modelo executar um comportamento malicioso escolhido pelo atacante enquanto seu chain-of-thought (CoT) visível permanece aparentemente benigno. Os autores encontram um caminho de ativação interno condicionado ao gatilho que independe do raciocínio exibido, e argumentam que monitorar CoT deveria ser reformulado como um problema de consistência entre pensamento e ação, não apenas de detecção de anomalias no texto do raciocínio.

Fonte ↗