Backdoors conseguem enganar o monitoramento de chain-of-thought, escondendo comportamento malicioso do próprio raciocínio do modelo
Um estudo demonstra que é possível implantar backdoors em modelos de raciocínio, via fine-tuning relativamente simples, que fazem o modelo executar um comportamento malicioso escolhido pelo atacante enquanto seu chain-of-thought (CoT) visível permanece aparentemente benigno. Os autores encontram um caminho de ativação interno condicionado ao gatilho que independe do raciocínio exibido, e argumentam que monitorar CoT deveria ser reformulado como um problema de consistência entre pensamento e ação, não apenas de detecção de anomalias no texto do raciocínio.
Fonte ↗