MemPoison mapeia pontos cegos estruturais de defesas contra envenenamento de memória em agentes LLM
MemPoison é um benchmark com 1.227 casos validados manualmente que testa ataques de envenenamento de memória persistente em dez famílias de modelos, organizados em uma taxonomia de três níveis de complexidade. O achado central é que defesas simples aplicadas no momento da escrita, como checagens de consistência, barram ataques diretos, mas falham sistematicamente contra corrupção composicional entre múltiplos registros e contra gatilhos dormentes ativados só em contexto específico.
Fonte ↗