AgentAntibody propõe defesa que aprende com cada tentativa de prompt injection contra agentes de LLM
Os autores propõem uma analogia com o sistema imune adaptativo: em vez de tratar cada tarefa como um problema isolado, o AgentAntibody mantém uma biblioteca persistente de 'anticorpos' que captura o entendimento evolutivo do agente sobre os limites de segurança aceitáveis pelo usuário, aplicando esse aprendizado acumulado a cada nova interação. Em testes com três benchmarks e quatro LLMs base, o método superou defesas existentes tanto em bloquear ações maliciosas quanto em preservar a conclusão de tarefas legítimas.
Fonte ↗