COPA trata defesa contra prompt injection como um problema de aprendizado contínuo
Pesquisadores propuseram o COPA, um framework que atualiza continuamente as defesas de um LLM contra prompt injection à medida que novos ataques surgem, em vez de depender de um alinhamento estático feito uma única vez. Usando otimização por preferência baseada em GRPO e replay de experiência ponderado por margem para não esquecer defesas antigas, o método reduziu a taxa de sucesso de ataques em até 6,3 vezes frente a defesas de última geração, em fluxos de ataques que evoluem ao longo do tempo.
Fonte ↗