ToolHazard automatiza a criação de ambientes adversariais para testar agentes LLM contra injeção de prompt indireta
O framework substitui a construção manual de cenários de teste por uma pipeline de três agentes que sintetiza ambientes executáveis com estado, descobre pontos viáveis de injeção e gera tarefas de longo horizonte realistas para expor agentes LLM equipados com ferramentas. Os experimentos confirmam vulnerabilidades substanciais nos agentes testados e mostram que o momento e o local da injeção afetam diretamente a eficácia do ataque, além de os dados gerados servirem também para treinar defesas sem sacrificar utilidade em tarefas legítimas.
Fonte ↗