olimposec.com
Radar / Notícias / OS-2026-286
risco altoPROMPT2026-08-24 · 2 min de leitura
0

TraceGrant bloqueia 100% dos ataques de prompt injection indireta em dois benchmarks de agentes de IA sem perder utilidade

Resumo executivo

TraceGrant governa o ciclo de vida completo de 'tarefa para efeito' de agentes de LLM conectados a e-mail, nuvem e serviços web, estabelecendo um Contrato de fronteira de autoridade antes da execução, restringindo o que evidências admitidas podem autorizar durante a execução, e verificando o resultado real contra o que foi de fato executado depois. Em 949 casos do AgentDojo e 400 do Agent Security Bench, o framework registrou zero sucessos de ataque mantendo utilidade sob taxas de ataque de 77% e 83%.

Agentes de LLM conectados a e-mail, armazenamento em nuvem, calendários e plataformas de transação precisam ler conteúdo de terceiros para completar tarefas multi-etapa com efeitos externos persistentes (enviar um pagamento, apagar um arquivo, marcar um compromisso). O problema é que esse mesmo conteúdo necessário para a execução legítima pode conter instruções injetadas indiretamente — prompt injection escondida num e-mail ou documento — que redirecionam o uso de ferramentas, alteram argumentos sensíveis ou sabotam a conclusão da tarefa. Defesas atuais em geral restringem conteúdo não confiável ou chamadas de ferramenta isoladas, mas não conectam intenção do usuário, evidência em runtime, efeito realizado e verificação de conclusão de tarefa numa só cadeia de garantia.

TraceGrant introduz um 'Contrato' explícito que formaliza essa cadeia em três fases. Antes da execução, o framework estabelece uma fronteira de tarefa-efeito a partir do pedido confiável original do usuário — ou seja, define de antemão o que pode legitimamente acontecer. Durante a execução, qualquer evidência admitida (conteúdo recuperado, resultado de ferramenta) só pode instanciar autoridade que já estava prevista no Contrato, o que barra a injeção indireta de tentar ampliar o escopo de ação na hora. Depois da execução, o sistema verifica se a conclusão da tarefa bate com os resultados reais das ferramentas chamadas, fechando o ciclo com verificação factual.

Os resultados de avaliação são notavelmente absolutos: rodando os 949 casos de ataque do AgentDojo e 400 do Agent Security Bench sob configurações fixas de benchmark, TraceGrant não registrou nenhum sucesso de ataque, enquanto mantinha utilidade (capacidade de completar tarefas legítimas) mesmo sob taxas de ataque de 77,32% e 83,00% — ou seja, mesmo quando a maioria absoluta das tentativas era maliciosa, o sistema continuou completando tarefas benignas. Os autores também testaram contra ataques 'defense-aware' de caixa branca (que conhecem o mecanismo de defesa), fizeram análise de qualidade do Contrato e ablação por estágio, reforçando a robustez do resultado além do caso ingênuo.

O diferencial conceitual de TraceGrant frente a defesas anteriores de prompt injection é tratar autorização como algo que persiste e é verificado ao longo de todo o ciclo de vida do efeito, não apenas checado uma vez na admissão da chamada de ferramenta. Isso é particularmente relevante para agentes com acesso a ações irreversíveis (pagamentos, exclusões, envios de e-mail), onde uma injeção bem-sucedida a meio caminho da execução pode ser tão danosa quanto uma na entrada.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.