olimposec.com
Radar / Notícias / OS-2026-075
panoramaPROMPT2026-07-23 · 2 min de leitura
0

Twin Agent separa privilegios entre um agente que explora e outro que executa para conter injecao de prompt

Resumo executivo

O Twin Agent propoe um padrao de design de separacao de privilegios com dois agentes quase simetricos: um Explore Agent que inspeciona conteudo nao confiavel e um Safe Agent que executa acoes privilegiadas, comunicando-se apenas por dicas compactas. A abordagem busca resolver o dilema classico das defesas de separacao de privilegios, que costumam sacrificar utilidade da tarefa em troca de seguranca.

Agentes LLM que consomem observacoes de fontes externas (paginas web, resultados de ferramentas, e-mails) estao sujeitos a ataques de injecao de prompt indireta, em que instrucoes maliciosas embutidas nesse conteudo manipulam o raciocinio e as acoes subsequentes do agente. A defesa canonica e separar o processamento de conteudo nao confiavel da execucao de acoes privilegiadas, mas implementacoes anteriores desse principio tendem a degradar a utilidade do agente ou exigir engenharia especifica para cada tarefa.

O Twin Agent resolve isso com dois agentes quase simetricos inspirados em codificacao residual: o Explore Agent inspeciona a informacao nao confiavel condicionado ao contexto atual do Safe Agent, e repassa apenas "dicas" compactas sobre a proxima acao a tomar -- nao o conteudo bruto nem raciocinio extenso. O Safe Agent, que de fato executa acoes privilegiadas, nunca ve o conteudo nao confiavel diretamente, apenas esse resumo minimo. Ao reduzir drasticamente a quantidade de informacao que atravessa a fronteira de privilegio, o design melhora o equilibrio entre seguranca e utilidade, algo que os autores verificam empiricamente variando o tamanho das dicas e medindo como utilidade e taxa de sucesso de ataque mudam.

A avaliacao em tarefas de engenharia de software de longo horizonte (SWE-bench Lite) e em interacoes heterogeneas com multiplas ferramentas (AgentDojo, DecodingTrust-Agent) mostra que o Twin Agent mantem alta utilidade de tarefa enquanto bloqueia ataques de injecao de prompt, superando tanto agentes sem defesa quanto baselines anteriores de separacao de privilegios. Na pratica, esse tipo de arquitetura e relevante para qualquer produto que de a um agente LLM acesso a ferramentas com efeitos reais (escrever codigo, enviar dados, executar comandos) enquanto tambem o expoe a conteudo nao confiavel da internet -- exatamente a combinacao que hoje sustenta a maioria dos incidentes de injecao de prompt relatados em agentes de producao.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.