StepJack expõe agentes de uso de computador a injeção de prompt indireta fragmentada em múltiplas etapas
Pesquisadores mostram que dividir um objetivo malicioso em sub-instruções aparentemente inofensivas, espalhadas ao longo de páginas que um agente de uso de computador (CUA) navega, aumenta a taxa de sucesso de injeção de prompt indireta — no GPT-5.4-mini, a taxa de sucesso subiu de 41,7% (ataque em uma etapa) para 72,9% (três etapas). O benchmark StepJack, com 480 casos de teste, formaliza essa classe de ataque e mostra que defesas que inspecionam instruções isoladas não bastam quando o ataque é fragmentado ao longo da trajetória de navegação do agente.
Fonte ↗