olimposec.com
tema

#benchmark-de-seguranca

2 publicações marcadas com esta tag.

risco altoOS-2026-182 · 2026-08-10
0

StepJack expõe agentes de uso de computador a injeção de prompt indireta fragmentada em múltiplas etapas

Pesquisadores mostram que dividir um objetivo malicioso em sub-instruções aparentemente inofensivas, espalhadas ao longo de páginas que um agente de uso de computador (CUA) navega, aumenta a taxa de sucesso de injeção de prompt indireta — no GPT-5.4-mini, a taxa de sucesso subiu de 41,7% (ataque em uma etapa) para 72,9% (três etapas). O benchmark StepJack, com 480 casos de teste, formaliza essa classe de ataque e mostra que defesas que inspecionam instruções isoladas não bastam quando o ataque é fragmentado ao longo da trajetória de navegação do agente.

Fonte ↗
risco médioOS-2026-190 · 2026-08-10
0

HarnessSafe avalia como riscos persistem e se propagam por memória, skills e ferramentas em harnesses de agentes de IA

O benchmark HarnessSafe reúne 328 casos executáveis distribuídos em sete famílias de 'carriers' persistentes (memória, skills, ferramentas, artefatos compartilhados) para avaliar como uma influência maliciosa introduzida uma única vez pode atravessar fronteiras de sistema e, mais tarde, afetar a execução de uma tarefa completamente benigna. Os resultados mostram que a contenção do risco é altamente específica a cada carrier e depende fortemente da combinação entre harness de agente e modelo usado, e que a taxa de sucesso do ataque isolada não revela em que estágio da cadeia o comprometimento foi de fato contido.

Fonte ↗