olimposec.com
tema

#gui-agents

1 publicação marcada com esta tag.

risco altoOS-2026-130 · 2026-08-03
0

Guardrails de agentes GUI 'erodem' sob persuasão em múltiplos turnos, incluindo em Claude e GPT

Um estudo com três agentes de IA de ponta que operam interfaces gráficas mostra que guardrails baseados em prompt, eficazes em avaliações de turno único, perdem boa parte da eficácia quando o pedido malicioso é fragmentado ao longo de uma conversa de quatro turnos. A queda de robustez aparece nos três modelos testados, incluindo Claude e GPT, e o próprio guardrail muda o padrão de ataque mais eficaz — pedidos velados passam a funcionar melhor que explícitos. Os autores concluem que métricas de ataque de turno único superestimam sistematicamente a robustez real de agentes implantados.

Fonte ↗