Poise: uma única instrução escondida no corpo de um "skill" de agente basta para executar comandos do atacante silenciosamente
O estudo demonstra o Poise, um ataque que envenena arquivos de "skill" usados para estender agentes de IA, inserindo uma única instrução no corpo do arquivo — não no frontmatter YAML mais visível — de forma que o agente executa o comando do atacante enquanto ainda completa normalmente a tarefa legítima do usuário, sem levantar suspeita. Contra o modelo codex+gpt-5.2, o Poise atinge 89,3% de taxa de sucesso de ataque, comparável a uma versão mais exposta que usa o campo YAML, mas com taxa de detecção por auditores automáticos muito menor.
Fonte ↗