PoisonedEvolution: ataque envenena "habilidades" que agentes de IA aprendem sozinhos com a própria experiência
Pesquisadores apresentam o PoisonedEvolution, um ataque contra sistemas de "skills auto-evolutivas", nos quais agentes de IA destilam suas próprias trajetórias de uso em habilidades persistentes que passam a ser tratadas como instrução confiável. Um atacante que só consegue contribuir com evidência limitada e visível — sem acesso a pools privados nem à lógica interna de evolução — conseguiu embutir comportamentos-alvo em 91% dos casos testados no sistema SkillClaw, e o ataque também transferiu, com taxa menor, para uma arquitetura de evolução estruturalmente diferente.
Fonte ↗