MaliciousSkillBench expõe o quanto os detectores atuais falham contra "skills" maliciosas para agentes de IA
Pesquisadores consolidaram 13 fontes públicas para criar o MaliciousSkillBench, um benchmark com 9.740 "Agent Skills" (pacotes de instruções, scripts e configurações reutilizáveis que estendem agentes de LLM), sendo 7.505 maliciosas. O resultado mostra que os melhores detectores atuais, embora pontuem bem em avaliação aleatória, despencam quando testados contra skills de fontes nunca vistas — um dos melhores modelos manteve 95,6% de detecção maliciosa mas gerou 62,4% de falsos positivos em skills benignas.
Fonte ↗