SkillsMetric mapeia os limites da análise estática contra Agent Skills maliciosas — e encontra pontos cegos de 0% de detecção
O SkillsMetric é um framework de análise estática em cinco estágios para avaliar pacotes de "Agent Skills" (extensões de instruções e scripts para agentes LLM) quanto a risco malicioso, atingindo AUC de 0,93 em um dataset adversarial de 2.266 skills cobrindo 16 tipos de ataque. Apesar do bom desempenho geral, os autores identificam pontos cegos completos: ataques de destruição de host usando comandos de shell comuns escapam de todos os cinco estágios (0% de detecção), e prompt injection via manipulação em linguagem natural é detectada em apenas 42% dos casos.
"Agent Skills" — pacotes estruturados de instruções e scripts que estendem o que um agente baseado em LLM consegue fazer — estão se proliferando rapidamente como um novo tipo de "extensão" ou "plugin", mas suas propriedades de segurança ainda são pouco estudadas em comparação com, por exemplo, extensões de navegador ou pacotes npm. O SkillsMetric propõe preencher essa lacuna com um framework de análise estática em cinco estágios: densidade de padrões suspeitos, anomalia estatística, rastreamento de fluxo de dados (taint analysis), anomalia de importações e incompatibilidade entre a capacidade declarada da skill e o que ela de fato faz.
Para validar o framework, os autores construíram um dataset adversarial com 2.266 skills cobrindo 16 tipos de ataque em três níveis — código, sistema e semântico — e avaliaram também no corpus completo SkillMD-138K. O resultado agregado é forte: AUC de 0,93 e F1 de 73,4% (± 0,5%) em validação cruzada de 5 folds, com desempenho particularmente bom contra exfiltração de dados (93% de detecção) e payloads esteganográficos (93%).
O achado mais importante, porém, é o oposto do resultado agregado: os autores identificam pontos cegos completos do método. Ataques de "destruição de host" usando comandos de shell comuns e legítimos (sem qualquer ofuscação exótica) escapam dos cinco estágios de análise por completo — 0% de detecção — porque comandos destrutivos convencionais não têm assinatura estatisticamente distinguível de uso legítimo de shell. Prompt injection via manipulação puramente em linguagem natural (sem payload de código) também é mal capturada, com apenas 42% de detecção, já que análise estática de código não tem visibilidade sobre a semântica de instruções em texto livre.
O trabalho é valioso justamente por ser honesto sobre os limites: análise estática sozinha, mesmo bem construída, não é suficiente para segurança de marketplaces de Agent Skills. A recomendação dos autores — defesa em profundidade combinando triagem estática rápida com revisão semântica adicional — é diretamente acionável para qualquer plataforma que hospede ou distribua skills de terceiros para agentes de IA, já que os pontos cegos identificados (comandos shell comuns e injeção em linguagem natural) são exatamente os vetores mais simples e baratos de um atacante real explorar.