ClawSentry reduz de ~40% para ~2,6% a taxa de sucesso de ataques via skills maliciosas em agentes de IA
ClawSentry é um gateway de segurança agnóstico de framework que audita pacotes de 'skills' de terceiros antes da primeira execução e monitora o agente em runtime em três camadas de profundidade crescente, funcionando sobre Codex, Claude Code, Kimi CLI e Gemini CLI sem alterar os agentes. No benchmark SkillInject, a taxa de sucesso de ataque caiu de 39,55% para 2,61% com perda mínima de utilidade (98,7% de tarefas legítimas ainda completadas).
À medida que agentes de LLM passam de simples chatbots para executores de código, leitores de arquivos locais e orquestradores de ferramentas externas, uma skill de terceiro maliciosa instalada no agente pode causar exfiltração de dados, escalada de privilégio ou comprometimento em cascata — um risco estruturalmente parecido com dependências maliciosas em gerenciadores de pacote, mas agravado porque o próprio agente de IA decide dinamicamente quando e como invocar a skill. Os autores argumentam que esse risco é 'progressivo': ele pode entrar em quatro pontos do loop de controle do agente — admissão da skill, intenção no momento da chamada, efeito no momento da execução e consequência pós-ação — e defesas hoje existentes normalmente cobrem só um desses pontos isoladamente.
ClawSentry cobre os quatro pontos com uma arquitetura em camadas: antes de qualquer execução, o First-use Skill Package Review (FSPR) audita o pacote sob um piso determinístico de evidência, escalando casos ambíguos para uma revisão agentic somente-leitura limitada. Em runtime, um motor de decisão progressivo de três níveis — L1 determinístico, L2 semântico ancorado em regras, L3 agente que busca evidência em modo somente-leitura — gasta esforço de revisão contextual só na ambiguidade residual, evitando o custo de analisar profundamente toda chamada. Um mecanismo de anti-bypass em nível de sessão reconhece quando o agente tenta trocar de ferramenta ou reformular um pedido negado para contornar a barreira, e evidências de alta severidade pós-ação alimentam revisões futuras sem retroagir sobre decisões já tomadas.
Os números de avaliação são fortes: no benchmark SkillInject com Codex/GPT-5.4, a taxa de sucesso de ataque contextual caiu de 39,55% para 2,61%, enquanto a taxa de sucesso de tarefa legítima caiu muito pouco (de 83,78% para 83,05%) — ou seja, a defesa quase não penaliza uso benigno. Em cinco agentes de trabalho diferentes testados no benchmark completo SkillsSafety, ClawSentry limitou a taxa de sucesso de ataque a 9,09–15,03% (contra 33,5–49,7% sem proteção), mantendo 98,7% de taxa de sucesso em skills legítimas.
O ponto mais relevante do design é o 'Agent Harness Protocol', uma camada de abstração que aplica a mesma política sobre Codex, Claude Code, Kimi CLI e Gemini CLI sem modificar o funcionamento interno de nenhum deles — um sinal de que a comunidade de segurança de agentes está convergindo para gateways de política agnósticos de runtime, análogo ao que firewalls de aplicação web fizeram para servidores web heterogêneos. Para qualquer organização que hoje permite que agentes de IA instalem skills/plugins de terceiros, esse tipo de camada de supervisão deixa de ser opcional e passa a ser infraestrutura básica de segurança.