Reflex-Guard propõe guardrail local de baixíssima latência para bloquear jailbreaks de LLM em tempo real
Reflex-Guard é um guardrail de segurança para prompts de LLM que roda inteiramente local, usando embeddings compactos e classificadores binários rápidos, para detectar jailbreaks em cerca de 38 milissegundos, muito abaixo dos 250-900ms típicos de abordagens baseadas em LLM-juiz ou APIs de moderação na nuvem. O sistema detecta 100% dos ataques de sufixo GCG e prompts em Base64, mas exige ajuste de limiar para lidar com ataques estruturados do tipo DrAttack, que ocupam uma região diferente do espaço de embeddings.
Pesquisadores (Istiaque Ahmed, Afia Anjum Borsha, Ranat Das Prangon, Abu-fuad Ahmad, Thi Hong Tran) miram uma restrição de implantação que os guardrails de segurança de prompt existentes em geral ignoram: aplicações em tempo real costumam precisar responder em menos de 100 milissegundos, mas as abordagens dominantes hoje, LLM-como-juiz ou APIs de moderação na nuvem, adicionam de 250 a 900 milissegundos de latência por requisição, além de exigirem enviar o prompt do usuário a um serviço externo, o que levanta preocupações de privacidade.
Tecnicamente, o Reflex-Guard roda inteiramente local, usando pré-processamento consciente de jailbreak, embeddings compactos de sentence-transformer e sete classificadores binários rápidos operando em conjunto sobre esses embeddings, evitando tanto a ida e volta a uma API externa de moderação quanto o custo de rodar uma passada completa de LLM-juiz.
Avaliado sobre um dataset balanceado de 30.568 amostras vindas de cinco fontes complementares, o Reflex-Guard atinge 95,9% de recall em prompts nocivos com latência ponta a ponta de 37,6 milissegundos, mais rápido que o Llama Guard 2 (255ms) e o SafeDecoding (723ms); detecta 100% dos ataques de sufixo GCG e prompts codificados em Base64 no limiar padrão, embora prompts estruturados do tipo DrAttack tenham exigido reduzir o limiar de detecção para 0,03 para uma detecção confiável, já que produzem uma distribuição de probabilidade distinta no espaço de embeddings em relação aos demais tipos de ataque. Os autores reportam um 'Reflex Efficiency Score' combinado (precisão por latência) de até 16,79, contra 11,90 do Llama Guard 2 e 9,80 do SafeDecoding.
Para qualquer produto que embuta um LLM em um fluxo sensível a latência e voltado ao usuário final, assistentes de voz, chat em tempo real, autocompletar de código dentro do editor, as duas opções dominantes de guardrail hoje, uma chamada de LLM-juiz ou uma API de segurança na nuvem, costumam ser simplesmente lentas demais ou invasivas demais em privacidade para uso inline, o que na prática empurra muitas equipes a pular a filtragem pré-geração ou aplicá-la só depois do fato. Um guardrail que roda localmente em menos de 40 milissegundos, sem sair do ambiente de implantação, remove essa troca, ao menos para os tipos de ataque contra os quais foi validado; a ressalva de que diferentes famílias de jailbreak (DrAttack vs. GCG vs. Base64) ocupam regiões distintas do espaço de embeddings, e precisam de limiares diferentes, é um detalhe prático importante: equipes que adotam esse tipo de classificador leve precisam ajustar e validar por família de ataque, em vez de assumir que um único limiar generaliza, sob risco de uma falsa sensação de cobertura contra estilos de ataque mais novos e não representados nos dados de treino.