olimposec.com
tema

#guardrail

2 publicações marcadas com esta tag.

panoramaOS-2026-256 · 2026-08-19
0

Reflex-Guard propõe guardrail local de baixíssima latência para bloquear jailbreaks de LLM em tempo real

Reflex-Guard é um guardrail de segurança para prompts de LLM que roda inteiramente local, usando embeddings compactos e classificadores binários rápidos, para detectar jailbreaks em cerca de 38 milissegundos, muito abaixo dos 250-900ms típicos de abordagens baseadas em LLM-juiz ou APIs de moderação na nuvem. O sistema detecta 100% dos ataques de sufixo GCG e prompts em Base64, mas exige ajuste de limiar para lidar com ataques estruturados do tipo DrAttack, que ocupam uma região diferente do espaço de embeddings.

Fonte ↗
panoramaOS-2026-198 · 2026-08-11
0

Defesa "Capability-Routed Guard" mira jailbreaks que exploram o raciocínio de modelos de raciocínio grandes

Pesquisadores propõem o Capability-Routed Guard (CRG), uma defesa de inferência para modelos de raciocínio de código fechado que ataca um problema específico: prompts adversariais que manipulam o contexto de raciocínio ou a decomposição de tarefas para fazer o modelo tratar um objetivo malicioso como um passo de raciocínio legítimo. Em vez de inspecionar o prompt adversarial diretamente, o CRG constrói uma representação confiável da tarefa autorizada por um canal separado e roteia a execução conforme o risco.

Fonte ↗