olimposec.com
Radar / Notícias / OS-2026-202
panoramaPROMPT2026-08-11 · 2 min de leitura
0

RAG-IDS defende sistemas de detecção de intrusão baseados em RAG contra envenenamento de base de conhecimento e prompt injection

Resumo executivo

Sistemas de detecção de intrusão que usam RAG para classificar tráfego de rede e gerar relatórios legíveis herdam uma nova superfície de ataque na camada de recuperação: envenenamento da base de conhecimento vetorial e prompt injection via documentos recuperados. O RAG-IDS combina pontuação de confiança, checagem de consistência entre rótulo e embedding e sanitização de prompt para recuperar a maior parte do desempenho perdido sob ataque, com overhead desprezível em condições normais.

Aplicar RAG a detecção de intrusão tem uma vantagem clara: em vez de depender só de um classificador estático, o sistema recupera tráfego histórico semanticamente similar de uma base vetorial e usa isso tanto para classificar o fluxo atual quanto para gerar relatórios de incidente legíveis por humanos. O problema é que essa mesma camada de recuperação vira um novo ponto de entrada para o atacante: se ele conseguir inserir exemplos maliciosos na base de conhecimento (poisoning) ou embutir instruções dentro dos documentos recuperados (prompt injection), pode manipular a classificação final ou o relatório gerado.

O RAG-IDS responde com uma defesa em três camadas na fronteira de recuperação: soft trust scoring, que rebaixa (sem eliminar completamente) a confiança de documentos suspeitos em vez de aplicar um filtro binário rígido; LECC (Label-Embedding Consistency Checking), que verifica se o rótulo associado a um documento recuperado é consistente com seu embedding, pegando exemplos envenenados que tentam associar um rótulo falso a um padrão de tráfego; e sanitização de prompt para neutralizar instruções embutidas nos documentos antes de chegarem ao LLM.

Nos testes com o dataset CIC-UNSW-NB15, a defesa recuperou desempenho equivalente ao cenário limpo (R=1,0) com 1% de envenenamento, caindo para R=0,57 em 30% de envenenamento — ainda uma recuperação substancial frente ao pipeline sem defesa. Sob prompt injection, a recuperação com múltiplos documentos limitou o sucesso de troca de rótulo a 0,6-2,4%, contra 35-55% quando a recuperação usa um único documento — evidenciando que multi-document retrieval por si só já é uma mitigação relevante. O overhead em desempenho limpo foi descrito como desprezível, e a LECC se destacou como o componente que mais contribuiu para a robustez geral.

Para equipes de SOC que avaliam adotar RAG em ferramentas de detecção, o trabalho é um lembrete de que qualquer base de conhecimento alimentando decisões de segurança automatizadas precisa ela mesma de controles de integridade — do contrário, a própria camada de "inteligência" adicionada para melhorar a detecção se torna o alvo mais fácil de manipular.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.