olimposec.com
Radar / Notícias / OS-2026-299
risco médioNOTÍCIA2026-08-26 · 2 min de leitura
0

RAGSentinel detecta documentos envenenados em RAG sem precisar de treinamento ou rótulos

Resumo executivo

Defesa geométrica para sistemas RAG usa um encoder substituto para medir como cada documento recuperado desloca o estado oculto do modelo, filtrando como outliers os documentos que tentam manipular a resposta, com garantia formal de recuperar um contexto livre de veneno sob suposição de maioria honesta.

Sistemas de geração aumentada por recuperação (RAG) fundamentam as respostas de um LLM em documentos externos para melhorar factualidade, mas isso também abre uma superfície de ataque concreta: um atacante capaz de injetar documentos na base de conhecimento consultada (uma wiki pública, um índice raspado da web, uma base compartilhada) pode direcionar o modelo para respostas erradas específicas sempre que uma consulta compatível recuperar aquele documento envenenado.

Defesas anteriores verificam se o documento recuperado segue instruções, contradiz conhecimento paramétrico do modelo, ou é consistente em nível textual — tudo isso algo que um atacante adaptativo consegue otimizar seu documento envenenado para contornar, uma vez que conhece a defesa. O RAGSentinel, em vez disso, mede como cada documento candidato desloca a representação de estado oculto do modelo em relação à consulta, remove as direções temáticas compartilhadas por todos os documentos recuperados (benignos e maliciosos) e sinaliza como outlier geométrico qualquer documento cuja representação restante destoa da maioria — documentos envenenados, por mais fluentes que sejam textualmente, tendem a empurrar o estado oculto numa direção atípica para conseguir seu efeito de manipulação.

Ser livre de treinamento e de rótulos significa que pode ser acoplado a um pipeline RAG de caixa preta já existente sem retreinar nada nem precisar de exemplos rotulados de envenenamento previamente conhecidos, e os autores provam uma garantia formal de recuperação sob suposição de maioria honesta, em vez de reportar apenas números empíricos — algo relevante para uma defesa que precisa resistir a atacantes adaptativos com conhecimento completo do pipeline.

Aceito no EMNLP 2026 (conferência principal), o método foi avaliado em três datasets de perguntas e respostas e três famílias de LLM, mantendo eficácia mesmo contra atacantes adaptativos com conhecimento completo do pipeline — uma classe de defesa RAG bem mais robusta do que os filtros baseados em instrução ou texto que a maioria das implementações usa hoje.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.