DenialRAG: ataque de envenenamento em RAG que nega a resposta certa dentro do próprio documento malicioso
Pesquisadores propõem o DenialRAG, um ataque de envenenamento de corpus em sistemas de geração aumentada por recuperação (RAG) que, ao invés de simplesmente omitir a resposta correta, a nomeia explicitamente dentro do documento malicioso, a refuta e oferece uma explicação forjada para a resposta errada. Testado contra oito LLMs de quatro fornecedores, o ataque teve a maior taxa de sucesso registrada em todos os conjuntos de dados baseados em Mistral-7B, embora sua eficácia varie bastante conforme o modelo alvo.
Sistemas RAG buscam documentos relevantes em um corpus e os injetam no contexto do LLM para fundamentar a resposta em informação externa. Isso os torna vulneráveis a envenenamento de corpus: se um atacante conseguir inserir um documento malicioso no índice de recuperação, pode tentar direcionar o modelo para uma resposta incorreta escolhida por ele. Ataques anteriores de documento único geralmente evitavam mencionar a resposta correta dentro do documento envenenado, preferindo simplesmente reforçar a resposta errada.
O DenialRAG inverte essa lógica: o documento malicioso nomeia explicitamente a resposta correta, a nega diretamente, e apresenta uma justificativa fabricada e coerente para a resposta incorreta favorecida pelo atacante. Ao colocar as duas respostas — a correta e a envenenada — dentro do mesmo trecho recuperado, o conflito é embutido diretamente no contexto que o modelo gerador vai processar, forçando-o a "resolver" uma contradição já pré-arbitrada pelo atacante. Nos testes de contribuição de componentes, essa negação embutida foi identificada como o elemento mais influente do ataque.
A avaliação comparou o DenialRAG contra quatro ataques publicados de envenenamento de documento único, em três datasets de perguntas e respostas em domínio aberto, oito LLMs de quatro fornecedores diferentes, e cinco defesas aplicadas em tempo de inferência. O resultado central é que a eficácia de qualquer ataque de RAG é fortemente dependente do modelo alvo: o DenialRAG dominou em todos os datasets baseados em Mistral-7B e se manteve competitivo em vários outros modelos, mas outros ataques da literatura levaram vantagem em regimes de modelo diferentes. As defesas testadas reduziram a taxa de sucesso de forma mensurável, mas nenhuma eliminou o risco de forma uniforme entre modelos.
A conclusão prática — de que o risco de envenenamento de RAG não pode ser caracterizado por uma única família de ataque ou um único modelo alvo — é relevante para quem avalia defesas de RAG em produção: testar apenas contra um ataque conhecido, ou apenas contra um modelo, dá uma falsa sensação de cobertura. Times que operam pipelines RAG com corpora parcialmente abertos a contribuição externa (wikis, tickets, documentos enviados por usuários) deveriam considerar esse tipo de ataque combinado como parte de sua superfície de ameaça.