Agente de avaliação detecta envenenamento de conhecimento em RAG antes de o LLM gerar a resposta
O 'Evaluation Agent' combina verificação factual por inferência de linguagem natural, um detector de envenenamento com cinco sinais e um Índice de Confiança combinado para identificar documentos maliciosos injetados em sistemas RAG antes que o LLM os use para gerar resposta. No TruthfulQA com Llama 3.3 70B, atingiu 91% de acurácia e 100% de recall contra injeção de instrução, mas teve dificuldade com trocas sutis de entidade e enfraquecimento semântico.
Sistemas RAG (Retrieval-Augmented Generation) fundamentam respostas de LLM em documentos recuperados de uma base externa, partindo da premissa implícita de que relevância semântica alta implica confiabilidade factual — uma premissa falsa que os autores chamam de 'lacuna de segurança-confiabilidade' (Security-Reliability Gap). Um atacante pode explorar exatamente essa lacuna por envenenamento de conhecimento: inserir documentos maliciosos na base que são semanticamente relevantes à pergunta (por isso são recuperados) mas contêm desinformação direcionada, fazendo o LLM gerar respostas erradas com aparência de fundamentação legítima.
O Evaluation Agent atua como middleware entre a etapa de recuperação e a etapa de geração, combinando três mecanismos: inferência de linguagem natural (NLI) para verificação factual dos documentos recuperados contra a pergunta, um detector de envenenamento com cinco sinais distintos agregados por peso de relevância, e um Índice de Confiança (Trust Index) calculado como T = 0,4·F + 0,35·C + 0,25·(1−P), com um amortecedor não-linear que penaliza mais fortemente contextos de alta contaminação. Crucialmente, o sistema mede a detecção de contexto envenenado antes da geração, não se o LLM efetivamente 'engoliu' a desinformação depois — uma distinção importante porque intercepta o problema na porta de entrada, antes que ele se propague para a resposta final.
No benchmark TruthfulQA com Llama 3.3 70B, o sistema atingiu 91% de acurácia e 100% de precisão, com 100% de recall especificamente contra ataques de injeção de instrução — o tipo de ataque mais 'ruidoso' e portanto mais fácil de sinalizar. Já edições sutis no local (troca de entidades, enfraquecimento semântico gradual da afirmação) permaneceram difíceis de detectar, o que é esperado, já que esses ataques são desenhados para preservar a aparência de coerência textual. Em três LLMs diferentes, o Índice de Confiança manteve capacidade discriminativa (AUC-ROC entre 0,73 e 0,81), mas os autores notam que o estilo de geração de cada modelo importa mais que o tamanho do modelo, e que calibração de limiar por LLM foi necessária para recuperar acurácia competitiva — um resultado mais fraco em generalização cross-dataset (FEVER) reforça que calibração específica de domínio é necessária, não um limiar único universal.
Os autores também testaram um caso de uso concreto de engenharia de software: um assistente de codificação segura fundamentado em diretrizes OWASP Top 10 e CWE, onde o agente bloqueou de forma confiável injeção de instrução de conselho inseguro (F1 de 92%), mas teve mais dificuldade com contradições sutis. Isso torna o trabalho relevante tanto para quem opera chatbots RAG voltados ao público quanto para quem usa RAG como base de conhecimento em ferramentas de segurança/codificação, onde uma base de conhecimento envenenada poderia silenciosamente ensinar práticas inseguras.