olimposec.com
Radar / Notícias / OS-2026-135
risco altoPROMPT2026-08-03 · 2 min de leitura
0

Pesquisa mostra como transformar o próprio alinhamento de segurança de LLMs em arma para bloquear RAG

Resumo executivo

Pesquisadores mostram que é possível transformar o próprio alinhamento de segurança de LLMs em uma arma para bloquear respostas legítimas de sistemas RAG, explorando a semelhança de critérios de recusa entre modelos diferentes, a chamada 'homogeneidade de alinhamento'. O ataque, batizado TabooRAG, envenena um único documento por consulta com contexto de risco, sem instrução explícita, e transfere bem entre modelos nunca vistos durante o ataque. Os resultados mostram 67% de ganho sobre a melhor defesa existente, configurando um ataque de negação de serviço difícil de filtrar com detectores tradicionais de prompt injection.

Pesquisadores (Junchen Li e mais oito coautores) demonstraram o TabooRAG, um ataque que engana sistemas de Retrieval-Augmented Generation para que recusem responder a perguntas legítimas dos usuários, explorando o próprio treinamento de segurança dos modelos como vetor de ataque, em vez de tentar contorná-lo.

Ataques anteriores de bloqueio injetavam instruções explícitas ou sufixos adversariais em documentos indexados para forçar recusa, técnica cada vez mais detectada por filtros de prompt injection. O TabooRAG parte de uma observação diferente, batizada de 'homogeneidade de alinhamento': diferentes LLMs com fine-tuning de segurança compartilham categorias de risco e critérios de recusa muito parecidos, o que torna transferível entre modelos qualquer contexto que dispare recusa em um deles. O ataque otimiza, em um ambiente RAG substituto controlado pelo atacante, um único documento por consulta que constrói contexto de risco relevante à pergunta, sem instrução explícita alguma, e esse documento, quando indexado no sistema RAG alvo real e desconhecido, aciona a recusa alinhada do LLM, negando uma resposta legítima. Uma biblioteca de estratégias reaproveita padrões validados para reduzir o custo de otimizar um novo ataque a cada consulta.

Isso importa porque é, na prática, um ataque de negação de serviço direcionado: um concorrente ou ator malicioso poderia envenenar poucos documentos em uma base de conhecimento pública — wikis, fóruns, páginas indexadas — para fazer um assistente baseado em RAG recusar sistematicamente perguntas específicas, sem nunca precisar acessar o sistema alvo diretamente nem realizar jailbreak convencional. Os autores relatam 67,3% de ganho relativo sobre a melhor linha de base em nove LLMs e três datasets, inclusive contra defesas existentes e modelos-alvo nunca vistos durante o treinamento do ataque, ou seja, o método generaliza bem, o pior cenário para quem depende de treinar um classificador de detecção específico.

Times que constroem RAG sobre corpora com contribuição de terceiros — wikis internas, tickets de suporte, conteúdo gerado por usuário — devem considerar que o próprio alinhamento de segurança do modelo agora faz parte da superfície de ataque, não apenas uma rede de proteção, e que defesas de detecção de prompt injection tradicionais, focadas em instruções explícitas, não capturam esse padrão baseado em contexto de risco implícito.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.