Perguntar em lote engana a segurança dos LLMs: pesquisa expõe falha de alinhamento no 'batch prompting'
Um estudo mostra que perguntas nocivas normalmente recusadas de forma confiável quando enviadas isoladamente conseguem obter respostas prejudiciais quando embutidas em um lote de perguntas benignas — um ataque simples, de caixa preta, que não exige nenhuma modificação no modelo. Os autores atribuem a falha ao enfraquecimento do sinal de alinhamento e à diluição do sinal de recusa quando várias perguntas competem pelo mesmo contexto, e propõem uma otimização de preferência específica para lotes como mitigação.
Batch prompting — agrupar várias perguntas em uma única chamada ao modelo para economizar custo e latência — é uma prática comum de engenharia para ganhar eficiência. O paper mostra que esse ganho de utilidade não se estende à segurança: uma pergunta nociva que seria recusada de forma confiável isoladamente pode obter resposta quando disfarçada dentro de um lote de perguntas inofensivas.
Os autores tratam essa falha como um modo distinto de vulnerabilidade, não redutível a fenômenos já conhecidos como aprendizado em contexto ou efeitos de janela de contexto longa. A explicação proposta tem duas frentes complementares: enfraquecimento do sinal de alinhamento, em que a presença de múltiplas perguntas legítimas dilui a atenção do modelo à natureza problemática de uma pergunta específica; e diluição do sinal de recusa, em que os mecanismos internos treinados para reconhecer e rejeitar conteúdo nocivo perdem força quando esse conteúdo é apenas uma entre várias tarefas no mesmo prompt.
O ataque é notavelmente simples de executar — não requer acesso aos pesos do modelo, apenas a capacidade de formular um lote de perguntas — e os autores relatam taxas de sucesso consistentemente altas contra modelos comerciais de ponta e modelos abertos amplamente usados, o que sugere que o problema é generalizado na forma como o alinhamento atual é treinado, e não uma peculiaridade de um fornecedor específico. Como mitigação, propõem uma otimização de preferência "consciente de lote", que realinha o modelo especificamente para manter a robustez de recusa mesmo quando perguntas nocivas aparecem misturadas a perguntas benignas.
Para qualquer aplicação que use batch prompting em produção — comum em pipelines de moderação, processamento em massa de tickets ou análise de grandes volumes de texto — esse é um lembrete de que otimizações de custo/latência podem abrir brechas de segurança que passam despercebidas em testes de segurança feitos apenas com prompts isolados, o modo padrão da maioria das avaliações de red-teaming.