Mask2Shield tenta blindar LLMs contra ataques que podam neurônios responsáveis pela recusa de conteúdo nocivo
Pesquisadores mostram que o comportamento de recusa de LLMs alinhados costuma depender de um pequeno conjunto de neurônios que, se removidos por poda (pruning), eliminam a segurança do modelo sem destruir sua capacidade geral. Em resposta, propõem o Mask2Shield, um método de treinamento que força o modelo a manter a recusa mesmo quando esses neurônios são artificialmente desativados durante o treino.
O artigo parte de uma observação preocupante sobre alinhamento de segurança em LLMs: o comportamento de recusa a pedidos nocivos não está distribuído de forma redundante pela rede, mas concentrado em um conjunto pequeno e identificável de neurônios. Ataques de poda neuronal (neuron-pruning attacks) exploram exatamente isso — bastam remover ou desativar essas unidades para que o modelo perca a recusa e continue respondendo normalmente ao restante das tarefas, sem o custo computacional ou a detectabilidade de um jailbreak via prompt.
A defesa proposta, batizada de Mask2Shield (M2S), usa uma técnica de "alinhamento com máscara na passagem direta": durante o treinamento, partes da rede são mascaradas (simulando a poda) e o modelo é forçado a recuperar uma recusa segura usando apenas o restante da computação disponível. Para evitar que esse processo degrade a utilidade do modelo, um professor congelado e sem máscara fornece respostas benignas completas como referência, limitando a perda de capacidade. Em dez configurações de modelo testadas, o M2S reduziu ataques de poda bem-sucedidos de uma faixa de 80–279 para apenas 1–44 em 313 prompts, mantendo o desempenho em quatro benchmarks de capacidade, inclusive contra o TwinBreak, uma técnica de poda com critério de seleção de neurônios diferente.
Na prática, o resultado é relevante porque ataques de poda operam diretamente sobre os pesos do modelo, um vetor que fica fora do alcance de defesas baseadas em filtragem de prompt ou moderação de saída — típicas de provedores que só controlam a camada de API. Qualquer ator com acesso aos pesos de um modelo open-weight pode, em teoria, aplicar esse tipo de ataque para remover as recusas antes de redistribuir ou hospedar o modelo. Isso torna o Mask2Shield relevante sobretudo para quem publica pesos abertos e quer que a segurança sobreviva a modificações downstream feitas por terceiros, e reforça que "alinhamento robusto" precisa ser pensado também no nível dos parâmetros internos, não só no nível do prompt.