Mask2Shield tenta blindar LLMs contra ataques que podam neurônios responsáveis pela recusa de conteúdo nocivo
Pesquisadores mostram que o comportamento de recusa de LLMs alinhados costuma depender de um pequeno conjunto de neurônios que, se removidos por poda (pruning), eliminam a segurança do modelo sem destruir sua capacidade geral. Em resposta, propõem o Mask2Shield, um método de treinamento que força o modelo a manter a recusa mesmo quando esses neurônios são artificialmente desativados durante o treino.
Fonte ↗