NeuronGuard redistribui 'sinais de segurança' entre neurônios para blindar LLMs contra jailbreak e poda maliciosa
Nova defesa aplicada na fase de fine-tuning espalha a informação de recusa de segurança por um conjunto mais amplo de neurônios de um LLM, em vez de concentrá-la em poucos neurônios críticos, reduzindo a taxas de sucesso de jailbreaks textuais e de ataques que podam neurônios após o deploy para perto de zero, mantendo a utilidade do modelo.
Fonte ↗