olimposec.com
tema

#alinhamento-de-seguranca

1 publicação marcada com esta tag.

risco médioOS-2026-298 · 2026-08-26
0

NeuronGuard redistribui 'sinais de segurança' entre neurônios para blindar LLMs contra jailbreak e poda maliciosa

Nova defesa aplicada na fase de fine-tuning espalha a informação de recusa de segurança por um conjunto mais amplo de neurônios de um LLM, em vez de concentrá-la em poucos neurônios críticos, reduzindo a taxas de sucesso de jailbreaks textuais e de ataques que podam neurônios após o deploy para perto de zero, mantendo a utilidade do modelo.

Fonte ↗