olimposec.com
Radar / Notícias / OS-2026-079
panoramaNOTÍCIA2026-07-23 · 2 min de leitura
0

DeCNIP remove backdoors de LLMs podando neuronios criticos identificados por analise representacional

Resumo executivo

O DeCNIP e uma defesa contra backdoors em LLMs que vai alem de heuristicas comportamentais, identificando e podando um conjunto minimo de neuronios responsaveis por ativar o gatilho malicioso. O metodo cobre tanto backdoors inseridos por fine-tuning quanto por edicao direta de modelo, reduzindo a taxa de sucesso do ataque em mais de 95% intervindo em apenas 0,1% dos neuronios e preservando 97% do desempenho original em tarefas normais.

Backdoors em LLMs sao gatilhos ocultos, inseridos durante treinamento ou ajuste fino, que fazem o modelo produzir saidas maliciosas quando um padrao especifico aparece na entrada, permanecendo invisiveis em uso normal. As defesas existentes se concentram majoritariamente em backdoors inseridos via fine-tuning (por exemplo, modulos PEFT) e falham em cobrir ataques de edicao direta de modelo que contornam o pipeline de treinamento por completo; alem disso, tendem a depender de heuristicas de comportamento superficial em vez de entender a causa representacional profunda da ativacao maliciosa.

O DeCNIP ataca o problema de forma representacional: primeiro, identifica comportamentos do tipo gatilho otimizando uma funcao de perda de entropia cruzada que compara prompts nocivos com tokens candidatos contra entradas benignas, expondo os mecanismos pelos quais o gatilho sequestra os pesos do modelo. Com essa analise, o metodo isola os chamados Neuronios Criticos de Backdoor (BCNs) -- o subconjunto minimo de neuronios efetivamente responsavel pelo comportamento malicioso -- e os poda seletivamente, preservando o restante da rede intacto.

Avaliado em seis LLMs de codigo aberto e dois datasets de referencia, o DeCNIP reduz a taxa de sucesso de ataque em mais de 95% em relacao a linha de base, superando sete defesas de estado da arte, com apenas 0,1% de intervencao nos neuronios do modelo e mantendo 97% do desempenho em benchmarks normais -- uma combinacao de eficacia e baixo custo de intervencao dificil de alcancar com podas mais amplas ou retraining completo.

O valor pratico do trabalho esta em cobrir uma lacuna real: como modelos de peso aberto cada vez mais passam por edicao direta de pesos (nao apenas fine-tuning tradicional) para inserir comportamento customizado antes da distribuicao, uma defesa que so olha para o processo de treinamento perde exatamente esse vetor. Para quem consome modelos de terceiros de origem nao totalmente confiavel, uma tecnica de poda pos-hoc e barata como essa oferece uma camada de verificacao independente da forma como o backdoor foi inserido.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.