olimposec.com
tema

#unlearning

1 publicação marcada com esta tag.

panoramaOS-2026-225 · 2026-08-13
0

Instalar um backdoor conhecido para depois removê-lo ajuda a limpar backdoors desconhecidos em agentes LLM

Pesquisadores testaram a estratégia de "envenenamento defensivo": instalar deliberadamente um backdoor conhecido num agente LLM comprometido e depois desaprendê-lo, na esperança de que o backdoor original oculto seja removido como efeito colateral. Em 115 experimentos, essa técnica sozinha eliminou cerca de 56% dos backdoors originais, e a descontaminação subsequente removeu quase todos os sobreviventes — mas vestígios do gatilho original persistiram nas camadas internas do modelo mesmo após o comportamento malicioso ser eliminado.

Fonte ↗