Técnica "self-feeding" detecta backdoors em LLMs de peso aberto realimentando a própria saída do modelo
Pesquisadores propõem um teste de caixa-preta barato para checar se um LLM baixado de um repositório público esconde um backdoor: alimentar repetidamente a própria saída do modelo de volta como entrada, deixando o texto derivar até tocar nos dados usados no fine-tuning malicioso. A técnica encontrou backdoors em cinco de seis modelos testados com 92% de precisão agregada, contra apenas um acerto em 120 tentativas de um baseline que repete o mesmo prompt.
Fonte ↗