olimposec.com
tema

#modelos-abertos

1 publicação marcada com esta tag.

panoramaOS-2026-226 · 2026-08-13
0

Técnica "self-feeding" detecta backdoors em LLMs de peso aberto realimentando a própria saída do modelo

Pesquisadores propõem um teste de caixa-preta barato para checar se um LLM baixado de um repositório público esconde um backdoor: alimentar repetidamente a própria saída do modelo de volta como entrada, deixando o texto derivar até tocar nos dados usados no fine-tuning malicioso. A técnica encontrou backdoors em cinco de seis modelos testados com 92% de precisão agregada, contra apenas um acerto em 120 tentativas de um baseline que repete o mesmo prompt.

Fonte ↗