LoRAScan detecta prompts de backdoor em adaptadores LoRA analisando picos de ativação, sem alterar o modelo
LoRAScan explora o fato de que, em adaptadores LoRA comprometidos, cerca de 5% dos pontos de inserção permanecem estáveis em entradas limpas mas disparam picos de ativação na camada de down-projection quando um gatilho de backdoor está presente. Monitorando esses pontos em tempo de inferência, sem modificar os pesos do adaptador, o método rejeita cerca de 98,5% das entradas maliciosas com baixa taxa de erro em entradas legítimas, superando defesas anteriores que diluem o sinal de backdoor ao mesclar o adaptador ao modelo base ou apenas sinalizam o adaptador inteiro como suspeito.
Fonte ↗