ARIA automatiza a criação de backdoors furtivos em instruções de LLMs personalizados para geração de código
Pesquisadores apresentam o ARIA, um framework de red teaming automatizado que usa um LLM atacante para gerar e refinar instruções com backdoor contra plataformas de personalização de LLM que operam só por system prompt, sem alterar os pesos do modelo. O ataque atingiu 94,5% de taxa de sucesso preservando a utilidade da tarefa original, além de evadir quase totalmente mecanismos de detecção do lado da plataforma e do usuário, com taxa de falso negativo chegando a 1,0.
Fonte ↗