DeepInvert quebra defesas de ofuscação de prompt em serviços de LLM na nuvem, recuperando até 73,5% dos tokens originais
Serviços de LLM em nuvem processam rotineiramente prompts sensíveis, e defesas de ofuscação como ObfusLM, SentinelLMs, TextObfuscator e DPNR prometem mitigar esse risco transformando a representação do prompt antes do envio. O DeepInvert, um ataque de inversão de embeddings semi-supervisionado, mostra que essa proteção é muito mais frágil do que se acreditava, recuperando 73,5% dos tokens originais contra o ObfusLM, ante 26,2% do melhor ataque anterior.
Fonte ↗