RoguePrompt combina cifras Vigenère e ROT13 para furar filtros de moderação de LLMs em até 94% dos casos
Pesquisadores apresentam o RoguePrompt, um pipeline de jailbreak que fragmenta um pedido proibido e aplica duas cifras clássicas em camada — Vigenère seguida de ROT13 — junto com instruções em linguagem natural para o próprio modelo reconstruir e executar o conteúdo original. Testado às cegas (apenas via API/interface) contra 313 prompts já bloqueados por moderação, o método furou os filtros em 93,9% dos casos, embora a reconstrução completa e a execução final do pedido tenham sucesso menor (79% e 70%, respectivamente). O resultado mostra que a maior fraqueza hoje está na moderação de entrada, não na capacidade do modelo de resistir ao pedido depois de decodificado.
Fonte ↗