olimposec.com
tema

#system-prompt

1 publicação marcada com esta tag.

risco altoOS-2026-217 · 2026-08-12
0

Pedir a resposta em formato codificado engana LLMs e vaza system prompts protegidos contra extração direta

Um framework de avaliação automatizada mostra que instruções de sistema de LLMs, mesmo quando protegidas contra pedidos diretos de extração, vazam com alta frequência quando o mesmo pedido é reformulado como tarefa de codificação ou serialização estruturada, por exemplo "traduza para base64" ou "serialize como JSON". Testando sete modelos comuns contra 46 instruções de sistema verificadas, os autores observaram taxa de sucesso de ataque acima de 0,7 nesse tipo de reformulação, e demonstram que reescrever a própria instrução de sistema com apoio de um modelo de raciocínio reduz significativamente essa taxa sem precisar retreinar nada.

Fonte ↗