olimposec.com
tema

#ataque-de-caixa-preta

1 publicação marcada com esta tag.

risco médioOS-2026-253 · 2026-08-19
0

Fair-ASR reavalia jailbreaks de LLM sob orçamento igual de tentativas e expõe ataque barato com 85% de sucesso no GPT-5

O estudo Fair-ASR mostra que comparações de eficácia entre ataques de jailbreak são enganosas quando não controlam o número de consultas usadas contra o alvo, e que, sob orçamento igual, técnicas simples continuam competitivas com métodos elaborados guiados por LLM. Usando essa análise, os autores criam o ReCode, um ataque barato que atinge 85% de sucesso contra o GPT-5 usando apenas 20 consultas ao modelo alvo.

Fonte ↗