olimposec.com
Radar / Bugs / OS-2026-091
risco médioBUG2026-07-27 · 2 min de leitura
0

Sufixos de prompt adversariais conseguem quebrar a aceleração de speculative decoding em LLMs

Resumo executivo

Pesquisadores demonstram o ADSD, o primeiro ataque de sufixo de prompt capaz de colapsar a taxa de aceitação do verificador em speculative decoding, técnica amplamente usada para acelerar a inferência de LLMs sem perda de qualidade. No dataset GSM8K, o ataque aumentou o tempo médio de amostragem em 62,3% mantendo a qualidade da resposta, e o efeito se mostrou consistente em diferentes domínios, estratégias de decodificação especulativa e arquiteturas de modelo.

Speculative decoding acelera a geração de texto usando um modelo “rascunho” menor para propor vários tokens de uma vez, que depois são validados em lote pelo modelo alvo maior; tokens aceitos economizam passagens completas pelo modelo grande, e a garantia teórica é que a saída final é estatisticamente equivalente à do modelo alvo rodando sozinho. O trabalho mostra que essa garantia de equivalência esconde uma superfície de ataque: o alinhamento entre o modelo rascunho e o modelo alvo, do qual depende toda a aceleração, pode ser deliberadamente atacado através do próprio prompt de entrada.

O ataque, batizado ADSD, usa uma função substituta chamada Soft-Collapse, derivada diretamente da regra assimétrica de aceitação usada em speculative decoding, para encontrar sufixos de prompt que empurram a distribuição de probabilidade do modelo rascunho para tokens que o modelo alvo dificilmente aceitaria. Um objetivo adicional de preservação do alvo evita que o ataque corrompa a tarefa de forma óbvia — ou seja, a resposta final continua parecendo normal e correta, mas a velocidade de geração despenca porque quase todo token proposto pelo rascunho é rejeitado e precisa ser recalculado do zero pelo modelo grande.

Os resultados no GSM8K mostram um aumento de 62,3% no tempo médio de amostragem, com a qualidade da tarefa preservada — ou seja, um atacante consegue degradar a performance de um serviço de inferência sem que isso apareça como uma resposta obviamente errada ou recusada, o que dificulta a detecção por meios convencionais de monitoramento de qualidade. Os autores ainda mostram que a vulnerabilidade generaliza entre diferentes domínios de tarefa, diferentes variantes do algoritmo de speculative decoding e diferentes arquiteturas de modelo, sugerindo um problema estrutural da técnica e não uma falha de implementação isolada.

Na prática, isso configura um vetor de negação de serviço econômico contra provedores de inferência de LLM: como speculative decoding é adotado justamente para reduzir custo computacional por token, um prompt malicioso capaz de anular esse ganho pode ser usado para inflar custos de infraestrutura ou degradar latência de um serviço multiusuário sem disparar alarmes de conteúdo impróprio, já que a resposta gerada continua sendo textualmente aceitável.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.