olimposec.com
Radar / Notícias / OS-2026-194
risco médioNOTÍCIA2026-08-11 · 2 min de leitura
0

Primeiro ataque adversarial black-box contra modelo de OCR generativo expõe falhas de decodificação

Resumo executivo

Pesquisadores apresentam o que descrevem como o primeiro ataque adversarial totalmente black-box contra um modelo de OCR generativo (baseado no Deep-OCR/DeepSeek-OCR), atuando apenas a partir da string de saída, sem acesso a gradientes ou logits. Perturbações imperceptíveis na imagem, otimizadas via estimativa de gradiente por diferenças finitas, foram suficientes para causar repetição, truncamento e vazamento de instruções internas do decodificador.

O alvo do ataque é uma classe de sistemas de OCR que tratam a imagem do documento como um meio de compressão óptica de contexto — uma abordagem mais eficiente em tokens, mas que os autores argumentam introduzir uma superfície de ataque nova, pouco explorada até aqui em comparação com modelos de visão-linguagem convencionais.

O diferencial técnico é operar em regime estritamente black-box: o atacante só observa a string decodificada final, sem qualquer acesso a gradientes, logits ou pesos do modelo. Os autores reformulam o ataque como um problema de otimização de ordem zero, definindo uma função de perda escalar baseada em similaridade entre sequências de texto, e estimam o gradiente com um esquema de diferenças finitas em direção aleatória cujo custo de consultas independe da dimensão da imagem — tornando o ataque praticável mesmo sem informação interna do modelo. Uma atualização estilo Adam com projeção em norma L-infinito produz perturbações visualmente imperceptíveis.

Os experimentos-piloto, ainda que preliminares, já expõem falhas de decodificador consideradas severas: repetição de blocos de texto, truncamento de saída e vazamento de instruções de prompt que não deveriam aparecer na resposta. Os autores são cautelosos quanto a reescrita direcionada (fazer o modelo produzir um texto específico e não apenas degradar a leitura), afirmando que esse objetivo é substancialmente mais difícil e evitando alegar sucesso até a conclusão de uma avaliação pré-registrada.

O resultado importa porque sistemas de OCR baseados em modelos generativos estão sendo adotados como componente de pipelines de ingestão de documentos (contratos, notas fiscais, formulários) alimentando diretamente outros sistemas de IA — um documento malicioso capaz de induzir truncamento ou vazamento de prompt em silêncio é um vetor de ataque à integridade de todo o pipeline downstream, não apenas um problema de reconhecimento de caracteres.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.