GhostPrompt cria ataque adversarial reutilizavel entre imagens diferentes contra modelos de visao-linguagem
O GhostPrompt introduz um prompt adversarial otimizado uma unica vez e reutilizavel em imagens diversas para forcar modelos de visao-linguagem a produzir respostas escolhidas pelo atacante, superando a limitacao de ataques anteriores que ficavam presos a uma imagem especifica. O metodo eleva a taxa de sucesso de ataque em mais de 30% sobre o estado da arte, reduzindo em cerca de 70% o tempo de computacao necessario.
A maioria dos ataques baseados em texto contra Modelos de Visao-Linguagem (VLMs) foi adaptada de metodos centrados em modelos de linguagem pura, nos quais a entrada visual permanece fixa durante a otimizacao do prompt adversarial. Isso produz prompts atrelados a uma imagem especifica, o que limita seu uso pratico: um atacante teria que reotimizar o ataque para cada nova imagem-alvo.
O GhostPrompt introduz a nocao de transferibilidade cross-image: um unico prompt adversarial, otimizado uma vez, que continua eficaz ao ser aplicado sobre imagens diferentes das usadas no treinamento do ataque. Tecnicamente, isso e alcancado por uma otimizacao conjunta que destila caracteristicas adversariais invariantes a imagem dentro do prompt, atraves de um processo de geracao de "pior caso": o metodo alterna entre construir condicoes visuais dificeis para o prompt atual e atualizar o prompt para que permaneca eficaz sob essas condicoes adversas, forcando a convergencia para um padrao textual que funciona independentemente do conteudo visual especifico.
Em experimentos com VLMs amplamente usados, o GhostPrompt superou o estado da arte anterior em mais de 30% de taxa de sucesso de ataque, ao mesmo tempo em que reduziu o tempo de computacao necessario em aproximadamente 70% -- uma combinacao que barateia significativamente o custo de montar um ataque em escala contra multiplas imagens-alvo. Na pratica, isso reduz a barreira para atacar aplicacoes que processam imagens de usuarios com um VLM (moderacao de conteudo, assistentes multimodais, sistemas de analise de documentos), porque um unico prompt adversarial reutilizavel elimina a necessidade de reotimizacao por imagem, tornando o ataque mais escalavel e mais dificil de mitigar com defesas pensadas para prompts atrelados a uma imagem unica.