olimposec.com
tema

#vlm

2 publicações marcadas com esta tag.

risco médioOS-2026-112 · 2026-07-30
0

Guards de modelos de visão-linguagem ainda falham contra jailbreaks codificados, mesmo com defesa amplificada

Um novo artigo expõe o "decode gap": classificadores de segurança para modelos de visão-linguagem julgam a forma superficial de uma solicitação, não seu significado real, permitindo que pedidos nocivos disfarçados em lógica formal, linguagens raras, código ou imagens de texto escapem da moderação. Os autores propõem um amplificador que tenta neutralizar esse desvio antes do guard atuar, mas mostram que mesmo a melhor combinação ainda deixa 63-65% dos ataques passarem, e o remédio para isso dispara recusas indevidas em pedidos legítimos.

Fonte ↗
risco médioOS-2026-077 · 2026-07-23
0

GhostPrompt cria ataque adversarial reutilizavel entre imagens diferentes contra modelos de visao-linguagem

O GhostPrompt introduz um prompt adversarial otimizado uma unica vez e reutilizavel em imagens diversas para forcar modelos de visao-linguagem a produzir respostas escolhidas pelo atacante, superando a limitacao de ataques anteriores que ficavam presos a uma imagem especifica. O metodo eleva a taxa de sucesso de ataque em mais de 30% sobre o estado da arte, reduzindo em cerca de 70% o tempo de computacao necessario.

Fonte ↗