olimposec.com
tema

#mllm

2 publicações marcadas com esta tag.

risco médioOS-2026-302 · 2026-08-26
0

RACER remove backdoors de modelos multimodais usando apenas 100 amostras limpas

Framework de reparo identifica uma "anomalia de inconsistência entre camadas" causada por gatilhos de backdoor em regiões específicas dos tokens visuais ou textuais de um MLLM, e usa esse sinal para gerar um ajuste fino adversarial que elimina o comportamento malicioso sem precisar saber qual é o gatilho.

Fonte ↗
panoramaOS-2026-251 · 2026-08-19
0

COMIC propõe filtro de segurança multimodal que avalia o alvo visual real de um pedido, não só o texto

Pesquisadores mostram que muitos jailbreaks multimodais não têm conteúdo nocivo nem no texto nem na imagem isoladamente: o dano só surge quando o modelo associa uma instrução aparentemente inofensiva a uma região específica da imagem. O filtro COMIC resolve isso identificando primeiro qual operação e qual alvo visual estão sendo referenciados, e só então avalia a segurança desse par operação-alvo, superando defesas que julgam o par texto-imagem como um todo.

Fonte ↗