olimposec.com
tema

#oversight

1 publicação marcada com esta tag.

risco médioOS-2026-183 · 2026-08-10
0

Confiança de modelos de visão-linguagem se mostra manipulável mesmo sem alterar a resposta gerada

Um estudo com quatro modelos de visão-linguagem, três benchmarks de VQA e cinco canais de confiança mostra que atacantes em caixa-branca conseguem manipular o escore de confiança reportado por um modelo sem alterar a resposta final gerada, byte a byte. Em uma simulação com bloqueio por confiança, um ataque coordenado transferido para um mecanismo de corte baseado em estado oculto fez até 84,8% das respostas incorretas antes rejeitadas passarem a ser aceitas, levando os autores a concluir que confiança é um sinal 'sensível à integridade' e não robusto por natureza.

Fonte ↗