Confiança de modelos de visão-linguagem se mostra manipulável mesmo sem alterar a resposta gerada
Um estudo com quatro modelos de visão-linguagem, três benchmarks de VQA e cinco canais de confiança mostra que atacantes em caixa-branca conseguem manipular o escore de confiança reportado por um modelo sem alterar a resposta final gerada, byte a byte. Em uma simulação com bloqueio por confiança, um ataque coordenado transferido para um mecanismo de corte baseado em estado oculto fez até 84,8% das respostas incorretas antes rejeitadas passarem a ser aceitas, levando os autores a concluir que confiança é um sinal 'sensível à integridade' e não robusto por natureza.
Fonte ↗