olimposec.com
Radar / Notícias / OS-2026-155
panoramaNOTÍCIA2026-08-06 · 2 min de leitura
0

CASCADE usa predição conforme para detectar pares imagem-texto envenenados em modelos como o CLIP

Resumo executivo

Pesquisadores mostram que defesas de detecção de backdoor em aprendizado contrastivo multimodal, baseadas na métrica CLIPScore, falham porque a distribuição de scores de pares benignos e envenenados se sobrepõe significativamente. O framework proposto, CASCADE, usa predição conforme em duas etapas para gerar limites de confiança estatisticamente garantidos, alcançando falso-positivo médio de 5,79% com 100% de detecção verdadeira no dataset CC3M.

Modelos de aprendizado contrastivo multimodal, como o CLIP, são treinados sobre grandes volumes de pares imagem-legenda coletados da web, o que os torna vulneráveis a ataques de backdoor por envenenamento de dados: um atacante insere pares maliciosos no conjunto de treinamento de forma que o modelo aprenda uma associação escondida, ativada apenas por um gatilho específico. A defesa dominante até então usava o CLIPScore — a similaridade semântica entre imagem e legenda medida pelo próprio CLIP — partindo da premissa de que pares envenenados teriam similaridade mais baixa que pares legítimos.

O artigo identifica duas falhas nessa abordagem: a sobreposição substancial entre as distribuições de CLIPScore de pares benignos e envenenados torna a métrica pouco confiável isoladamente, e o uso de um limiar fixo de detecção não oferece nenhuma garantia estatística para amostras que caem justamente na região de sobreposição, onde a decisão é mais incerta. A resposta proposta, CASCADE, aplica predição conforme (conformal prediction) para transformar a decisão binária em um problema com garantias de confiança calibradas estatisticamente, em vez de depender de um corte arbitrário.

O método funciona em duas etapas: primeiro, uma fase grosseira usa consistência entre modalidades para identificar com alta confiança quais pares são claramente benignos ou claramente envenenados; depois, a fase fina constrói um conjunto de referência a partir dos pares envenenados de alta confiança e calcula scores de não-conformidade baseados em similaridade no espaço de texto para os pares ambíguos restantes, permitindo classificá-los com base em quão bem se encaixam na distribuição de padrões de envenenamento já identificados.

Os resultados no dataset CC3M — AUROC médio de 0,9867 e taxa de falso-positivo de 5,79% mantendo 100% de detecção verdadeira, inclusive contra ataques adaptativos — indicam um ganho prático relevante para pipelines de treinamento que dependem de dados coletados da web sem curadoria manual completa, um cenário comum em treinamento de modelos multimodais em escala. Para equipes que mantêm pipelines de pré-treinamento com dados de origem não totalmente confiável, esse tipo de defesa complementa (não substitui) a necessidade de proveniência e controle de acesso sobre as fontes de dados de treinamento.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.