CASCADE usa predição conforme para detectar pares imagem-texto envenenados em modelos como o CLIP
Pesquisadores mostram que defesas de detecção de backdoor em aprendizado contrastivo multimodal, baseadas na métrica CLIPScore, falham porque a distribuição de scores de pares benignos e envenenados se sobrepõe significativamente. O framework proposto, CASCADE, usa predição conforme em duas etapas para gerar limites de confiança estatisticamente garantidos, alcançando falso-positivo médio de 5,79% com 100% de detecção verdadeira no dataset CC3M.
Fonte ↗