Certificação criptográfica de modelos de IA pode ser enganada: 99% de acurácia na auditoria, menos de 30% na vida real
Pesquisadores mostram que protocolos de certificação criptográfica de modelos (CMC), que usam provas de conhecimento zero para permitir que auditores avaliem um modelo de IA sem acessar seus dados ou pesos, podem ser enganados por um provedor de modelo mal-intencionado. Engenheirando cuidadosamente os dados de treinamento, um atacante consegue certificar mais de 99% de acurácia no conjunto de auditoria fixo, enquanto o modelo real atinge menos de 30% em amostras novas da mesma distribuição.
Fonte ↗