StraightDP reduz a perda de qualidade ao treinar modelos generativos com privacidade diferencial forte
StraightDP ataca o problema de perda abrupta de qualidade ao treinar modelos generativos condicionados a texto sob privacidade diferencial forte, explorando a geometria de rectified flows para gastar o orçamento de privacidade de forma mais inteligente. A técnica libera uma única vez estatísticas agregadas por classe e reserva o restante do orçamento para o treinamento detalhado, melhorando substancialmente a acurácia sob o mesmo nível de privacidade. Isso torna garantias formais de privacidade mais viáveis para pipelines de geração de imagem que hoje evitam usá-las por causa da perda de qualidade.
Pesquisadores (Xujun Che, Depeng Xu e Xintao Wu) atacaram o problema conhecido de 'penhasco de utilidade' que aparece ao treinar modelos generativos condicionados a texto — como os baseados em rectified flow, usados em diffusion — sob privacidade diferencial forte, regime em que o modelo tradicionalmente perde qualidade de forma abrupta.
A proposta explora a geometria do rectified flow, a interpolação reta entre ruído e dado, observando que, perto do lado do ruído, a velocidade ótima é dominada por poucos momentos condicionais de classe, enquanto perto do lado do dado a estrutura específica de cada amostra importa mais. O StraightDP gasta uma fatia pequena do orçamento de privacidade para liberar, uma única vez, esses momentos 'branqueados' por classe, que podem ser destilados nos pesos do modelo ou injetados durante a amostragem, e reserva o restante do orçamento para treinamento com privacidade diferencial convencional na parte da geração que realmente precisa de detalhe específico da amostra.
Isso importa porque a privacidade diferencial é hoje a principal defesa formal contra ataques de inferência de pertencimento e memorização em modelos generativos — evitar que o modelo vaze dados de treinamento identificáveis —, mas sua adoção prática esbarra exatamente nessa perda de utilidade sob orçamentos de privacidade realistas. Os resultados mostrados, como saltar de 0,21 para 0,81 de acurácia no MNIST sob o mesmo orçamento de privacidade mantendo qualidade de imagem, tornam a privacidade diferencial mais viável para quem hoje evita usá-la por causa da degradação de qualidade.
O fato de os momentos liberados funcionarem também para um modelo Stable Diffusion 3 já treinado, superando outra técnica de ajuste privado com muito menos orçamento, sugere aplicabilidade além de benchmarks acadêmicos como o MNIST. É uma melhoria de engenharia sobre uma técnica de privacidade já estabelecida, relevante para times que avaliam adicionar garantias formais de privacidade a pipelines de geração de imagem ou texto quando os dados de treinamento são sensíveis.