olimposec.com
Radar / Notícias / OS-2026-277
risco médioNOTÍCIA2026-08-24 · 2 min de leitura
0

Estudo com mais de 120 LLMs revela que segurança, privacidade e alinhamento competem entre si

Resumo executivo

O aiXamine é uma plataforma de avaliação black-box que testa simultaneamente segurança, privacidade e alinhamento de segurança em LLMs, rodando 46 testes automatizados de red-teaming por modelo. Em mais de 5.000 execuções contra 120+ modelos, os autores encontraram uma 'taxa de segurança' (mais alinhamento gera mais recusas indevidas), privacidade quase independente das demais dimensões, e um colapso catastrófico de robustez em modelos destilados sem correção on-policy.

Até hoje, avaliações de segurança, privacidade e alinhamento de LLMs costumam ser feitas em silos: um time mede taxa de recusa a pedidos maliciosos, outro mede vazamento de dados pessoais, outro mede robustez a jailbreak, e raramente alguém cruza esses resultados. O aiXamine ataca esse problema construindo uma bateria de 46 testes distribuídos em nove serviços de avaliação, aplicada de forma uniforme a mais de 120 modelos proprietários e abertos, totalizando mais de 5.000 execuções — hoje o maior estudo conjunto dessas três dimensões.

Tecnicamente, a plataforma opera como um pipeline de red-teaming automatizado que gera prompts adversariais e legítimos, mede a resposta do modelo em cada dimensão e cruza os resultados em perfis de risco hierárquicos, do nível de prompt individual até comparações entre serviços. O achado mais citável é a 'taxa de segurança' (safety tax): um modelo pode atingir 99,3 de pontuação em alinhamento de segurança e ainda assim recusar cerca de um terço de pedidos totalmente benignos, evidenciando que meter mais filtros de recusa não é gratuito — ele degrada utilidade real. Outro achado é que privacidade é quase ortogonal às demais métricas de confiabilidade, ou seja, um modelo pode ser 'seguro' contra jailbreak e ainda vazar dados sensíveis, porque os mecanismos de alinhamento padrão simplesmente não cobrem esse eixo.

O achado mais preocupante para quem constrói produtos com modelos destilados é o chamado 'colapso de robustez induzido por destilação': quando um modelo menor é destilado a partir de um maior sem correção on-policy, a robustez a ataques pode desabar de 56,9 para 2,6 na mesma arquitetura base — uma queda de mais de 20x que não aparece em benchmarks de capacidade convencionais, só em testes adversariais dedicados.

Para equipes que avaliam ou compram modelos para uso em produção, a lição prática é que benchmarks de segurança isolados escondem trade-offs reais: otimizar para uma métrica (recusa, privacidade, robustez) pode ativamente piorar outra, especialmente após pipelines de destilação usados para reduzir custo de inferência. Isso reforça a necessidade de avaliação multi-dimensional antes de promover um modelo destilado para produção, não apenas checar se ele 'passou' em um único critério de segurança.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.