olimposec.com
Radar / Bugs / OS-2026-222
risco altoBUG2026-08-12 · 2 min de leitura
0

Falha em objetos de raciocínio criptografado permite que modelo de IA mais fraco decodifique o raciocínio de um modelo mais forte

Resumo executivo

Pesquisadores demonstraram que os blocos de raciocínio oculto usados pelas APIs de reasoning da OpenAI, Anthropic e Google podiam ser reaproveitados entre sessões, usuários e até modelos diferentes, e que um modelo menor bastava para transcrever o conteúdo de um modelo maior. A técnica recuperou centenas de segredos reais — chaves de API, senhas e tokens — que apareciam apenas no raciocínio oculto, nunca no texto visível, tornando a sanitização de logs tradicional insuficiente.

O problema não estava na criptografia dos blocos de raciocínio em si, mas na ausência de amarração de contexto: um objeto criptografado gerado numa sessão podia ser reproduzido em outra sessão, com outro usuário, e até processado por um modelo diferente do que o gerou. Isso porque os provedores tratam esses blocos como opacos e os aceitam sem validar se pertencem à conversa corrente, o que abre uma superfície de replay que normalmente não existiria em texto plano visível.

A parte mais interessante da pesquisa é o método de exploração: em vez de tentar quebrar a criptografia, os pesquisadores usaram um segundo modelo, mais barato e mais fraco, como "decodificador difuso" — pedindo a ele que tentasse transcrever o conteúdo de um bloco de raciocínio de um modelo mais forte. A técnica funcionou de forma cruzada entre famílias de modelo, o que sugere que o raciocínio oculto vaza estrutura semântica reconhecível por modelos menores mesmo sob criptografia, algo que a defesa em profundidade dessas APIs não previa.

O impacto prático foi medido em uma amostra de milhares de trajetórias públicas de agentes, onde centenas de artefatos sensíveis genuínos — chaves de API, senhas, tokens de acesso e chaves privadas — foram recuperados. O dado mais preocupante é que uma fração relevante desses segredos aparecia exclusivamente no raciocínio oculto e não no texto de saída visível ao usuário, o que significa que pipelines de log scrubbing focados apenas na resposta final do modelo deixam esses segredos expostos sem que ninguém perceba.

Os pesquisadores afirmam que o ataque principal já não é mais reproduzível após mitigações dos provedores, mas nenhuma empresa confirmou publicamente a correção nem detalhou o que mudou. Para quem opera agentes de IA em produção, o caso é um lembrete de que "raciocínio oculto" não deve ser tratado como equivalente a "dado descartável": se ele carrega segredos operacionais durante a execução de uma tarefa, precisa do mesmo tratamento de dado sensível que qualquer outro artefato de log, incluindo escopo de sessão estrito e não apenas criptografia em trânsito.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.