Falha em objetos de raciocínio criptografado permite que modelo de IA mais fraco decodifique o raciocínio de um modelo mais forte
Pesquisadores demonstraram que os blocos de raciocínio oculto usados pelas APIs de reasoning da OpenAI, Anthropic e Google podiam ser reaproveitados entre sessões, usuários e até modelos diferentes, e que um modelo menor bastava para transcrever o conteúdo de um modelo maior. A técnica recuperou centenas de segredos reais — chaves de API, senhas e tokens — que apareciam apenas no raciocínio oculto, nunca no texto visível, tornando a sanitização de logs tradicional insuficiente.
Fonte ↗