olimposec.com
Radar / Bugs / OS-2026-273
risco altoBUG2026-08-21 · 2 min de leitura
0

Segredos no contexto vazam em respostas normais de LLMs, mesmo sem pedido direto de extração

Resumo executivo

Pesquisadores demonstraram que a simples presença de dados sensíveis (como números de cartão ou de seguridade social) no contexto de um LLM introduz correlações ocultas em respostas completamente benignas do modelo, permitindo reconstruir esses dados mesmo quando o modelo se recusa corretamente a repassá-los se pedido diretamente. Em oito modelos proprietários testados, segredos de 2 dígitos foram reconstruídos com precisão quase perfeita e segredos de 4 dígitos com 82% de acerto exato, e um adversário treinado com RL conseguiu extrair números completos de seguridade social de um agente em estilo de produção.

Agentes de IA úteis para além do bate-papo simples precisam manter no contexto dados sensíveis do usuário — calendários, credenciais, registros de saúde, dados financeiros. A pergunta que este trabalho investiga é incômoda: será que a mera presença desses segredos no contexto do modelo já introduz um vazamento, mesmo quando o modelo nunca é explicitamente instruído a repeti-los, e mesmo quando ele recusa corretamente qualquer pedido direto de extração?

A resposta é sim, e o mecanismo é sutil: as saídas benignas do modelo carregam correlações estatísticas com o conteúdo do contexto, e essas correlações bastam para reconstruir o segredo com um ataque adaptativo de caixa-preta (isto é, sem acesso aos pesos ou logits internos do modelo, só às respostas de texto normais). Os autores também mostram que um atacante pode ir além de apenas observar esse vazamento passivo: é possível construir prompts ativamente desenhados para amplificar o efeito, transformando o modelo em um "carregador encoberto" que transmite o segredo embutido em texto aparentemente inocente.

Os números validam a preocupação: em oito modelos proprietários testados, segredos de 2 dígitos no contexto foram reconstruídos com precisão quase perfeita, e segredos de 4 dígitos com 82% de acerto exato — tudo a partir de respostas geradas para pedidos comuns, não-adversariais. Um achado particularmente contraintuitivo: modelos mais capazes vazam mais, porque um seguimento de instruções mais forte amplifica a sensibilidade do modelo ao conteúdo do contexto — ou seja, o vazamento parece ser um subproduto da própria capacidade do modelo, e não um bug isolado e facilmente corrigível com um patch pontual.

Os autores demonstram dois ataques práticos construídos sobre esse efeito: um classificador treinado que infere predicados semânticos sobre a memória do usuário (por exemplo, condições de saúde ou eventos financeiros) a partir de saídas de texto rotineiras, e um adversário treinado por reforço que extrai números completos de Seguridade Social de um agente em estilo de produção. Para quem projeta agentes de IA que retêm contexto sensível entre interações — um padrão cada vez mais comum —, isso implica que "o modelo se recusa quando perguntado diretamente" não é garantia suficiente de que os dados estão protegidos.

Fonte ↗
0 comentários

Entre para comentar.

Nenhum comentário ainda — seja o primeiro.