HijackKV sequestra cache KV de LLMs para injetar contexto malicioso invisivel na entrada
Pesquisadores demonstram o HijackKV, um ataque contra sistemas de reuso de cache KV independente de posicao -- uma otimizacao de inferencia cada vez mais comum em servicos de LLM -- que permite a um atacante contaminar o cache de um trecho de texto aparentemente benigno para que ele carregue, de forma invisivel, um objetivo controlado pelo atacante. Quando esse cache e reaproveitado pela vitima, o modelo tem seu comportamento sequestrado mesmo sem nenhum texto malicioso visivel na propria entrada, com taxa media de sucesso de 94% em uma unica tentativa.
Caches Key-Value (KV) reduzem a latencia de inferencia em LLMs evitando recomputar a representacao de trechos de texto ja processados. O reuso tradicional, baseado em prefixo, exige correspondencia exata de token e posicao, o que limita a taxa de acerto do cache entre requisicoes diferentes. Para melhorar eficiencia, otimizacoes de sistema mais recentes introduziram reuso de KV independente de posicao, permitindo reaproveitar o cache sempre que um trecho de texto identico aparecer, independentemente de onde ele esteja na sequencia.
O problema, demonstrado pelos autores, e que o cache KV e recuperado por correspondencia de token, mas codifica o contexto completo em que foi originalmente computado -- ou seja, o KV associado a um trecho de texto que parece benigno pode, na verdade, carregar embutida a influencia de um prefixo malicioso usado na primeira vez em que aquele trecho foi processado. O HijackKV otimiza esse prefixo controlado pelo atacante de forma que o KV computado para um texto comum e benigno subsequente passe a codificar o objetivo do atacante, enquanto o texto em si permanece inalterado e continua batendo com futuras buscas de cache. Quando uma vitima depois processa esse mesmo trecho de texto "benigno", ela reutiliza silenciosamente o cache contaminado, e o modelo tem seu comportamento sequestrado sem que nenhum conteudo malicioso apareca na entrada que a vitima de fato enviou.
Os numeros reportados sao expressivos: 94% de sucesso medio em tentativa unica, mantendo eficacia mesmo sob condicoes realistas de taxa de acerto de cache baixa (10%) e recomputacao frequente (50%), persistindo ao longo de interacoes multi-turno e transferindo entre modelos diferentes em cenarios black-box.
Na pratica, esse ataque expoe um trade-off pouco discutido entre eficiencia de inferencia e isolamento de contexto: otimizacoes de cache pensadas para reduzir custo e latencia introduzem, como efeito colateral, um canal encoberto atraves do qual conteudo processado por um usuario pode contaminar a inferencia de outro usuario completamente diferente, caso ambos compartilhem a mesma infraestrutura de cache KV. Isso e particularmente relevante para provedores de inferencia multi-tenant que adotaram reuso de cache independente de posicao para reduzir custo, e sugere que o design desses sistemas precisa considerar isolamento de contexto como requisito de seguranca, nao apenas de performance.