CPInj expõe injeção de prompt em otimização colaborativa de prompts e mostra que as defesas atuais não seguram o ataque
A Otimização Colaborativa Textual de Prompts (TCPO) deixa múltiplos clientes aprimorarem prompts de LLM de forma descentralizada, mantendo seus dados locais, mas o texto livre trocado nesse processo cria uma superfície de ataque nova. O CPInj mostra que um cliente malicioso consegue contaminar o prompt global agregado de forma que a instrução maliciosa sobrevive à agregação no servidor, resiste à otimização subsequente feita por clientes benignos e evade defesas de detecção, degradando o desempenho de todos os outros participantes.
Fonte ↗