GPT-Red: agente de IA treinado para descobrir sozinho novos ataques de prompt injection em escala
Pesquisadores apresentam o GPT-Red, um agente de red-teaming automatizado treinado via self-play para descobrir ataques de prompt injection contra LLMs de fronteira. O sistema foi usado para treinar adversarialmente o GPT-5.6, tornando-o mais robusto a esse tipo de ataque. Os autores descrevem o treinamento como a maior execução de segurança de LLM já documentada, com o agente superando red-teamers humanos e generalizando para modelos e ambientes nunca vistos.
Fonte ↗