OpenAI automatiza red-teaming de prompt injection com o GPT-Red para blindar o GPT-5.6 Sol
A OpenAI divulgou o GPT-Red, um modelo interno treinado especificamente para atacar outros modelos com prompt injection em larga escala, usado para gerar dados de treinamento adversarial antes do lançamento do GPT-5.6 Sol. Segundo a empresa, a integração do GPT-Red ao pipeline de treinamento reduziu drasticamente a taxa de sucesso de ataques de injeção direta e de fake chain-of-thought em relação a modelos anteriores.
A OpenAI descreveu publicamente o GPT-Red, um "red-teamer" automatizado usado internamente para descobrir vulnerabilidades de prompt injection antes que os modelos cheguem a produção, revelando que o integrou diretamente ao processo de treinamento do GPT-5.6 Sol.
O sistema funciona por self-play com aprendizado por reforço: um modelo de ataque e modelos defensores treinam simultaneamente, com o atacante recompensado por eliciar falhas válidas e os defensores recompensados por resistir aos ataques sem perder a capacidade de completar a tarefa original do usuário. Esse desenho cria uma corrida armamentista controlada, em que o modelo defensor é forçado a generalizar contra ataques cada vez mais sofisticados, em vez de simplesmente memorizar um conjunto fixo de payloads conhecidos.
A OpenAI reporta números expressivos: seis vezes menos falhas contra injeção direta em comparação ao GPT-5.5, taxa de sucesso abaixo de 10% em ataques de "fake chain-of-thought" (ante mais de 95% observados no GPT-5.1) e mais de 97% de acurácia em benchmarks de injeção indireta, cobrindo cenários como exfiltração de dados, desativação de autenticação em dois fatores e execução de scripts maliciosos.
O caso ilustra bem a corrida entre ataque e defesa em segurança de IA: a mesma técnica de geração automática de ataques adversariais usada para fortalecer um modelo pode, em princípio, ser replicada por terceiros para atacar modelos concorrentes. Vale também notar que métricas como "0,05% de falha" vêm de benchmarks internos da própria fabricante, o que pede cautela até que resultados equivalentes sejam reproduzidos por avaliação independente.