olimposec.com
tema

#self-play

1 publicação marcada com esta tag.

panoramaOS-2026-109 · 2026-07-30
0

GPT-Red: agente de IA treinado para descobrir sozinho novos ataques de prompt injection em escala

Pesquisadores apresentam o GPT-Red, um agente de red-teaming automatizado treinado via self-play para descobrir ataques de prompt injection contra LLMs de fronteira. O sistema foi usado para treinar adversarialmente o GPT-5.6, tornando-o mais robusto a esse tipo de ataque. Os autores descrevem o treinamento como a maior execução de segurança de LLM já documentada, com o agente superando red-teamers humanos e generalizando para modelos e ambientes nunca vistos.

Fonte ↗