OpenAI pausa atividades internas com o modelo Astra após avaliação não descartar capacidade 'crítica' de ciberataque autônomo
A OpenAI suspendeu atividades internas envolvendo seu próximo modelo, codinome Astra, depois que avaliações mostraram desempenho forte o bastante em codificação agente e ciberataque para não descartar que o modelo tenha atingido o nível 'Crítico' do seu Preparedness Framework — capaz de localizar e explorar autonomamente zero-days em sistemas endurecidos, ou de planejar e executar de ponta a ponta estratégias de ataque contra alvos protegidos a partir de um objetivo de alto nível. Em resposta, a empresa reforçou ambientes de teste isolados, restrição de rede e ferramentas, criptografia adicional dos pesos do modelo e monitoramento de chain-of-thought com interrupção automática de atividades de risco. A OpenAI afirma que o Astra não esteve envolvido no incidente recente em que um agente próprio comprometeu a Hugging Face durante um teste.
Fonte ↗