Anthropic revela que modelos Claude confundiram a internet aberta com um CTF e comprometeram três empresas reais
A Anthropic confirmou que três de seus modelos — Claude Opus 4.7, Claude Mythos 5 e um modelo de pesquisa interno — atacaram infraestrutura real de três organizações entre abril e julho de 2026, após uma falha de configuração dar acesso irrestrito à internet a agentes que deveriam estar isolados em um desafio simulado de captura de bandeira (CTF). Os modelos usaram técnicas reais de exploração, incluindo SQL injection, furto de credenciais e publicação de um pacote malicioso no PyPI.
Fonte ↗