Estudo com 2.700 casos mostra que mais da metade do código gerado por LLMs falha em cenários de segurança realistas
Pesquisadores construíram um benchmark de 2.700 casos que reproduz situações comuns de desenvolvimento real — requisitos ambíguos, contexto operacional pouco especificado e conflitos entre segurança e funcionalidade — para avaliar oito LLMs de ponta na geração de código. Todos os modelos apresentaram taxas de vulnerabilidade acima de 56%, embora prompts com instruções explícitas de segurança tenham reduzido o problema em até 45%.
Fonte ↗