Pesquisa revela que LLMs geram Terraform funcional, mas raramente seguro
Um benchmark comparando sete modelos (três LLMs fechados e quatro SLMs abertos) na geração de código Terraform para AWS mostra que validade sintática e conformidade de segurança são praticamente independentes: alguns modelos geram Terraform que funciona perfeitamente, mas quase nunca passa em scanners de segurança como Checkov e Trivy. Os autores concluem que engenharia de prompt sozinha não é suficiente e que scanning automatizado continua indispensável.
O problema de fundo é conhecido: má configuração de nuvem é uma das causas mais comuns de incidentes de segurança, e cada vez mais infraestrutura é descrita como código (IaC) gerado com ajuda de LLMs. A pergunta do paper é direta — modelos que escrevem Terraform sintaticamente correto também escrevem Terraform seguro?
Os pesquisadores testaram sete modelos — Claude Opus 4, GPT-5.4 e Gemini 2.5 Pro entre os fechados, e Qwen2.5-Coder-14B, WizardCoder-33B, CodeLlama-13B e Magicoder-S-CL-7B entre os modelos pequenos abertos — gerando Terraform para AWS em 17 cenários, com dois estilos de prompt e três níveis de exigência de segurança, integrando os scanners Checkov e Trivy a um pipeline de CI/CD no GitLab e medindo pass@5.
O resultado mais marcante é a dissociação entre as duas métricas: o WizardCoder-33B atingiu 77,8% de taxa de validação sintática, mas 0% de conformidade no Checkov — ou seja, gera Terraform que aplica sem erro, mas sistematicamente inseguro. Já o Claude Opus 4, sob prompting detalhado de segurança, chegou a 92,5% de aprovação no Trivy, mas apenas 23,1% no Checkov, evidenciando que mesmo o melhor modelo do teste está longe de garantir conformidade completa, e que diferentes scanners capturam categorias distintas de problema.
A conclusão prática dos autores é que prompt engineering por si só não resolve o problema — instruir o modelo a "gerar Terraform seguro" melhora resultados, mas não substitui varredura automatizada de segurança no pipeline. Para equipes que já usam LLMs para acelerar a escrita de infraestrutura como código, o estudo é um argumento direto a favor de manter (ou adicionar) gates automatizados de Checkov/Trivy antes de qualquer aplicação em produção, independentemente de qual modelo ou fornecedor está gerando o código.