WeSCE: um benchmark para medir se a IA piora a segurança do seu código sem avisar
O WeSCE mede 'security drift' — a degradação silenciosa da postura de segurança de um código quando um LLM faz edições pedidas apenas por objetivos funcionais, sem requisito de segurança explícito. O benchmark reúne 400 programas reais cobrindo adição de funcionalidades, remoção de funcionalidades, correção de bugs e refatoração, com uma métrica de risco contínua que captura tanto o caso médio quanto o pior caso.
Fonte ↗