Jailbreak Foundry transforma artigos acadêmicos de jailbreak em ataques executáveis para padronizar benchmarks de robustez
Diante de um cenário em que técnicas de jailbreak evoluem mais rápido que os benchmarks usados para medi-las, o sistema Jailbreak Foundry usa um fluxo multiagente para traduzir automaticamente papers de jailbreak em módulos executáveis dentro de um harness unificado. Reproduzindo 30 ataques com desvio médio de apenas 0,26 pontos percentuais em relação às taxas de sucesso originalmente reportadas, o sistema permite avaliação padronizada de 10 modelos-alvo sob um único juiz (GPT-4o).
A literatura de jailbreak para LLMs cresce mais rápido do que a capacidade da comunidade de comparar resultados de forma justa entre si: cada paper costuma usar seu próprio dataset, harness de execução e protocolo de julgamento, o que torna estimativas de robustez rapidamente desatualizadas e difíceis de comparar entre trabalhos diferentes.
O Jailbreak Foundry (JBF) é composto por três peças que atacam esse problema de infraestrutura compartilhada. O JBF-LIB fornece contratos e utilitários reutilizáveis comuns a diferentes ataques. O JBF-FORGE implementa um fluxo multiagente que lê o texto de um paper de jailbreak e o traduz automaticamente em um módulo executável dentro do harness comum, eliminando boa parte do trabalho manual de reimplementação. O JBF-EVAL padroniza o protocolo de avaliação, garantindo o mesmo conjunto de modelos-alvo e o mesmo juiz em todas as comparações. Ao reutilizar infraestrutura compartilhada entre ataques, o sistema reduz o código específico de cada implementação em mais da metade em relação aos repositórios originais dos autores, com 82,5% de reaproveitamento médio de código entre os módulos gerados.
Em 30 ataques reproduzidos, o JBF alcança alta fidelidade em relação aos resultados originalmente publicados, com desvio médio de apenas 0,26 pontos percentuais na taxa de sucesso de ataque reportada versus reproduzida. A avaliação padronizada cobriu os 30 ataques contra 10 modelos-alvo, usando um juiz GPT-4o consistente em todas as comparações — uma escala de comparação direta raramente vista em papers individuais de jailbreak.
É essencialmente uma ferramenta de duplo uso. Para equipes de red team e pesquisadores de alinhamento, oferece uma forma escalável de manter benchmarks de jailbreak atualizados à medida que novas técnicas são publicadas, ajudando a medir a robustez real de modelos em produção contra o estado da arte, em vez de contra técnicas já defasadas. Mas o mesmo pipeline que converte automaticamente papers acadêmicos em ataques executáveis também reduz a barreira técnica para qualquer pessoa reproduzir rapidamente o estado da arte em jailbreak sem entender profundamente cada técnica individual — algo que times de segurança de provedores de LLM precisam considerar tanto ao planejar defesas quanto ao decidir o nível de detalhe de implementação a publicar em suas próprias pesquisas.