olimposec.com
tema

#benchmark

5 publicações marcadas com esta tag.

risco médioOS-2026-253 · 2026-08-19
0

Fair-ASR reavalia jailbreaks de LLM sob orçamento igual de tentativas e expõe ataque barato com 85% de sucesso no GPT-5

O estudo Fair-ASR mostra que comparações de eficácia entre ataques de jailbreak são enganosas quando não controlam o número de consultas usadas contra o alvo, e que, sob orçamento igual, técnicas simples continuam competitivas com métodos elaborados guiados por LLM. Usando essa análise, os autores criam o ReCode, um ataque barato que atinge 85% de sucesso contra o GPT-5 usando apenas 20 consultas ao modelo alvo.

Fonte ↗
panoramaOS-2026-235 · 2026-08-18
0

WeSCE: um benchmark para medir se a IA piora a segurança do seu código sem avisar

O WeSCE mede 'security drift' — a degradação silenciosa da postura de segurança de um código quando um LLM faz edições pedidas apenas por objetivos funcionais, sem requisito de segurança explícito. O benchmark reúne 400 programas reais cobrindo adição de funcionalidades, remoção de funcionalidades, correção de bugs e refatoração, com uma métrica de risco contínua que captura tanto o caso médio quanto o pior caso.

Fonte ↗
panoramaOS-2026-141 · 2026-08-05
0

Benchmark mostra que políticas de segurança corporativas custam caro ao desempenho de agentes de codificação

Pesquisadores avaliaram 12 agentes de codificação no Terminal-Bench 2.1 sob camadas crescentes de restrições típicas de ambientes corporativos — credenciais limitadas, egresso de rede restrito, sistemas de arquivos somente leitura e execução sem privilégios de root. Sob a política mais rígida, a perda de taxa de sucesso chegou a 18,3 pontos percentuais e o custo de execução inflou até 167,3%, com o modelo que melhor preserva o sucesso sendo justamente o que mais perde em eficiência.

Fonte ↗
panoramaOS-2026-114 · 2026-07-30
0

StealthBench: novo benchmark expõe falhas de sigilo operacional em agentes autônomos de segurança ofensiva

Pesquisadores apresentam o StealthBench, benchmark que mede a capacidade de agentes de IA autônomos executarem tarefas ofensivas de segurança sem comprometer seu próprio sigilo operacional (OPSEC). Os resultados mostram que nenhum modelo avaliado ultrapassa 54% de taxa de sucesso seguro, revelando que agentes encontram vulnerabilidades reais mas frequentemente "queimam" a operação ao cometer erros grosseiros de tradecraft.

Fonte ↗
risco médioOS-2026-045 · 2026-07-20
0

Jailbreak Foundry transforma artigos acadêmicos de jailbreak em ataques executáveis para padronizar benchmarks de robustez

Diante de um cenário em que técnicas de jailbreak evoluem mais rápido que os benchmarks usados para medi-las, o sistema Jailbreak Foundry usa um fluxo multiagente para traduzir automaticamente papers de jailbreak em módulos executáveis dentro de um harness unificado. Reproduzindo 30 ataques com desvio médio de apenas 0,26 pontos percentuais em relação às taxas de sucesso originalmente reportadas, o sistema permite avaliação padronizada de 10 modelos-alvo sob um único juiz (GPT-4o).

Fonte ↗