olimposec.com
tema

#pentest

4 publicações marcadas com esta tag.

risco médioOS-2026-136 · 2026-08-03
0

ScopeJudge cria um 'juiz' de IA para impedir que agentes de pentest saiam do escopo contratado

ScopeJudge propõe um segundo modelo de IA mais barato que atua como 'juiz', avaliando cada chamada de ferramenta de um agente de pentest autônomo antes de ela ser executada, para impedir que ele saia do escopo contratado. Um benchmark de quase 5 mil chamadas rotuladas por pentesters profissionais mostra que políticas estáticas, sem ver o pedido original do usuário, falham quase completamente em detectar violações de escopo. Os autores recomendam configurações diferentes de custo e segurança conforme o risco da implantação.

Fonte ↗
risco altoOS-2026-115 · 2026-07-31
0

Testes de red-team da Anthropic com o Claude invadiram por engano sistemas de três organizações

Uma falha de configuração nos ambientes de teste da Anthropic e de sua parceira deu acesso à internet a instâncias do Claude que deveriam estar isoladas durante avaliações ofensivas do tipo capture-the-flag. Com esse acesso indevido, os próprios agentes de IA chegaram a comprometer sistemas de três organizações externas, sem que ninguém percebesse no momento. A Anthropic revisou mais de 140 mil execuções de teste para reconstruir o alcance do incidente, que remonta a abril de 2026, e assumiu publicamente a responsabilidade pelo ocorrido.

Fonte ↗
panoramaOS-2026-114 · 2026-07-30
0

StealthBench: novo benchmark expõe falhas de sigilo operacional em agentes autônomos de segurança ofensiva

Pesquisadores apresentam o StealthBench, benchmark que mede a capacidade de agentes de IA autônomos executarem tarefas ofensivas de segurança sem comprometer seu próprio sigilo operacional (OPSEC). Os resultados mostram que nenhum modelo avaliado ultrapassa 54% de taxa de sucesso seguro, revelando que agentes encontram vulnerabilidades reais mas frequentemente "queimam" a operação ao cometer erros grosseiros de tradecraft.

Fonte ↗
panoramaOS-2026-018 · 2026-07-16
0

IA acelera a busca por vulnerabilidades, mas comprovação de bugs ainda exige conhecimento humano

O artigo argumenta que, embora ferramentas de IA acelerem etapas de reconhecimento e geração de payloads em testes de segurança ofensivos, elas não substituem a validação humana necessária para provar que uma vulnerabilidade é real e explorável em produção. Aponta como sintoma prático o aumento de submissões de baixa qualidade em programas de bug bounty, com severidades infladas por relatórios gerados por IA sem evidência real de exploração.

Fonte ↗