olimposec.com
tema

#avaliacao

3 publicações marcadas com esta tag.

panoramaOS-2026-278 · 2026-08-24
0

Pesquisa mostra que falhas em agentes de segurança de longo horizonte mudam de causa entre gerações de modelo

Um novo método de diagnóstico instrumenta tarefas de segurança executadas por agentes LLM com checkpoints, separando falhas que ocorrem antes de o agente sequer alcançar a capacidade necessária das falhas que ocorrem depois. Aplicado ao Gemini 2.5 e 3.7 Flash em tarefas de reutilização de estado observado, o estudo mostra que uma mesma intervenção de prompt que ajuda uma geração de modelo pode não ajudar, ou até atrapalhar, a geração seguinte.

Fonte ↗
risco médioOS-2026-283 · 2026-08-24
0

LLMs mostram raciocínio de segurança 'frágil': reformular o mesmo problema muda o ranking de defesas escolhidas

Testando LLMs na seleção de controles de segurança sobre grafos de ataque reais (ransomware, comprometimento de cadeia de suprimento, Kubernetes, ICS/OT), pesquisadores encontraram que os modelos produzem estratégias próximas de um baseline de otimização matemática quando a estrutura do ataque é explícita, mas a qualidade despenca com a complexidade do grafo e é muito sensível a mudanças de formulação do prompt — inclusive apenas rotular uma estratégia ruim como 'ótima' melhora drasticamente a avaliação que o próprio LLM dá a ela.

Fonte ↗
panoramaOS-2026-071 · 2026-07-23
0

JailMeter propoe avaliacao rigorosa baseada em evidencias para medir jailbreaks em LLMs

Pesquisadores lancaram o JailMeter, um framework que tenta resolver um problema cronico da literatura de jailbreak: a falta de criterio consistente para dizer se um ataque realmente funcionou. Em vez de contar qualquer resposta nao recusada como sucesso, o metodo extrai evidencia concisa da resposta do modelo e so valida o ataque quando ela captura a intencao maliciosa original e entrega uma resposta completa.

Fonte ↗