olimposec.com
tema

#llm-agents

8 publicações marcadas com esta tag.

risco médioOS-2026-276 · 2026-08-24
0

AEGIS propõe política unificada contra abuso de recursos em ferramentas MCP

Pesquisadores apresentam o AEGIS, um componente de aplicação de políticas para o Model Context Protocol (MCP) que normaliza chamadas de ferramentas multimodais (texto, imagem, vídeo, localização) em uma representação única para detectar e barrar abusos de recursos. O sistema se integra ao Open Policy Agent e ao ContextForge AI Gateway para permitir que administradores definam salvaguardas granulares sem travar a flexibilidade do ecossistema de agentes.

Fonte ↗
panoramaOS-2026-278 · 2026-08-24
0

Pesquisa mostra que falhas em agentes de segurança de longo horizonte mudam de causa entre gerações de modelo

Um novo método de diagnóstico instrumenta tarefas de segurança executadas por agentes LLM com checkpoints, separando falhas que ocorrem antes de o agente sequer alcançar a capacidade necessária das falhas que ocorrem depois. Aplicado ao Gemini 2.5 e 3.7 Flash em tarefas de reutilização de estado observado, o estudo mostra que uma mesma intervenção de prompt que ajuda uma geração de modelo pode não ajudar, ou até atrapalhar, a geração seguinte.

Fonte ↗
risco altoOS-2026-280 · 2026-08-24
0

'Claw in Plain Sight': ataque de pressão de autoridade faz agentes de LLM vazarem dados protegidos em chamadas de ferramenta

Pesquisadores demonstram um ataque onde conteúdo aparentemente relacionado à tarefa engana modelos DeepSeek e Claude a incluírem atributos protegidos (dados pessoais, credenciais) como argumentos de chamadas de ferramenta 'legítimas', mesmo com políticas de privacidade no prompt. Em benchmark controlado com 120 chamadas, a taxa de vazamento variou de 20,8% a 75% conforme o modelo, mostrando que políticas de privacidade em texto de prompt não bloqueiam o problema de forma confiável.

Fonte ↗
risco médioOS-2026-284 · 2026-08-24
0

Z²-ACT combina LLM, prova de conhecimento zero e zero-trust para controlar agentes de IA em redes 6G abertas

A arquitetura Z²-ACT integra tradução de intenção via LLM, contratos formais de intenção, verificação zero-trust de prompt e auditoria criptográfica para manter agentes de IA que controlam redes 6G abertas e multi-fornecedor seguros e auditáveis mesmo sob entradas não confiáveis. Testes sobre medições públicas do ColO-RAN mostram melhor filtragem de ações e maior resiliência a ataques, com custo modesto de latência frente a uma baseline de aprendizado por reforço convencional.

Fonte ↗
risco médioOS-2026-285 · 2026-08-24
0

ClawSentry reduz de ~40% para ~2,6% a taxa de sucesso de ataques via skills maliciosas em agentes de IA

ClawSentry é um gateway de segurança agnóstico de framework que audita pacotes de 'skills' de terceiros antes da primeira execução e monitora o agente em runtime em três camadas de profundidade crescente, funcionando sobre Codex, Claude Code, Kimi CLI e Gemini CLI sem alterar os agentes. No benchmark SkillInject, a taxa de sucesso de ataque caiu de 39,55% para 2,61% com perda mínima de utilidade (98,7% de tarefas legítimas ainda completadas).

Fonte ↗
risco altoOS-2026-286 · 2026-08-24
0

TraceGrant bloqueia 100% dos ataques de prompt injection indireta em dois benchmarks de agentes de IA sem perder utilidade

TraceGrant governa o ciclo de vida completo de 'tarefa para efeito' de agentes de LLM conectados a e-mail, nuvem e serviços web, estabelecendo um Contrato de fronteira de autoridade antes da execução, restringindo o que evidências admitidas podem autorizar durante a execução, e verificando o resultado real contra o que foi de fato executado depois. Em 949 casos do AgentDojo e 400 do Agent Security Bench, o framework registrou zero sucessos de ataque mantendo utilidade sob taxas de ataque de 77% e 83%.

Fonte ↗
risco altoOS-2026-287 · 2026-08-24
0

AID-Guard fecha a janela entre autorização e efeito real de agentes de IA que interagem com Stripe e outras APIs de pagamento

AID-Guard propõe um protocolo de autorização com estado que revalida a requisição aprovada e o estado do provedor no momento do commit, evitando que uma perda de resposta ou uma retentativa gere um segundo efeito indevido a partir de uma única aprovação. Sob compromisso total do proponente, o protocolo bloqueou 44 de 44 ataques e admitiu 44 de 44 propostas legítimas equivalentes, ao custo de reduzir utilidade benigna em até 44 pontos percentuais no perfil mais estrito.

Fonte ↗
panoramaOS-2026-054 · 2026-07-21
0

SlotGuard barra vazamento de segredos e dados privados em transcripts de agentes LLM sem quebrar o raciocínio do modelo

SlotGuard é uma proposta para impedir que agentes de LLM vazem caminhos de arquivo, e-mails e credenciais capturados de saídas de ferramentas, logs de shell e leituras de arquivo que acabam anexadas ao transcript enviado ao provedor do modelo. Em vez de redação por placeholder — que os autores mostram ser frágil, perdendo referências entre turnos e destruindo estrutura útil ao raciocínio —, o sistema reescreve vínculos estruturais em "slots" tipados e substitui segredos por valores sintéticos que preservam o formato original.

Fonte ↗