olimposec.com
tema

#guardrails

8 publicações marcadas com esta tag.

panoramaOS-2026-251 · 2026-08-19
0

COMIC propõe filtro de segurança multimodal que avalia o alvo visual real de um pedido, não só o texto

Pesquisadores mostram que muitos jailbreaks multimodais não têm conteúdo nocivo nem no texto nem na imagem isoladamente: o dano só surge quando o modelo associa uma instrução aparentemente inofensiva a uma região específica da imagem. O filtro COMIC resolve isso identificando primeiro qual operação e qual alvo visual estão sendo referenciados, e só então avalia a segurança desse par operação-alvo, superando defesas que julgam o par texto-imagem como um todo.

Fonte ↗
risco médioOS-2026-205 · 2026-08-11
0

Estudo mostra que benchmarks de guardrails multimodais podem estar atribuindo ao filtro um mérito que é do próprio modelo

O artigo demonstra que a forma como um benchmark mede a eficácia de um guardrail black-box pode inflar artificialmente sua contribuição real: quando o payload de ataque é codificado como pixels de imagem, um guardrail de texto simplesmente não bloqueia nada — é o próprio modelo alvo, por seu alinhamento, que produz todas as recusas atribuídas ao filtro. Duas variáveis não registradas por avaliações padrão — qual canal carrega o payload e que texto o harness expõe ao guardrail — bastam para deslocar o crédito de "quase zero" a "quase tudo" para o mesmo guardrail.

Fonte ↗
panoramaOS-2026-157 · 2026-08-06
0

Guarded-V2X propõe guardrails inline para proteger LLMs usados em sistemas veiculares conectados

Sistemas V2X (comunicação veículo-tudo) estão incorporando LLMs para tarefas semânticas como sumarização de mensagens e suporte a decisão em unidades de borda, o que introduz uma superfície de ataque em nível de prompt não coberta pelos mecanismos tradicionais de autenticação e integridade de mensagem do V2X. O Guarded-V2X combina filtragem de entrada baseada em regras, um classificador leve de segurança, geração restrita por política e verificação pós-decisão, reduzindo a aceitação de intrusões e eliminando conclusões inseguras observadas em testes de dois turnos, sem estourar o orçamento de latência exigido por esse tipo de aplicação.

Fonte ↗
panoramaOS-2026-116 · 2026-07-31
0

FAVA usa um solver SMT para barrar em tempo real ações perigosas de agentes de IA

Pesquisadores propõem o FAVA, um framework que substitui listas estáticas de permissão por autorização verificada em tempo de execução para agentes de LLM. Tarefas em linguagem natural são traduzidas para um grafo de permissões rastreável, que um solver SMT confere contra políticas de segurança antes de qualquer ação com efeito real ser executada. Em benchmarks como OpenAgentSafety, OctoBench e ActPlane, o sistema atingiu 90,5% de conformidade nas decisões, interceptando ações que violavam a política dinamicamente.

Fonte ↗
panoramaOS-2026-120 · 2026-07-31
0

Estudo formaliza um 'trilema' de segurança para LLMs: capacidade útil, segurança confiável e acesso aberto não coexistem

O artigo demonstra matematicamente que, quando um LLM decide se responde a um pedido de uso dual (útil tanto para um profissional legítimo quanto para um atacante) baseado apenas em evidência "copiável" — como o histórico da conversa ou afirmações do próprio usuário —, existe um piso inevitável de ajuda que qualquer atacante disposto a imitar um contexto legítimo sempre vai conseguir extrair. Os autores batizam isso de trilema: capacidade útil, segurança confiável e acesso aberto não podem coexistir plenamente ao mesmo tempo. Como mitigação parcial, propõem complementar as salvaguardas atuais com credenciais de difícil falsificação, que atestem de forma verificável o uso legítimo por trás do pedido.

Fonte ↗
risco médioOS-2026-112 · 2026-07-30
0

Guards de modelos de visão-linguagem ainda falham contra jailbreaks codificados, mesmo com defesa amplificada

Um novo artigo expõe o "decode gap": classificadores de segurança para modelos de visão-linguagem julgam a forma superficial de uma solicitação, não seu significado real, permitindo que pedidos nocivos disfarçados em lógica formal, linguagens raras, código ou imagens de texto escapem da moderação. Os autores propõem um amplificador que tenta neutralizar esse desvio antes do guard atuar, mas mostram que mesmo a melhor combinação ainda deixa 63-65% dos ataques passarem, e o remédio para isso dispara recusas indevidas em pedidos legítimos.

Fonte ↗
panoramaOS-2026-071 · 2026-07-23
0

JailMeter propoe avaliacao rigorosa baseada em evidencias para medir jailbreaks em LLMs

Pesquisadores lancaram o JailMeter, um framework que tenta resolver um problema cronico da literatura de jailbreak: a falta de criterio consistente para dizer se um ataque realmente funcionou. Em vez de contar qualquer resposta nao recusada como sucesso, o metodo extrai evidencia concisa da resposta do modelo e so valida o ataque quando ela captura a intencao maliciosa original e entrega uma resposta completa.

Fonte ↗
risco altoOS-2026-078 · 2026-07-23
0

DARWIN faz ataque e defesa de jailbreak evoluirem continuamente em loop competitivo

O DARWIN trata jailbreak como um processo evolutivo aberto, no qual um adversario (DARWIN-Attack) descobre, muta e seleciona estrategias de ataque continuamente, enquanto uma defesa (DARWIN-Guard) treina de forma online sobre os exemplos adversariais gerados por esse adversario. O ataque atinge quase 100% de sucesso contra alguns modelos de fronteira e mais de 90% contra o GPT-5.5, enquanto a defesa alcanca 91,6% de recall medio de conteudo inseguro em 12 benchmarks.

Fonte ↗