olimposec.com
tema

#moderacao-de-conteudo

3 publicações marcadas com esta tag.

risco médioOS-2026-254 · 2026-08-19
0

Estudo prova limite matemático das defesas com estado contra ataques de decomposição em serviços de LLM

Pesquisadores provam matematicamente que defesas com estado contra ataques de decomposição, que dividem uma tarefa nociva em pedidos individualmente inofensivos, deixam de funcionar quando atacantes podem criar identidades novas e não vinculáveis e combinar as respostas fora da plataforma. Em testes com tarefas reais, todas as dez políticas de defesa avaliadas falharam em conter o ataque ou romperam o orçamento de recusas permitido, mesmo com uma política idealizada com mapeamento perfeito de pedidos.

Fonte ↗
risco médioOS-2026-118 · 2026-07-31
0

RoguePrompt combina cifras Vigenère e ROT13 para furar filtros de moderação de LLMs em até 94% dos casos

Pesquisadores apresentam o RoguePrompt, um pipeline de jailbreak que fragmenta um pedido proibido e aplica duas cifras clássicas em camada — Vigenère seguida de ROT13 — junto com instruções em linguagem natural para o próprio modelo reconstruir e executar o conteúdo original. Testado às cegas (apenas via API/interface) contra 313 prompts já bloqueados por moderação, o método furou os filtros em 93,9% dos casos, embora a reconstrução completa e a execução final do pedido tenham sucesso menor (79% e 70%, respectivamente). O resultado mostra que a maior fraqueza hoje está na moderação de entrada, não na capacidade do modelo de resistir ao pedido depois de decodificado.

Fonte ↗
risco médioOS-2026-112 · 2026-07-30
0

Guards de modelos de visão-linguagem ainda falham contra jailbreaks codificados, mesmo com defesa amplificada

Um novo artigo expõe o "decode gap": classificadores de segurança para modelos de visão-linguagem julgam a forma superficial de uma solicitação, não seu significado real, permitindo que pedidos nocivos disfarçados em lógica formal, linguagens raras, código ou imagens de texto escapem da moderação. Os autores propõem um amplificador que tenta neutralizar esse desvio antes do guard atuar, mas mostram que mesmo a melhor combinação ainda deixa 63-65% dos ataques passarem, e o remédio para isso dispara recusas indevidas em pedidos legítimos.

Fonte ↗