olimposec.com
tema

#multimodal

4 publicações marcadas com esta tag.

risco médioOS-2026-205 · 2026-08-11
0

Estudo mostra que benchmarks de guardrails multimodais podem estar atribuindo ao filtro um mérito que é do próprio modelo

O artigo demonstra que a forma como um benchmark mede a eficácia de um guardrail black-box pode inflar artificialmente sua contribuição real: quando o payload de ataque é codificado como pixels de imagem, um guardrail de texto simplesmente não bloqueia nada — é o próprio modelo alvo, por seu alinhamento, que produz todas as recusas atribuídas ao filtro. Duas variáveis não registradas por avaliações padrão — qual canal carrega o payload e que texto o harness expõe ao guardrail — bastam para deslocar o crédito de "quase zero" a "quase tudo" para o mesmo guardrail.

Fonte ↗
panoramaOS-2026-169 · 2026-08-07
0

Benchmark de assistentes domésticos multimodais expõe dilema entre executar comandos falsos e ignorar comandos reais

Pesquisadores criaram o PromptShield-Home, um benchmark de cenários realistas de casa inteligente para testar se assistentes multimodais conseguem distinguir um comando genuíno de um usuário de conteúdo ambiente — fala de TV, texto na tela, uma conversa ouvida ao fundo — que apenas parece um comando. O estudo compara detectores tradicionais, um único agente multimodal e mediação multiagente, e descobre que as duas primeiras abordagens falham de formas opostas e complementares.

Fonte ↗
risco médioOS-2026-153 · 2026-08-06
0

Framework HACA automatiza jailbreak multimodal com 95% de taxa de sucesso contra modelos multimodais líderes

Pesquisadores decompõem o espaço de estratégias de jailbreak multimodal em componentes atômicos estruturais, semânticos e sintáticos, cobrindo texto e imagem, e propõem o HACA (Hierarchical Atomic Combination Attack), um método que combina automaticamente essas estratégias por meio de um planejador cross-modal. O sistema atingiu taxa média de sucesso de 95,48% contra cinco MLLMs (modelos de linguagem multimodais) amplamente usados, superando abordagens artesanais anteriores.

Fonte ↗
risco médioOS-2026-087 · 2026-07-23
0

Boletim ThreatsDay destaca GhostCommit: imagem em pull request esconde ordens para agente de revisão de código de IA

No boletim semanal ThreatsDay, entre diversas ameaças de naturezas variadas, destaca-se a técnica batizada de GhostCommit: um pull request contém uma imagem PNG aparentemente inofensiva cujo texto renderizado instrui um agente de IA de revisão de código a ler um arquivo .env, codificá-lo byte a byte e, depois do merge, exfiltrar segredos do repositório em uma sessão futura. O mesmo boletim também cobre um caso de jailbreaking de modelos de IA por ator estatal russo e vulnerabilidades introduzidas por código gerado por IA.

Fonte ↗