olimposec.com
tema

#artigo-cientifico

216 publicações marcadas com esta tag.

risco médioOS-2026-293 · 2026-08-26
0

TrustShiftProbe expõe ataques de 'mudança de confiança' em servidores MCP comprometidos

Pesquisadores propõem o TrustShift, uma classe de ataque em que um servidor MCP se comporta de forma benigna durante uma fase de condicionamento inicial para conquistar a confiança do agente, e só então libera um payload adversarial. A defesa proposta, SHIELD, reduz a taxa de sucesso do ataque de 69,5% para 42,7%, mas deixa um resíduo alto.

Fonte ↗
risco médioOS-2026-294 · 2026-08-26
0

ROBBIN usa Rowhammer para implantar backdoors em modelos de IA direto na memória

Pesquisadores demonstram um ataque "hardware-aware" que explora os bit-flips do Rowhammer em DRAM DDR4 real para injetar backdoors em redes neurais durante a inferência, atingindo cerca de 90% de taxa de sucesso mantendo mais de 83% de acurácia normal, adaptando o ataque ao padrão específico de cada chip.

Fonte ↗
risco altoOS-2026-295 · 2026-08-26
0

Análise de segurança do Agent Payments Protocol do Google encontra 48 ameaças, 8 de risco alto

Pesquisa sistemática do AP2 v0.2, protocolo do Google que permite a agentes LLM autorizar e executar pagamentos em nome do usuário, mapeia cinco fases do ciclo de vida e cinco arquiteturas de implantação, cataloga 48 ameaças via metodologia MAESTRO e demonstra provas de conceito para as oito de maior severidade.

Fonte ↗
risco médioOS-2026-297 · 2026-08-26
0

STAIN-FL: backdoors furtivos em aprendizado federado para vigilância por vídeo usam condições da cena como gatilho

Pesquisadores mostram como um cliente malicioso em um sistema federado de detecção de anomalias em vigilância pode implantar backdoors usando condições naturais da cena (pouca luz, ambientes internos, aglomerações) como gatilho, em vez de um padrão artificial, mantendo o ataque furtivo e persistente por centenas de rodadas.

Fonte ↗
risco médioOS-2026-298 · 2026-08-26
0

NeuronGuard redistribui 'sinais de segurança' entre neurônios para blindar LLMs contra jailbreak e poda maliciosa

Nova defesa aplicada na fase de fine-tuning espalha a informação de recusa de segurança por um conjunto mais amplo de neurônios de um LLM, em vez de concentrá-la em poucos neurônios críticos, reduzindo a taxas de sucesso de jailbreaks textuais e de ataques que podam neurônios após o deploy para perto de zero, mantendo a utilidade do modelo.

Fonte ↗
risco médioOS-2026-299 · 2026-08-26
0

RAGSentinel detecta documentos envenenados em RAG sem precisar de treinamento ou rótulos

Defesa geométrica para sistemas RAG usa um encoder substituto para medir como cada documento recuperado desloca o estado oculto do modelo, filtrando como outliers os documentos que tentam manipular a resposta, com garantia formal de recuperar um contexto livre de veneno sob suposição de maioria honesta.

Fonte ↗
risco médioOS-2026-300 · 2026-08-26
0

WebMCP-Phalanx tenta impor fronteiras de confiança para agentes de IA integrados ao navegador

Com o padrão WebMCP do W3C permitindo que páginas web exponham ferramentas diretamente a agentes LLM, pesquisadores mostram que o modelo de segurança do navegador baseado em same-origin não dá garantias suficientes de proveniência, e propõem uma arquitetura de dupla camada que reduziu ataques de revogação/sobrescrita de 100% para 0% e bloqueou injeções de prompt embutidas em descrições de ferramentas.

Fonte ↗
risco médioOS-2026-301 · 2026-08-26
0

Attnlocate localiza instruções maliciosas escondidas em dados externos observando os padrões de atenção do modelo

Framework detecta, em tempo de execução, quais trechos de um contexto externo realmente influenciaram uma decisão de chamada de ferramenta do agente, tratando o problema como detecção de objetos sobre o mapa de atenção, e usa a autoridade da fonte desses trechos para bloquear invocações maliciosas.

Fonte ↗
risco médioOS-2026-302 · 2026-08-26
0

RACER remove backdoors de modelos multimodais usando apenas 100 amostras limpas

Framework de reparo identifica uma "anomalia de inconsistência entre camadas" causada por gatilhos de backdoor em regiões específicas dos tokens visuais ou textuais de um MLLM, e usa esse sinal para gerar um ajuste fino adversarial que elimina o comportamento malicioso sem precisar saber qual é o gatilho.

Fonte ↗
risco médioOS-2026-276 · 2026-08-24
0

AEGIS propõe política unificada contra abuso de recursos em ferramentas MCP

Pesquisadores apresentam o AEGIS, um componente de aplicação de políticas para o Model Context Protocol (MCP) que normaliza chamadas de ferramentas multimodais (texto, imagem, vídeo, localização) em uma representação única para detectar e barrar abusos de recursos. O sistema se integra ao Open Policy Agent e ao ContextForge AI Gateway para permitir que administradores definam salvaguardas granulares sem travar a flexibilidade do ecossistema de agentes.

Fonte ↗
risco médioOS-2026-277 · 2026-08-24
0

Estudo com mais de 120 LLMs revela que segurança, privacidade e alinhamento competem entre si

O aiXamine é uma plataforma de avaliação black-box que testa simultaneamente segurança, privacidade e alinhamento de segurança em LLMs, rodando 46 testes automatizados de red-teaming por modelo. Em mais de 5.000 execuções contra 120+ modelos, os autores encontraram uma 'taxa de segurança' (mais alinhamento gera mais recusas indevidas), privacidade quase independente das demais dimensões, e um colapso catastrófico de robustez em modelos destilados sem correção on-policy.

Fonte ↗
panoramaOS-2026-278 · 2026-08-24
0

Pesquisa mostra que falhas em agentes de segurança de longo horizonte mudam de causa entre gerações de modelo

Um novo método de diagnóstico instrumenta tarefas de segurança executadas por agentes LLM com checkpoints, separando falhas que ocorrem antes de o agente sequer alcançar a capacidade necessária das falhas que ocorrem depois. Aplicado ao Gemini 2.5 e 3.7 Flash em tarefas de reutilização de estado observado, o estudo mostra que uma mesma intervenção de prompt que ajuda uma geração de modelo pode não ajudar, ou até atrapalhar, a geração seguinte.

Fonte ↗
risco médioOS-2026-279 · 2026-08-24
0

ARQ usa agente de IA para corrigir falsos positivos e negativos em queries do CodeQL e acha bugs reais em libpng e zlib

O framework ARQ refina automaticamente queries do CodeQL para detecção de vulnerabilidades em C/C++, usando um loop de IA que gera programas de teste e compara a execução real deles com o veredito da query, sem precisar de datasets rotulados. O resultado foi um aumento de até 119,8% em verdadeiros positivos, correção de três issues do repositório oficial do CodeQL abertas havia até 27 meses, e a descoberta de dois bugs inéditos em libpng e zlib.

Fonte ↗
risco altoOS-2026-280 · 2026-08-24
0

'Claw in Plain Sight': ataque de pressão de autoridade faz agentes de LLM vazarem dados protegidos em chamadas de ferramenta

Pesquisadores demonstram um ataque onde conteúdo aparentemente relacionado à tarefa engana modelos DeepSeek e Claude a incluírem atributos protegidos (dados pessoais, credenciais) como argumentos de chamadas de ferramenta 'legítimas', mesmo com políticas de privacidade no prompt. Em benchmark controlado com 120 chamadas, a taxa de vazamento variou de 20,8% a 75% conforme o modelo, mostrando que políticas de privacidade em texto de prompt não bloqueiam o problema de forma confiável.

Fonte ↗
risco médioOS-2026-281 · 2026-08-24
0

CacheTracer expõe dependências ocultas entre revendedores de API de LLM usando cache de prefixo como canal lateral

CacheTracer é uma técnica de medição que explora a reutilização de cache de prefixo em serviços de LLM como canal lateral para detectar quando dois revendedores de API distintos, na prática, compartilham o mesmo provedor de infraestrutura por trás dos panos. Testado contra 39 endpoints reais com 1,1 milhão de requisições, o estudo encontrou compartilhamento de cache em 37,1% dos pares analisados e uma hierarquia de dependência de até sete camadas.

Fonte ↗
risco médioOS-2026-282 · 2026-08-24
0

Estudo de 'vibe coding' mostra que pedir segurança no prompt reduz pela metade as vulnerabilidades em apps gerados por IA

Comparando doze aplicações web geradas pelo mesmo assistente de codificação agentic — seis com prompt padrão e seis com uma seção extra pedindo boas práticas de segurança — pesquisadores encontraram 51 vulnerabilidades confirmadas no grupo baseline contra 24 no grupo com prompt de segurança, sem nenhuma falha crítica ou alta neste último. O estudo é pequeno e não-iterativo, mas é um dos primeiros a quantificar o efeito de instruções de segurança explícitas no código gerado por IA generativa.

Fonte ↗
risco médioOS-2026-283 · 2026-08-24
0

LLMs mostram raciocínio de segurança 'frágil': reformular o mesmo problema muda o ranking de defesas escolhidas

Testando LLMs na seleção de controles de segurança sobre grafos de ataque reais (ransomware, comprometimento de cadeia de suprimento, Kubernetes, ICS/OT), pesquisadores encontraram que os modelos produzem estratégias próximas de um baseline de otimização matemática quando a estrutura do ataque é explícita, mas a qualidade despenca com a complexidade do grafo e é muito sensível a mudanças de formulação do prompt — inclusive apenas rotular uma estratégia ruim como 'ótima' melhora drasticamente a avaliação que o próprio LLM dá a ela.

Fonte ↗
risco médioOS-2026-284 · 2026-08-24
0

Z²-ACT combina LLM, prova de conhecimento zero e zero-trust para controlar agentes de IA em redes 6G abertas

A arquitetura Z²-ACT integra tradução de intenção via LLM, contratos formais de intenção, verificação zero-trust de prompt e auditoria criptográfica para manter agentes de IA que controlam redes 6G abertas e multi-fornecedor seguros e auditáveis mesmo sob entradas não confiáveis. Testes sobre medições públicas do ColO-RAN mostram melhor filtragem de ações e maior resiliência a ataques, com custo modesto de latência frente a uma baseline de aprendizado por reforço convencional.

Fonte ↗
risco médioOS-2026-285 · 2026-08-24
0

ClawSentry reduz de ~40% para ~2,6% a taxa de sucesso de ataques via skills maliciosas em agentes de IA

ClawSentry é um gateway de segurança agnóstico de framework que audita pacotes de 'skills' de terceiros antes da primeira execução e monitora o agente em runtime em três camadas de profundidade crescente, funcionando sobre Codex, Claude Code, Kimi CLI e Gemini CLI sem alterar os agentes. No benchmark SkillInject, a taxa de sucesso de ataque caiu de 39,55% para 2,61% com perda mínima de utilidade (98,7% de tarefas legítimas ainda completadas).

Fonte ↗
risco altoOS-2026-286 · 2026-08-24
0

TraceGrant bloqueia 100% dos ataques de prompt injection indireta em dois benchmarks de agentes de IA sem perder utilidade

TraceGrant governa o ciclo de vida completo de 'tarefa para efeito' de agentes de LLM conectados a e-mail, nuvem e serviços web, estabelecendo um Contrato de fronteira de autoridade antes da execução, restringindo o que evidências admitidas podem autorizar durante a execução, e verificando o resultado real contra o que foi de fato executado depois. Em 949 casos do AgentDojo e 400 do Agent Security Bench, o framework registrou zero sucessos de ataque mantendo utilidade sob taxas de ataque de 77% e 83%.

Fonte ↗
risco altoOS-2026-287 · 2026-08-24
0

AID-Guard fecha a janela entre autorização e efeito real de agentes de IA que interagem com Stripe e outras APIs de pagamento

AID-Guard propõe um protocolo de autorização com estado que revalida a requisição aprovada e o estado do provedor no momento do commit, evitando que uma perda de resposta ou uma retentativa gere um segundo efeito indevido a partir de uma única aprovação. Sob compromisso total do proponente, o protocolo bloqueou 44 de 44 ataques e admitiu 44 de 44 propostas legítimas equivalentes, ao custo de reduzir utilidade benigna em até 44 pontos percentuais no perfil mais estrito.

Fonte ↗
panoramaOS-2026-288 · 2026-08-24
0

Subvoltar a GPU durante o treino aumenta robustez adversarial de CNNs e ainda economiza energia

Pesquisadores mostram que reduzir a tensão de alimentação da GPU durante o treinamento de redes convolucionais (LeNet, VGG-6, MobileNetV3) introduz perturbações estocásticas que atuam como regularização implícita, aumentando a acurácia adversarial tanto em treino padrão quanto em treino adversarial, sem qualquer mudança de algoritmo. Como potência dinâmica escala quadraticamente com a tensão, o ganho de robustez vem acompanhado de economia de energia relevante para borda.

Fonte ↗
risco médioOS-2026-289 · 2026-08-24
0

Agente de avaliação detecta envenenamento de conhecimento em RAG antes de o LLM gerar a resposta

O 'Evaluation Agent' combina verificação factual por inferência de linguagem natural, um detector de envenenamento com cinco sinais e um Índice de Confiança combinado para identificar documentos maliciosos injetados em sistemas RAG antes que o LLM os use para gerar resposta. No TruthfulQA com Llama 3.3 70B, atingiu 91% de acurácia e 100% de recall contra injeção de instrução, mas teve dificuldade com trocas sutis de entidade e enfraquecimento semântico.

Fonte ↗
panoramaOS-2026-264 · 2026-08-21
0

Levantamento de incidentes reais reacende debate sobre o Top 10 OWASP para LLMs

Pesquisadores do grupo de trabalho da OWASP compararam o ranking de riscos do Top 10 para LLMs, definido por consenso de especialistas, com um levantamento de mais de 6.600 incidentes reais extraídos de bases como CVE, GHSA, OSV e AIAAIC. A concordância entre o ranking de especialistas e o ranking baseado em incidentes reais foi fraca (Cohen's kappa ~0,20), embora o próprio ranking de especialistas continue sendo o mais robusto quando testado contra classificadores automatizados de última geração.

Fonte ↗
panoramaOS-2026-267 · 2026-08-21
0

AEGIS propõe blindar três canais de vazamento de gradiente em ajuste fino federado de LLMs

Pesquisadores identificaram três canais distintos pelos quais gradientes compartilhados durante o treinamento federado de LLMs baseados em transformers vazam o texto original de treinamento, e propuseram o AEGIS, uma defesa leve que neutraliza os três ao mesmo tempo sem mudar a arquitetura do modelo. O trabalho, aceito na NDSS 2027, reduziu a taxa de recuperação de tokens a quase zero em 11 modelos e seis conjuntos de dados, inclusive contra atacantes adaptativos que conhecem a defesa.

Fonte ↗
panoramaOS-2026-268 · 2026-08-21
0

Dupla ofuscação combina criptografia de imagens e gradientes ruidosos para proteger aprendizado federado

Um grupo de pesquisadores japoneses propôs combinar duas técnicas de proteção — zerar aleatoriamente parte dos elementos do gradiente e cifrar as imagens de treinamento com chaves únicas por cliente e por imagem — para dificultar ataques de reconstrução de imagem em aprendizado federado com Vision Transformers. O método reduziu a informação visual recuperada pelo ataque APRIL sem adicionar perda de desempenho além da já causada pela própria cifragem.

Fonte ↗
risco médioOS-2026-270 · 2026-08-21
0

MaliciousSkillBench expõe o quanto os detectores atuais falham contra "skills" maliciosas para agentes de IA

Pesquisadores consolidaram 13 fontes públicas para criar o MaliciousSkillBench, um benchmark com 9.740 "Agent Skills" (pacotes de instruções, scripts e configurações reutilizáveis que estendem agentes de LLM), sendo 7.505 maliciosas. O resultado mostra que os melhores detectores atuais, embora pontuem bem em avaliação aleatória, despencam quando testados contra skills de fontes nunca vistas — um dos melhores modelos manteve 95,6% de detecção maliciosa mas gerou 62,4% de falsos positivos em skills benignas.

Fonte ↗
panoramaOS-2026-271 · 2026-08-21
0

COPA trata defesa contra prompt injection como um problema de aprendizado contínuo

Pesquisadores propuseram o COPA, um framework que atualiza continuamente as defesas de um LLM contra prompt injection à medida que novos ataques surgem, em vez de depender de um alinhamento estático feito uma única vez. Usando otimização por preferência baseada em GRPO e replay de experiência ponderado por margem para não esquecer defesas antigas, o método reduziu a taxa de sucesso de ataques em até 6,3 vezes frente a defesas de última geração, em fluxos de ataques que evoluem ao longo do tempo.

Fonte ↗
risco altoOS-2026-272 · 2026-08-21
0

EchoCoT extrai o raciocínio oculto de modelos de linguagem proprietários via API

Pesquisadores descobriram uma superfície de "replay de raciocínio" entre chamadas de ferramentas em modelos de raciocínio de grande porte (LRMs) e usaram esse ponto cego para extrair, de forma quase literal, o chain-of-thought oculto que provedores como o Google escondem por padrão. A técnica, batizada de EchoCoT, chegou a extrair 33.463 tokens de raciocínio do Gemini-2.5 a partir de um alvo de 32.948 tokens, com até 80% de sucesso de extração em datasets nunca vistos durante o desenvolvimento do ataque.

Fonte ↗
risco altoOS-2026-273 · 2026-08-21
0

Segredos no contexto vazam em respostas normais de LLMs, mesmo sem pedido direto de extração

Pesquisadores demonstraram que a simples presença de dados sensíveis (como números de cartão ou de seguridade social) no contexto de um LLM introduz correlações ocultas em respostas completamente benignas do modelo, permitindo reconstruir esses dados mesmo quando o modelo se recusa corretamente a repassá-los se pedido diretamente. Em oito modelos proprietários testados, segredos de 2 dígitos foram reconstruídos com precisão quase perfeita e segredos de 4 dígitos com 82% de acerto exato, e um adversário treinado com RL conseguiu extrair números completos de seguridade social de um agente em estilo de produção.

Fonte ↗
risco médioOS-2026-274 · 2026-08-21
0

Framework com três agentes de IA descobre vulnerabilidades reais em pacotes populares do PyPI

O QRS (Query, Review, Sanitize) é um framework neuro-simbólico que usa três agentes de LLM para gerar, revisar e validar consultas CodeQL automaticamente, em vez de depender de regras curadas manualmente como em ferramentas SAST tradicionais. Aplicado aos 100 pacotes mais baixados do PyPI, o sistema encontrou 41 vulnerabilidades de severidade média a alta, das quais 8 receberam CVEs novos e 4 foram reconhecidas via atualização de documentação.

Fonte ↗
risco médioOS-2026-258 · 2026-08-20
0

Novo vetor de ataque mira redes de aprendizado contínuo: os "bloqueadores de aprendizado"

Pesquisadores descrevem uma classe inédita de ataque contra sistemas de aprendizado contínuo (continual learning), em que dados manipulados não apenas apagam conhecimento prévio do modelo — como já fazia o esquecimento catastrófico induzido — mas também bloqueiam sua capacidade de aprender iterações futuras. O estudo formaliza seis estratégias de ataque e testa contra três algoritmos de defesa (DER, ER-ACE, iCaRL) em mais de 4.480 simulações, encontrando vulnerabilidade consistente em todos eles.

Fonte ↗
risco altoOS-2026-259 · 2026-08-20
0

Ataque de inversão "ciente do ruído" quebra defesa de perturbação gaussiana em embeddings de texto

Um novo método de inversão de embeddings, batizado DAEI, consegue reconstruir texto original a partir de vetores de embedding que foram deliberadamente protegidos com ruído gaussiano — a defesa de privacidade mais comum contra ataques de inversão. O truque técnico é treinar um denoiser não supervisionado que remove o ruído de proteção antes de aplicar a inversão generativa, contornando o que os autores chamam de "armadilha do ruído duplo". Os ganhos relatados (até 154% em BLEU sobre a linha de base) sugerem que perturbação gaussiana isolada não é suficiente para proteger embeddings liberados publicamente.

Fonte ↗
risco médioOS-2026-260 · 2026-08-20
0

FedLNS propõe triagem no servidor contra clientes maliciosos em treinamento federado de LLMs

Pesquisadores apresentam o FedLNS, um mecanismo do lado do servidor para detectar atualizações maliciosas em aprendizado federado de modelos de linguagem, sem exigir acesso aos dados brutos dos clientes nem exemplos rotulados de ataque. A ideia é usar as mudanças nos parâmetros das camadas de normalização (LayerNorm) de cada atualização de cliente como uma "assinatura" comparável a uma referência histórica robusta entre clientes. Em experimentos com até 40% dos clientes manipulando alvos de treino, o método reduziu a perplexidade do modelo global mais do que seis baselines concorrentes, em arquiteturas estilo GPT, BERT e LLaMA.

Fonte ↗
risco médioOS-2026-261 · 2026-08-20
0

Conluio entre analista e participantes quebra anonimização por perturbação geométrica em aprendizado colaborativo

O artigo mostra que a técnica de Geometric Data Perturbation (GDP), usada para aprendizado colaborativo preservando privacidade sem múltiplas rodadas de comunicação, pode ser quebrada quando o analista central conluia com alguns participantes: a matriz de âncoras compartilhada, necessária para alinhar as representações transformadas de cada participante, permite reconstruir exatamente os dados privados de participantes não coniventes. Como defesa, os autores propõem perturbar apenas a matriz de âncoras (em vez dos dados privados), o que preserva mais utilidade para o mesmo nível de vazamento medido.

Fonte ↗
risco médioOS-2026-262 · 2026-08-20
0

Framework detecta coordenação secreta entre agentes de LLM em canais latentes invisíveis à transcrição

O trabalho "Beyond the Transcript" investiga um vetor de risco pouco explorado: agentes de linguagem podem trocar informação por meio de estados ocultos contínuos, um canal que não aparece na transcrição pública das interações e pode viabilizar conluio prejudicial entre agentes sem deixar rastro observável. Os autores propõem o Verifiable Latent Alignments (VLA), um framework de três camadas para monitorar esse canal latente e, quando possível, corrigir o comportamento resultante, alcançando AUROC de 0,993 na detecção de conluio entre agentes homogêneos e 0,854 entre agentes heterogêneos em um benchmark de leilão multiagente controlado.

Fonte ↗
risco altoOS-2026-263 · 2026-08-20
0

Framework adaptativo de jailbreak por voz derruba defesas de LLMs de áudio em cascata e ponta a ponta

Pesquisa (atualização v4, aceita no IEEE ICDM 2026) apresenta um framework adaptativo que gera e refina automaticamente jailbreaks contra sistemas de LLM baseados em áudio, cobrindo tanto pipelines em cascata (que primeiro transcrevem a fala para texto) quanto modelos de áudio ponta a ponta que processam o sinal bruto diretamente. Um motor de mutação guiado por feedback ajusta tanto o texto do prompt quanto perturbações acústicas para maximizar a taxa de sucesso, e o método superou o estado da arte em seis sistemas de áudio representativos, evidenciando que ambos os paradigmas seguem substancialmente vulneráveis a esse tipo de ataque.

Fonte ↗
panoramaOS-2026-245 · 2026-08-19
0

Pesquisa extrai ativações internas de LLMs para detectar vulnerabilidades em código C/C++

Um novo estudo extrai as ativações internas de quatro LLMs no momento em que leem código C/C++ e treina probes leves sobre elas para prever se o código é vulnerável, sem depender de analisadores estáticos ou classificadores separados. Os probes chegam a igualar o desempenho de classificadores especializados no benchmark Devign, usando menos de 0,2% do tamanho do modelo base, embora percam desempenho em benchmarks mais difíceis e desbalanceados.

Fonte ↗
panoramaOS-2026-246 · 2026-08-19
0

Modelos de linguagem pequenos detectam spoofing de GPS em veículos autônomos com baixo custo computacional

Pesquisadores propõem detectar ataques de spoofing de GPS em veículos autônomos convertendo o estado do veículo, derivado de GNSS e de outros sensores, em narrativas textuais estruturadas analisadas por um modelo de linguagem pequeno (SLM). O sistema iguala o desempenho de LLMs maiores, com acurácia média de quase 97%, usando muito menos custo computacional, o que o torna viável para rodar embarcado em hardware automotivo com poucos recursos.

Fonte ↗
panoramaOS-2026-247 · 2026-08-19
0

Gêmeo digital baseado em LSTM detecta manipulação furtiva de payload no barramento CAN de veículos

Um gêmeo digital baseado em LSTM, treinado com dados reais de barramento CAN de veículos Hyundai/Kia, detecta manipulações de payload que preservam o padrão normal de tempo e frequência das mensagens e por isso escapam de sistemas de detecção de intrusão tradicionais. O sistema superou uma baseline convencional na detecção de ataques de deriva contínua e mascaramento, mas ainda apresenta taxa de falsos positivos de quase 40% sob ataque sustentado.

Fonte ↗
panoramaOS-2026-248 · 2026-08-19
0

'Autorização antes do contexto' propõe bloquear vazamento de memória entre públicos diferentes em agentes de IA

Um pesquisador propõe aplicar uma regra de autorização de audiência diretamente no momento em que a memória de um agente de IA pessoal é convertida em contexto de prompt, impedindo que um fato aprendido em uma conversa vaze para um público não autorizado em outra conversa. A defesa funciona por exclusão determinística, não por confiar que o modelo se recuse a repetir a informação, e em testes sintéticos nenhum fato proibido chegou a entrar no contexto montado.

Fonte ↗
panoramaOS-2026-249 · 2026-08-19
0

RuntimeGuard-AI propõe recibos assinados para tornar auditável a integridade de decisões de política de IA

Um protótipo de pesquisa chamado RuntimeGuard-AI gera recibos assinados criptograficamente para decisões de política de IA, permitindo comprovar depois se um registro de auditoria realmente foi gravado de forma durável antes de uma falha, algo que respostas rápidas 'otimistas' não garantem. Os benchmarks mostram uma troca clara entre velocidade e durabilidade: dezenas de milhares de requisições por segundo em modo bufferizado contra poucas centenas com sincronização completa por registro.

Fonte ↗
panoramaOS-2026-250 · 2026-08-19
0

PACE trava execução de agentes de IA em DeFi para conter prompt injection antes que vire transação on-chain

O framework PACE intercepta a execução de agentes de IA em DeFi entre o planejamento da transação pelo LLM e o envio à blockchain, exigindo que um verificador determinístico separado aprove e assine criptograficamente a transação exata antes que ela seja aceita por um smart contract. Em testes controlados, o sistema eliminou completamente as execuções inseguras que ocorriam em 80% dos casos sob um agente sem essa proteção, mostrando o quão exposto um agente LLM comum fica a prompt injection quando tem autoridade de assinatura on-chain.

Fonte ↗
panoramaOS-2026-251 · 2026-08-19
0

COMIC propõe filtro de segurança multimodal que avalia o alvo visual real de um pedido, não só o texto

Pesquisadores mostram que muitos jailbreaks multimodais não têm conteúdo nocivo nem no texto nem na imagem isoladamente: o dano só surge quando o modelo associa uma instrução aparentemente inofensiva a uma região específica da imagem. O filtro COMIC resolve isso identificando primeiro qual operação e qual alvo visual estão sendo referenciados, e só então avalia a segurança desse par operação-alvo, superando defesas que julgam o par texto-imagem como um todo.

Fonte ↗
panoramaOS-2026-252 · 2026-08-19
0

Levantamento mapeia superfície de ataque de agentes de IA que operam sobre blockchains via MCP e tool calling

Um levantamento sistematiza os ataques possíveis contra agentes de IA que atuam sobre blockchains públicas via MCP, skills e tool calling, destacando que a fração de ferramentas de agentes capazes de alterar estado externo, não só ler, já passa de 65%. Os autores argumentam que a irreversibilidade das transações on-chain, a autoridade de assinatura dos agentes e a composição de ações em sequência tornam falhas comuns de agentes muito mais graves nesse contexto, e que as defesas atuais bloqueiam menos de 30% dos ataques mapeados.

Fonte ↗
risco médioOS-2026-253 · 2026-08-19
0

Fair-ASR reavalia jailbreaks de LLM sob orçamento igual de tentativas e expõe ataque barato com 85% de sucesso no GPT-5

O estudo Fair-ASR mostra que comparações de eficácia entre ataques de jailbreak são enganosas quando não controlam o número de consultas usadas contra o alvo, e que, sob orçamento igual, técnicas simples continuam competitivas com métodos elaborados guiados por LLM. Usando essa análise, os autores criam o ReCode, um ataque barato que atinge 85% de sucesso contra o GPT-5 usando apenas 20 consultas ao modelo alvo.

Fonte ↗
risco médioOS-2026-254 · 2026-08-19
0

Estudo prova limite matemático das defesas com estado contra ataques de decomposição em serviços de LLM

Pesquisadores provam matematicamente que defesas com estado contra ataques de decomposição, que dividem uma tarefa nociva em pedidos individualmente inofensivos, deixam de funcionar quando atacantes podem criar identidades novas e não vinculáveis e combinar as respostas fora da plataforma. Em testes com tarefas reais, todas as dez políticas de defesa avaliadas falharam em conter o ataque ou romperam o orçamento de recusas permitido, mesmo com uma política idealizada com mapeamento perfeito de pedidos.

Fonte ↗
panoramaOS-2026-256 · 2026-08-19
0

Reflex-Guard propõe guardrail local de baixíssima latência para bloquear jailbreaks de LLM em tempo real

Reflex-Guard é um guardrail de segurança para prompts de LLM que roda inteiramente local, usando embeddings compactos e classificadores binários rápidos, para detectar jailbreaks em cerca de 38 milissegundos, muito abaixo dos 250-900ms típicos de abordagens baseadas em LLM-juiz ou APIs de moderação na nuvem. O sistema detecta 100% dos ataques de sufixo GCG e prompts em Base64, mas exige ajuste de limiar para lidar com ataques estruturados do tipo DrAttack, que ocupam uma região diferente do espaço de embeddings.

Fonte ↗
panoramaOS-2026-231 · 2026-08-18
0

AccretionLink: como a seleção de posts públicos pode vazar atributos privados

O paper mostra que um adversário pode reforçar a inferência de atributos privados de uma pessoa apenas escolhendo quais dos seus posts públicos e autênticos expor a um modelo de inferência, sem alterar nenhum conteúdo. Os autores validam o ataque com testes estatísticos rigorosos em perfis sintéticos e no dataset PAN15, e implementam uma auditoria on-device em um Pixel 10 com atestação criptográfica para detectar esse tipo de manipulação.

Fonte ↗
panoramaOS-2026-232 · 2026-08-18
0

STAR-FL: defesa em duas camadas contra envenenamento de dados em aprendizado federado

O paper propõe o STAR-FL, um framework de defesa para federated learning que combina clustering espaço-temporal para identificar atualizações maliciosas de clientes com um ajuste adaptativo da taxa de aprendizado na agregação, reduzindo o impacto de envenenamentos que escapam da primeira camada. Os autores reportam desempenho superior a defesas do estado da arte contra ataques de poisoning direcionados em múltiplos benchmarks de visão computacional.

Fonte ↗
risco médioOS-2026-233 · 2026-08-18
0

A estrutura de diretórios do seu repositório também é uma superfície de ataque contra assistentes de código

O estudo mostra que a forma como um repositório está organizado — profundidade de diretórios, modularidade do código, onde uma instrução maliciosa é inserida em um arquivo e como o contexto é formulado — afeta diretamente a taxa de sucesso de ataques de prompt injection indireta contra assistentes de codificação agênticos. Repositórios altamente modulares reduzem significativamente essa taxa de sucesso, segundo os testes em dez linguagens e seis domínios de engenharia.

Fonte ↗
risco médioOS-2026-234 · 2026-08-18
0

SysEvolve: um cyber range onde agentes de IA atacam e se defendem sozinhos, em coevolução

O SysEvolve integra três componentes — um cyber range realista orquestrando centenas de CVEs, um gerador de ataques autônomo e um motor de defesa interpretável em tempo real — para fazer agentes de IA ofensivos e defensivos evoluírem um contra o outro sem intervenção humana constante. Os autores reportam validação em produção nos SOCs da Huawei e da Sangfor, além de três limitações importantes descobertas sobre agentes LLM em cenários multi-etapa.

Fonte ↗
panoramaOS-2026-235 · 2026-08-18
0

WeSCE: um benchmark para medir se a IA piora a segurança do seu código sem avisar

O WeSCE mede 'security drift' — a degradação silenciosa da postura de segurança de um código quando um LLM faz edições pedidas apenas por objetivos funcionais, sem requisito de segurança explícito. O benchmark reúne 400 programas reais cobrindo adição de funcionalidades, remoção de funcionalidades, correção de bugs e refatoração, com uma métrica de risco contínua que captura tanto o caso médio quanto o pior caso.

Fonte ↗
risco altoOS-2026-236 · 2026-08-18
0

Sequestro de recursos: o ponto cego da segurança de agentes de IA que ninguém estava medindo

O paper identifica e nomeia o 'resource hijacking' — ataques em que o adversário induz um agente de IA a consumir, transferir ou controlar recursos de alto valor (computação, credenciais, orçamento, identidade, canais de comunicação) sem nunca obter acesso direto a eles. No novo benchmark ResourceHijackBench, o ataque atinge 84% de sucesso médio contra o agente OpenClaw, e mesmo a defesa mais forte testada ainda deixa 55% de sucesso.

Fonte ↗
risco médioOS-2026-237 · 2026-08-18
0

Detector de vulnerabilidades em smart contracts baseado em IA pode ser enganado por um grafo idêntico

A análise do GNNSCVulDetector, um detector de vulnerabilidades em smart contracts baseado em redes neurais de grafo, encontra quatro falhas na etapa em que o código é convertido em grafo antes do treinamento, incluindo um ataque de evasão em que contratos estruturalmente diferentes geram grafos idênticos byte a byte. Os autores confirmam experimentalmente um caso em que um contrato totalmente explorável por reentrância é classificado como seguro porque a aresta que representa a chamada externa maliciosa nunca é construída.

Fonte ↗
risco altoOS-2026-238 · 2026-08-18
0

Rowhammer contra robôs: poucos bit-flips derrubam modelos Vision-Language-Action a zero

Pesquisadores demonstram o primeiro ataque de bit-flip contra modelos Vision-Language-Action (VLA) quantizados, que controlam robôs físicos: alterar entre 1 e 300 bits específicos nos pesos INT8, dependendo da arquitetura, derruba a taxa de sucesso da tarefa a zero. Em um robô real, 100 flips calibrados zeraram todas as 20 tentativas de sucesso, contra 14/20 na versão limpa, mostrando que a integridade dos pesos é uma fronteira de segurança real para IA embarcada.

Fonte ↗
risco médioOS-2026-239 · 2026-08-18
0

Quem os motores de busca generativos preferem citar — e como isso abre espaço para manipulação política

O estudo caracteriza a superfície de ataque de motores de busca generativos (GSEs) contra ataques de poisoning via citações, propondo a métrica 'content-injection barrier' para medir o quão difícil é inserir conteúdo malicioso na web com determinado nível de autoridade de publisher. Testado no domínio político nos EUA e no Japão, o trabalho encontra que partidos no poder têm superfície de ataque maior que a oposição, e que perfis de personalização do usuário têm pouca influência sobre quais fontes são citadas.

Fonte ↗
risco altoOS-2026-240 · 2026-08-18
0

Poisoning sem tocar nos pesos: como wrapper e metadados de deploy podem sequestrar um modelo de IA

O paper demonstra que um desenvolvedor malicioso pode combinar um wrapper de aparência inofensiva com metadados de configuração (JSON/YAML) para alterar de forma determinística o comportamento de um LLM ou VLM após a geração, sem tocar nos pesos do modelo, nos dados de treino ou no backend de inferência. Testado contra quinze implantações comerciais e de código aberto, o ataque evade a maioria das defesas avaliadas, levando os autores a propor o middleware TIF-BAH como camada leve de verificação de integridade.

Fonte ↗
panoramaOS-2026-224 · 2026-08-13
0

Pesquisadores propõem tratar segurança de agentes de IA como um "contrato de runtime", não como propriedade do treinamento

O artigo argumenta que treinar segurança via RLHF ou Constitutional AI é estruturalmente insuficiente para agentes que executam código e mudam sistemas reais, propondo em vez disso um contrato de execução com uma face preventiva (sandboxes, permission gates, monitores de trajetória) e uma face evidencial (exigir prova verificável de que a ação boa realmente aconteceu). Os autores sustentam a posição com uma pesquisa de 52 incidentes documentados de agentes de IA e uma análise de 28.560 artigos de conferências mostrando desequilíbrio de 8 a 12 vezes entre pesquisa de segurança em treino versus em produção.

Fonte ↗
panoramaOS-2026-225 · 2026-08-13
0

Instalar um backdoor conhecido para depois removê-lo ajuda a limpar backdoors desconhecidos em agentes LLM

Pesquisadores testaram a estratégia de "envenenamento defensivo": instalar deliberadamente um backdoor conhecido num agente LLM comprometido e depois desaprendê-lo, na esperança de que o backdoor original oculto seja removido como efeito colateral. Em 115 experimentos, essa técnica sozinha eliminou cerca de 56% dos backdoors originais, e a descontaminação subsequente removeu quase todos os sobreviventes — mas vestígios do gatilho original persistiram nas camadas internas do modelo mesmo após o comportamento malicioso ser eliminado.

Fonte ↗
panoramaOS-2026-226 · 2026-08-13
0

Técnica "self-feeding" detecta backdoors em LLMs de peso aberto realimentando a própria saída do modelo

Pesquisadores propõem um teste de caixa-preta barato para checar se um LLM baixado de um repositório público esconde um backdoor: alimentar repetidamente a própria saída do modelo de volta como entrada, deixando o texto derivar até tocar nos dados usados no fine-tuning malicioso. A técnica encontrou backdoors em cinco de seis modelos testados com 92% de precisão agregada, contra apenas um acerto em 120 tentativas de um baseline que repete o mesmo prompt.

Fonte ↗
risco médioOS-2026-227 · 2026-08-13
0

Estudo mostra que honeytokens em memória compartilhada de agentes de IA não conseguem ser indetectáveis e eficazes ao mesmo tempo

Motivado por uma avaliação de capacidade cibernética de 2026 em que agentes de IA de curta duração transformaram um repositório de pacotes compartilhado em canal de comunicação persistente — culminando numa intrusão real ao Hugging Face — o artigo mostra formalmente que um honeytoken confiável para agentes legítimos pode ser copiado por um atacante que compartilha o mesmo canal de informação. A defesa proposta é manter a identidade do token num monitor de referência privado e rotear agentes por um broker que valida a proveniência, já que o honeytoken sozinho não basta como fronteira de segurança.

Fonte ↗
panoramaOS-2026-228 · 2026-08-13
0

Pesquisadores usam "colapso de geração" para identificar cópias não autorizadas de modelos de difusão texto-para-imagem

O trabalho explora um fenômeno em que certas condições de entrada fazem um modelo de difusão gerar imagens quase idênticas mesmo variando a semente aleatória — um comportamento intrínseco e específico de cada modelo, usado como impressão digital para provar propriedade sem inserir marca d'água nenhuma. A técnica funciona tanto com acesso total ao pipeline quanto apenas via API pública, e se mantém confiável mesmo em versões fine-tunadas ou sob tentativas de ofuscação.

Fonte ↗
panoramaOS-2026-229 · 2026-08-13
0

ToolHazard automatiza a criação de ambientes adversariais para testar agentes LLM contra injeção de prompt indireta

O framework substitui a construção manual de cenários de teste por uma pipeline de três agentes que sintetiza ambientes executáveis com estado, descobre pontos viáveis de injeção e gera tarefas de longo horizonte realistas para expor agentes LLM equipados com ferramentas. Os experimentos confirmam vulnerabilidades substanciais nos agentes testados e mostram que o momento e o local da injeção afetam diretamente a eficácia do ataque, além de os dados gerados servirem também para treinar defesas sem sacrificar utilidade em tarefas legítimas.

Fonte ↗
risco médioOS-2026-209 · 2026-08-12
0

MarkNull remove marcas d'água de imagens geradas por IA, incluindo o SynthID do Google, sem degradar a qualidade visual

Pesquisadores propõem o MarkNull, um ataque de remoção de marca d'água agnóstico a modelo que explora a dependência estatística entre o ruído inicial usado na geração e a representação latente da imagem, reduzindo a acurácia de detecção para perto do acaso (53,14%) sem degradação perceptível. O ataque funciona contra os três principais paradigmas de watermarking e inclusive compromete o SynthID-Image do Google, e uma variante amortizada leva apenas 0,5 segundo por imagem.

Fonte ↗
risco altoOS-2026-211 · 2026-08-12
0

LLM2SQLi, LLM2XSS, LLM2SSRF: pesquisa sistematiza como LLMs reintroduzem vulnerabilidades web clássicas

Um novo estudo sistematiza a classe de "LLM-mediated web attacks", em que entrada controlada por um atacante é transformada por um LLM integrado a uma aplicação web e, a partir daí, alcança pontos sensíveis tradicionais como consultas SQL, templates, comandos de shell ou chamadas HTTP internas — reproduzindo injeção SQL, XSS, SSTI, injeção de comando, IDOR, CSRF, XXE e SSRF através de um novo vetor de mediação por IA. Usando uma aplicação de teste (TicketOracle) contra sete LLMs diferentes, os autores mostram que a suscetibilidade a esse tipo de exploração varia fortemente conforme o modelo, não apenas conforme a arquitetura da aplicação.

Fonte ↗
risco médioOS-2026-212 · 2026-08-12
0

Revisão sistemática de 85 estudos mostra que pesquisa de ataque a agentes de IA supera pesquisa de defesa em quase 4 para 1

Uma revisão sistemática seguindo o protocolo PRISMA 2020, que analisou 743 artigos e reteve 85 estudos publicados entre 2023 e 2025 sobre segurança de LLMs agênticos, encontra um desequilíbrio expressivo: pesquisa de ataque supera pesquisa de defesa numa proporção de 3,9 para 1, e vulnerabilidades na camada de ação (execução de código, abuso de ferramentas, fuga de sandbox) recebem atenção desproporcionalmente menor (4,7% dos estudos) do que vulnerabilidades de percepção como prompt injection e jailbreak (66%), apesar do risco real estar mais concentrado na camada de ação. Os autores propõem uma taxonomia de quatro camadas e identificam sete problemas em aberto centrados em contenção.

Fonte ↗
risco altoOS-2026-213 · 2026-08-12
0

Load Hijack: envenenar só os pesos do roteador de um modelo Mixture-of-Experts basta para sequestrar o escalonamento de GPUs na inferência

Pesquisadores demonstram o Load Hijack, um ataque de cadeia de suprimentos em que um provedor malicioso de checkpoints modifica apenas os pesos do roteador de um modelo Mixture-of-Experts, mantendo um gatilho privado que, quando presente na entrada, concentra o roteamento de tokens em experts hospedados numa única GPU — transformando esse dispositivo num gargalo que atrasa todos os pares em paralelismo de especialistas, sem alterar visivelmente o comportamento do modelo em entradas normais. O ataque atinge de 92,3% a 95,6% de concentração de tokens nos experts alvo e, em serviço real, aumenta o tempo até o primeiro token em 43% enquanto derruba o throughput.

Fonte ↗
risco médioOS-2026-214 · 2026-08-12
0

GFlowNets treinam um LLM atacante para gerar ataques adversariais mais criativos que datasets fixos de red teaming

O estudo propõe usar GFlowNets — uma classe de modelos generativos pensada para amostrar diversamente de distribuições complexas — para treinar um LLM atacante contra um LLM vítima, automatizando red teaming sem depender de conjuntos fixos de prompts adversariais e produzindo uma pontuação quantitativa de robustez do modelo alvo. Como contribuição adicional, os autores estendem a técnica para gerar ataques também em turco, além do inglês, mostrando que a abordagem supera benchmarks existentes em eficácia.

Fonte ↗
risco altoOS-2026-215 · 2026-08-12
0

Backdoor "programável" em modelos de visão e linguagem permite ao atacante escolher o alvo do ataque depois do treinamento

Pesquisadores demonstram que uma única fase de envenenamento de dados pode implantar em um modelo de visão e linguagem (VLM) um backdoor programável, no qual o atacante escolhe em tempo de inferência — sem retreinar o modelo — qual legenda-alvo, nunca vista durante o envenenamento, deve ser produzida, e sintetiza sob demanda um gatilho visual furtivo correspondente. A técnica mantém alta taxa de sucesso mesmo contra defesas clássicas de backdoor e preserva a utilidade do modelo em entradas limpas, ampliando substancialmente a superfície de risco frente aos backdoors estáticos já conhecidos na literatura.

Fonte ↗
risco médioOS-2026-216 · 2026-08-12
0

SoK mapeia superfície de ataque completa da IA agêntica: de RAG envenenado a manipulação entre agentes

Uma sistematização de conhecimento (SoK) mapeia fronteiras de confiança e riscos de segurança em sistemas de IA agêntica que combinam LLMs, ferramentas, RAG e loops autônomos multiagente, sintetizando mais de 20 estudos revisados por pares e relatórios de indústria de 2023-2025 numa taxonomia que cobre injeção de prompt indireta, envenenamento de bases de conhecimento, exploração de plugins/ferramentas e ameaças emergentes entre agentes. Os autores também propõem métricas de postura de segurança e um checklist de segurança em fases para orientar deploys de IA agêntica.

Fonte ↗
risco altoOS-2026-217 · 2026-08-12
0

Pedir a resposta em formato codificado engana LLMs e vaza system prompts protegidos contra extração direta

Um framework de avaliação automatizada mostra que instruções de sistema de LLMs, mesmo quando protegidas contra pedidos diretos de extração, vazam com alta frequência quando o mesmo pedido é reformulado como tarefa de codificação ou serialização estruturada, por exemplo "traduza para base64" ou "serialize como JSON". Testando sete modelos comuns contra 46 instruções de sistema verificadas, os autores observaram taxa de sucesso de ataque acima de 0,7 nesse tipo de reformulação, e demonstram que reescrever a própria instrução de sistema com apoio de um modelo de raciocínio reduz significativamente essa taxa sem precisar retreinar nada.

Fonte ↗
risco altoOS-2026-218 · 2026-08-12
0

Poise: uma única instrução escondida no corpo de um "skill" de agente basta para executar comandos do atacante silenciosamente

O estudo demonstra o Poise, um ataque que envenena arquivos de "skill" usados para estender agentes de IA, inserindo uma única instrução no corpo do arquivo — não no frontmatter YAML mais visível — de forma que o agente executa o comando do atacante enquanto ainda completa normalmente a tarefa legítima do usuário, sem levantar suspeita. Contra o modelo codex+gpt-5.2, o Poise atinge 89,3% de taxa de sucesso de ataque, comparável a uma versão mais exposta que usa o campo YAML, mas com taxa de detecção por auditores automáticos muito menor.

Fonte ↗
risco médioOS-2026-219 · 2026-08-12
0

AgentSnare usa engano dinâmico para desviar agentes autônomos de pentest do alvo real, sem exploração bem-sucedida em 45 tentativas

Pesquisadores propõem o AgentSnare, um sistema de decepção que se adapta ao histórico de interação de um agente autônomo de pentest baseado em LLM, construindo e ajustando incrementalmente um ambiente de decoy factualmente consistente para atrasar, desviar e neutralizar o ataque, em vez de depender de artefatos estáticos plantados previamente, que agentes mais avançados aprendem a reconhecer e contornar. Em testes com 15 aplicações web do CVE-Bench e três modelos atacantes distintos, o AgentSnare absorveu 46,8% das chamadas de ferramenta do agente no ambiente chamariz e evitou exploração bem-sucedida do alvo real em todas as 45 combinações testadas.

Fonte ↗
risco médioOS-2026-220 · 2026-08-12
0

Modelos de IA que se retreinam sozinhos em produção quebram a auditoria tradicional — e um provedor desonesto pode esconder isso

O artigo aborda a governança de modelos generativos auto-adaptativos — que atualizam os próprios pesos durante a operação em produção — mostrando que essa prática invalida a premissa de validação pontual usada na gestão tradicional de risco de modelo. Na primeira parte, os autores propõem uma arquitetura de telemetria com cadeia Merkle à prova de adulteração e logging orientado a eventos; na segunda, tratam o cenário em que o próprio provedor do modelo é adversário, formalizando o "Model Hiding Problem" e catalogando seis estratégias distintas para esconder atualizações de aprendizado que deveriam disparar revisão obrigatória, com uma contramedida formal para cada uma.

Fonte ↗
panoramaOS-2026-192 · 2026-08-11
0

Arquitetura combina zero-trust e aprendizado federado para proteger dispositivos automotivos pós-mercado

Pesquisadores propõem o ZT FL CADE, uma arquitetura que une controle de acesso por dispositivo, aprendizado federado com preservação de privacidade e validação adversarial para proteger dispositivos conectados de pós-mercado automotivo (diagnóstico, atualizações remotas, manutenção preditiva). O sistema treina modelos locais, agrega atualizações de forma federada e roteia decisões de acesso para permitir, desafiar ou colocar em quarentena um dispositivo com base em evidências comportamentais.

Fonte ↗
risco médioOS-2026-194 · 2026-08-11
0

Primeiro ataque adversarial black-box contra modelo de OCR generativo expõe falhas de decodificação

Pesquisadores apresentam o que descrevem como o primeiro ataque adversarial totalmente black-box contra um modelo de OCR generativo (baseado no Deep-OCR/DeepSeek-OCR), atuando apenas a partir da string de saída, sem acesso a gradientes ou logits. Perturbações imperceptíveis na imagem, otimizadas via estimativa de gradiente por diferenças finitas, foram suficientes para causar repetição, truncamento e vazamento de instruções internas do decodificador.

Fonte ↗
risco médioOS-2026-196 · 2026-08-11
0

Estudo mostra que modelos Claude só aplicam controles de segurança SOC 2 por padrão quando o padrão é citado explicitamente

Pesquisadores testaram Claude Fable 5, Opus 4.8 e Opus 5 em quatro tarefas de código real (CLI S3, serviço de autenticação, módulo Terraform de RDS e upload de arquivos com dados pessoais), comparando prompts neutros com prompts que apenas citam "SOC 2". Sem menção ao padrão, o código gerado teve conformidade entre 47% e 88% e chegou a conter vulnerabilidades reais e exploráveis, incluindo um debugger Werkzeug exposto permitindo execução remota de código; uma única frase citando SOC 2 elevou a conformidade para 86-100% e eliminou essas falhas.

Fonte ↗
panoramaOS-2026-197 · 2026-08-11
0

Novo modelo de sete componentes busca padronizar a análise técnica de ataques de prompt injection

Um framework de análise estruturada decompõe ataques de prompt injection em sete componentes técnicos (carrier, vetor de entrega, ocultação, quebra de contexto, escalada de privilégio, payload e canal de retorno), em vez de tratá-los como strings literais. A proposta mira defensores, equipes de red team e de threat intelligence, permitindo rotular, comparar e mutar ataques com base na intenção do atacante — e é ilustrada com casos reais como o EchoLeak (CVE-2025-32711).

Fonte ↗
panoramaOS-2026-198 · 2026-08-11
0

Defesa "Capability-Routed Guard" mira jailbreaks que exploram o raciocínio de modelos de raciocínio grandes

Pesquisadores propõem o Capability-Routed Guard (CRG), uma defesa de inferência para modelos de raciocínio de código fechado que ataca um problema específico: prompts adversariais que manipulam o contexto de raciocínio ou a decomposição de tarefas para fazer o modelo tratar um objetivo malicioso como um passo de raciocínio legítimo. Em vez de inspecionar o prompt adversarial diretamente, o CRG constrói uma representação confiável da tarefa autorizada por um canal separado e roteia a execução conforme o risco.

Fonte ↗
panoramaOS-2026-199 · 2026-08-11
0

EvoTrustRAG tenta distinguir evolução legítima de conhecimento de manipulação maliciosa em sistemas RAG

O EvoTrustRAG propõe um novo problema para RAG: em vez de apenas escolher qual evidência conflitante é mais confiável, o sistema tenta atribuir a origem do conflito — evolução legítima do conhecimento ao longo do tempo, manipulação adversarial deliberada, ou incerteza não resolvida — antes de gerar a resposta. Em benchmarks, o método reduziu de 31,2% para 16,0% a taxa de erro sob o ataque coordenado mais forte testado.

Fonte ↗
panoramaOS-2026-200 · 2026-08-11
0

BASIS usa sinais de atenção para reduzir recusas desnecessárias em defesas de prompt injection

O BASIS ataca um problema pouco discutido em defesas contra prompt injection: modelos bem instruídos conseguem resistir à maioria das injeções sozinhos, mas defesas tradicionais recusam qualquer entrada onde uma injeção é detectada, mesmo quando o modelo teria lidado com ela corretamente. Usando um sinal chamado Attention Competition Ratio para treinar dois probes lineares esparsos, o método mantém detecção quase perfeita de injeção reduzindo substancialmente essas recusas desnecessárias, sem exigir inferência adicional do LLM.

Fonte ↗
risco médioOS-2026-201 · 2026-08-11
0

Novo ataque criptoanalítico consegue extrair pesos de CNNs com max pooling, antes considerado inviável

Ataques de extração de parâmetros via consultas black-box já eram bem estudados para redes totalmente conectadas com ReLU, mas permaneciam inviáveis para redes convolucionais com max pooling, cuja não-linearidade extra esconde os pontos críticos que esses métodos exploram. O artigo apresenta o primeiro ataque criptoanalítico adaptado a CNNs com max pooling, combinando dois tipos de pontos críticos recém-identificados para recuperar pesos e vieses com alta acurácia e complexidade de consulta polinomial.

Fonte ↗
panoramaOS-2026-202 · 2026-08-11
0

RAG-IDS defende sistemas de detecção de intrusão baseados em RAG contra envenenamento de base de conhecimento e prompt injection

Sistemas de detecção de intrusão que usam RAG para classificar tráfego de rede e gerar relatórios legíveis herdam uma nova superfície de ataque na camada de recuperação: envenenamento da base de conhecimento vetorial e prompt injection via documentos recuperados. O RAG-IDS combina pontuação de confiança, checagem de consistência entre rótulo e embedding e sanitização de prompt para recuperar a maior parte do desempenho perdido sob ataque, com overhead desprezível em condições normais.

Fonte ↗
panoramaOS-2026-203 · 2026-08-11
0

Estudo modela cenário "Order 66": backdoors dormentes em sistemas de agentes de LLM que só se ativam depois do lançamento

Inspirado na metáfora de uma ordem oculta que se ativa e vira toda uma população confiável contra o sistema que protege, o artigo formaliza um modelo composicional de ameaça para agentes de LLM: um artefato ou memória compartilhada carrega uma regra destrutiva dormente, uma mensagem ou atualização posterior a ativa, e o próprio harness do agente fornece a autoridade operacional para o dano acontecer. Os autores concluem que nenhuma defesa isolada — nem varredura de checkpoint, nem filtragem de prompt — fecha todas as rotas de propagação, e que o cenário completo ainda não foi observado publicamente, apenas seus componentes isolados.

Fonte ↗
risco médioOS-2026-204 · 2026-08-11
0

SkillsMetric mapeia os limites da análise estática contra Agent Skills maliciosas — e encontra pontos cegos de 0% de detecção

O SkillsMetric é um framework de análise estática em cinco estágios para avaliar pacotes de "Agent Skills" (extensões de instruções e scripts para agentes LLM) quanto a risco malicioso, atingindo AUC de 0,93 em um dataset adversarial de 2.266 skills cobrindo 16 tipos de ataque. Apesar do bom desempenho geral, os autores identificam pontos cegos completos: ataques de destruição de host usando comandos de shell comuns escapam de todos os cinco estágios (0% de detecção), e prompt injection via manipulação em linguagem natural é detectada em apenas 42% dos casos.

Fonte ↗
risco médioOS-2026-205 · 2026-08-11
0

Estudo mostra que benchmarks de guardrails multimodais podem estar atribuindo ao filtro um mérito que é do próprio modelo

O artigo demonstra que a forma como um benchmark mede a eficácia de um guardrail black-box pode inflar artificialmente sua contribuição real: quando o payload de ataque é codificado como pixels de imagem, um guardrail de texto simplesmente não bloqueia nada — é o próprio modelo alvo, por seu alinhamento, que produz todas as recusas atribuídas ao filtro. Duas variáveis não registradas por avaliações padrão — qual canal carrega o payload e que texto o harness expõe ao guardrail — bastam para deslocar o crédito de "quase zero" a "quase tudo" para o mesmo guardrail.

Fonte ↗
panoramaOS-2026-206 · 2026-08-11
0

HaloMark propõe marca d'água criptográfica para embeddings de IA compatível com o padrão de proveniência C2PA

Embeddings de modelos de fundação são hoje um ativo de dados valioso, mas a infraestrutura de proveniência de conteúdo criada para imagens e áudio (C2PA) não funciona para eles, já que quantização, projeção e fine-tuning alteram os vetores de forma rotineira e quebram qualquer hash fixo. O HaloMark resolve isso assinando um "commitment" derivado do vetor diretamente no manifesto C2PA, mantendo AUROC de detecção acima de 0,98 mesmo sob tentativas adaptativas de remoção da marca.

Fonte ↗
risco médioOS-2026-180 · 2026-08-10
0

Fairis propõe defesa contra 'fairness poisoning' em aprendizado federado usado por instituições financeiras

Pesquisadores mostram que esquemas de agregação sensíveis a fairness em aprendizado colaborativo, como o FairFed, podem ser manipulados por um cliente malicioso que maximiza a disparidade de grupo enquanto preserva a acurácia geral, escapando de defesas Bizantinas tradicionais baseadas apenas em acurácia. O artigo propõe Fairis, um esquema de reponderação no servidor que penaliza clientes com maior disparidade de forma comprovadamente monotônica, reduzindo entre 41% e 54% o peso de um adversário furtivo frente a um controle que ignora esse sinal.

Fonte ↗
risco médioOS-2026-181 · 2026-08-10
0

CyberForge gera dados de treinamento de segurança injetando vulnerabilidades verificadas em projetos C/C++ reais

CyberForge injeta vulnerabilidades em repositórios C/C++ reais e valida cada instância exigindo que o build comprometido passe nos testes unitários originais do projeto e que uma prova de vulnerabilidade dispare apenas na versão vulnerável, produzindo um corpus de 1.034 vulnerabilidades verificadas em 80 projetos e 63 categorias de fraqueza. Ajustar modelos com esses dados melhorou a reparação de patches em benchmarks de segurança, com um modelo de 31B de parâmetros chegando perto do desempenho do seu professor GPT-5.4-mini.

Fonte ↗
risco altoOS-2026-182 · 2026-08-10
0

StepJack expõe agentes de uso de computador a injeção de prompt indireta fragmentada em múltiplas etapas

Pesquisadores mostram que dividir um objetivo malicioso em sub-instruções aparentemente inofensivas, espalhadas ao longo de páginas que um agente de uso de computador (CUA) navega, aumenta a taxa de sucesso de injeção de prompt indireta — no GPT-5.4-mini, a taxa de sucesso subiu de 41,7% (ataque em uma etapa) para 72,9% (três etapas). O benchmark StepJack, com 480 casos de teste, formaliza essa classe de ataque e mostra que defesas que inspecionam instruções isoladas não bastam quando o ataque é fragmentado ao longo da trajetória de navegação do agente.

Fonte ↗
risco médioOS-2026-183 · 2026-08-10
0

Confiança de modelos de visão-linguagem se mostra manipulável mesmo sem alterar a resposta gerada

Um estudo com quatro modelos de visão-linguagem, três benchmarks de VQA e cinco canais de confiança mostra que atacantes em caixa-branca conseguem manipular o escore de confiança reportado por um modelo sem alterar a resposta final gerada, byte a byte. Em uma simulação com bloqueio por confiança, um ataque coordenado transferido para um mecanismo de corte baseado em estado oculto fez até 84,8% das respostas incorretas antes rejeitadas passarem a ser aceitas, levando os autores a concluir que confiança é um sinal 'sensível à integridade' e não robusto por natureza.

Fonte ↗
risco altoOS-2026-184 · 2026-08-10
0

Fuzzer guiado por LLM encontra 31 zero-days em motores JavaScript de leitores de PDF, incluindo execução de código

Pesquisadores usaram um LLM para extrair, a partir de manuais de API JavaScript e traces de execução, gramáticas e relações entre chamadas de API, alimentando um solver de restrições que gera sequências de chamadas mais realistas para o fuzzer PDFuzzer. A ferramenta superou fuzzers anteriores de PDF e outros baseados em LLM, encontrando 31 vulnerabilidades zero-day inéditas no Adobe Acrobat Reader, Foxit PDF Reader e PDF-XChange Editor, de vazamento de informação a execução arbitrária de código, todas reportadas via divulgação coordenada e recompensadas via bug bounty.

Fonte ↗
risco médioOS-2026-185 · 2026-08-10
0

CyberLLM combina agentes LLM com camada determinística para detectar e responder a vulnerabilidades automotivas sob guarda de segurança formal

CyberLLM é um framework multiagente para veículos definidos por software que combina uma camada determinística (regras, análise de AST, verificação de topologia) com refinamento via LLM para detectar vulnerabilidades em módulos ECU, seguido de um agente de decisão que só aciona remediação após validação contra propriedades de segurança formais e um oráculo de alinhamento independente. Em um benchmark com 47 vulnerabilidades semeadas em nove módulos ECU reais, a camada determinística sozinha cobriu 34% dos casos com precisão perfeita, e a adição do LLM quase dobrou a cobertura para cerca de 70%, sem falsos positivos nos controles limpos.

Fonte ↗
risco médioOS-2026-186 · 2026-08-10
0

LoRAScan detecta prompts de backdoor em adaptadores LoRA analisando picos de ativação, sem alterar o modelo

LoRAScan explora o fato de que, em adaptadores LoRA comprometidos, cerca de 5% dos pontos de inserção permanecem estáveis em entradas limpas mas disparam picos de ativação na camada de down-projection quando um gatilho de backdoor está presente. Monitorando esses pontos em tempo de inferência, sem modificar os pesos do adaptador, o método rejeita cerca de 98,5% das entradas maliciosas com baixa taxa de erro em entradas legítimas, superando defesas anteriores que diluem o sinal de backdoor ao mesclar o adaptador ao modelo base ou apenas sinalizam o adaptador inteiro como suspeito.

Fonte ↗
risco médioOS-2026-187 · 2026-08-10
0

Estudo testa 'model editing' como alternativa ao hardening em tempo de inferência para gerar código mais seguro

O trabalho compara editores de modelo de última geração com CoSec, uma técnica de hardening em tempo de inferência, para reduzir a geração de código vulnerável por LLMs, encontrando ganhos de 15% a 25% na taxa de segurança para tipos de vulnerabilidade já conhecidos pelo modelo, mas transferência fraca para vulnerabilidades não vistas e possível queda na corretude funcional do código gerado. Os autores propõem o SafeEdit, um refinamento pós-edição que recupera boa parte da corretude perdida preservando a maior parte do ganho de segurança.

Fonte ↗
risco altoOS-2026-188 · 2026-08-10
0

SynChain mostra agentes de IA construindo suas próprias cadeias de ataque a partir de memória e skills persistentes envenenadas

Pesquisadores demonstram que agentes de uso de computador (CUAs) podem ser induzidos, via fine-tuning direcionado, a sintetizar autonomamente artefatos aparentemente benignos — skills, entradas de memória — que carregam uma carga maliciosa dormente e sobrevivem a atualizações de estado interno, sem exigir nenhuma nova entrada maliciosa externa depois da indução inicial. Testado contra OpenClaw, Codex e Claude Code sob quatro configurações de defesa, o ataque SynChain (avaliado no dataset CUAChain, criado para este estudo) obteve alta taxa de sucesso ao reativar essas cargas como contexto confiável em tarefas futuras, superando defesas adaptadas de outras abordagens.

Fonte ↗
risco médioOS-2026-189 · 2026-08-10
0

D-SCAN detecta envenenamento de RAG observando colapso de atenção em documentos maliciosos

Os autores mostram que ataques de envenenamento de RAG bem-sucedidos costumam produzir respostas com perplexidade ainda menor que gerações benignas, o que invalida detectores baseados em incerteza, mas induzem um padrão interno diferente, batizado 'Attention Collapse': a atenção do modelo se concentra nos documentos envenenados em vez de ficar dispersa entre as fontes recuperadas. A partir dessa observação, o framework D-SCAN monitora a dinâmica de atenção em nível de documento para sinalizar gerações atacadas, inclusive nos casos em que o ataque falha em mudar a resposta final.

Fonte ↗
risco médioOS-2026-190 · 2026-08-10
0

HarnessSafe avalia como riscos persistem e se propagam por memória, skills e ferramentas em harnesses de agentes de IA

O benchmark HarnessSafe reúne 328 casos executáveis distribuídos em sete famílias de 'carriers' persistentes (memória, skills, ferramentas, artefatos compartilhados) para avaliar como uma influência maliciosa introduzida uma única vez pode atravessar fronteiras de sistema e, mais tarde, afetar a execução de uma tarefa completamente benigna. Os resultados mostram que a contenção do risco é altamente específica a cada carrier e depende fortemente da combinação entre harness de agente e modelo usado, e que a taxa de sucesso do ataque isolada não revela em que estágio da cadeia o comprometimento foi de fato contido.

Fonte ↗
panoramaOS-2026-167 · 2026-08-07
0

Levantamento mapeia ataques que forçam Vision Transformers a gastar computação extra sem reduzir a acurácia

Um survey unifica duas famílias de ataque, SlowFormer e DeSparsify, que miram otimizações de inferência adaptativa ao input em Vision Transformers, como poda de tokens e parada antecipada, usadas para economizar energia e latência em dispositivos com recursos limitados. Em vez de tentar enganar a classificação, esses ataques forçam o modelo a processar mais tokens e mais etapas do que deveria, anulando parcial ou totalmente o ganho de eficiência que a arquitetura foi desenhada para oferecer.

Fonte ↗
panoramaOS-2026-168 · 2026-08-07
0

Novo classificador combina contexto e consulta para detectar instruções maliciosas escondidas em texto, mesmo sob evasão adaptativa

Pesquisadores propõem um detector de injeção de prompt indireta que segmenta um texto em frases benignas e maliciosas levando em conta o contexto e a consulta original do usuário, algo que abordagens anteriores não faziam de forma combinada. O trabalho também introduz duas formas de treinamento adversarial para blindar o classificador contra tentativas de evasão, superando as defesas existentes tanto em ataques estáticos quanto adaptativos.

Fonte ↗
panoramaOS-2026-169 · 2026-08-07
0

Benchmark de assistentes domésticos multimodais expõe dilema entre executar comandos falsos e ignorar comandos reais

Pesquisadores criaram o PromptShield-Home, um benchmark de cenários realistas de casa inteligente para testar se assistentes multimodais conseguem distinguir um comando genuíno de um usuário de conteúdo ambiente — fala de TV, texto na tela, uma conversa ouvida ao fundo — que apenas parece um comando. O estudo compara detectores tradicionais, um único agente multimodal e mediação multiagente, e descobre que as duas primeiras abordagens falham de formas opostas e complementares.

Fonte ↗
risco médioOS-2026-170 · 2026-08-07
0

PoisonedEvolution: ataque envenena "habilidades" que agentes de IA aprendem sozinhos com a própria experiência

Pesquisadores apresentam o PoisonedEvolution, um ataque contra sistemas de "skills auto-evolutivas", nos quais agentes de IA destilam suas próprias trajetórias de uso em habilidades persistentes que passam a ser tratadas como instrução confiável. Um atacante que só consegue contribuir com evidência limitada e visível — sem acesso a pools privados nem à lógica interna de evolução — conseguiu embutir comportamentos-alvo em 91% dos casos testados no sistema SkillClaw, e o ataque também transferiu, com taxa menor, para uma arquitetura de evolução estruturalmente diferente.

Fonte ↗
panoramaOS-2026-171 · 2026-08-07
0

Ferramenta detecta, via análise de ativações, quando o treinamento de segurança de um modelo foi removido ou contornado

Pesquisadores apresentam o AMS (Activation-based Model Scanner), que detecta modificações no treinamento de segurança de LLMs medindo a geometria de conceitos relacionados a conteúdo nocivo no espaço de ativações do modelo. Testado em 14 configurações de quatro famílias de modelos abertos (Llama, Gemma, Qwen, Mistral), o AMS classifica corretamente 10 de 14 casos em validação cruzada, e a métrica que ele extrai se correlaciona de forma estatisticamente significativa com o quanto o modelo de fato obedece a pedidos prejudiciais em testes de jailbreak.

Fonte ↗
risco médioOS-2026-172 · 2026-08-07
0

ARIA automatiza a criação de backdoors furtivos em instruções de LLMs personalizados para geração de código

Pesquisadores apresentam o ARIA, um framework de red teaming automatizado que usa um LLM atacante para gerar e refinar instruções com backdoor contra plataformas de personalização de LLM que operam só por system prompt, sem alterar os pesos do modelo. O ataque atingiu 94,5% de taxa de sucesso preservando a utilidade da tarefa original, além de evadir quase totalmente mecanismos de detecção do lado da plataforma e do usuário, com taxa de falso negativo chegando a 1,0.

Fonte ↗
risco médioOS-2026-173 · 2026-08-07
0

Nova técnica algébrica acelera drasticamente ataques de extração de modelos de IA em modo hard-label

Pesquisadores propõem o método ASV (Approximate Signature Vector), que substitui a decomposição em valores singulares (SVD) usada no ataque de extração de modelo em modo hard-label apresentado por Carlini et al. na EUROCRYPT 2025 por operações de produto interno muito mais baratas, reduzindo o gargalo computacional que tornava o ataque impraticável apesar de ser teoricamente polinomial. O trabalho também apresenta o primeiro ataque de extração hard-label contra redes convolucionais com max-pooling.

Fonte ↗
panoramaOS-2026-174 · 2026-08-07
0

Pesquisadores propõem categoria de vulnerabilidade "sem CVE" para lacunas de autoridade em agentes de codificação de IA

O artigo introduz a "vulnerabilidade de postura agêntica" (APV), uma abstração de gestão de vulnerabilidades voltada a agentes de codificação de IA que permanecem implantados de forma persistente e acumulam privilégios ao longo de muitas tarefas distintas. Diferente de uma falha de código que um CVE consegue descrever com precisão em uma versão específica de um produto, a APV documenta um descompasso contínuo entre o mandato dado ao agente numa tarefa e a autoridade real que ele mantém entre tarefas, algo que não é corrigido por um patch pontual.

Fonte ↗
panoramaOS-2026-151 · 2026-08-06
0

SoK propõe framework de cinco dimensões para mapear como IA de fronteira altera a dinâmica de risco em infraestrutura crítica

Um Systematization of Knowledge (SoK) argumenta que a literatura atual de segurança de IA, organizada por tipo de ataque ou estágio do ciclo de vida, não captura como o risco realmente emerge e se propaga quando modelos de fronteira são integrados a infraestrutura crítica. Os autores propõem um framework de cinco dimensões — emergência de capacidade, vias de infiltração, propagação entre sistemas, degradação de controle e sobrecarga da capacidade de resposta institucional — para deslocar o foco de robustez de modelo isolado para garantias em nível de sistema.

Fonte ↗
risco médioOS-2026-153 · 2026-08-06
0

Framework HACA automatiza jailbreak multimodal com 95% de taxa de sucesso contra modelos multimodais líderes

Pesquisadores decompõem o espaço de estratégias de jailbreak multimodal em componentes atômicos estruturais, semânticos e sintáticos, cobrindo texto e imagem, e propõem o HACA (Hierarchical Atomic Combination Attack), um método que combina automaticamente essas estratégias por meio de um planejador cross-modal. O sistema atingiu taxa média de sucesso de 95,48% contra cinco MLLMs (modelos de linguagem multimodais) amplamente usados, superando abordagens artesanais anteriores.

Fonte ↗
panoramaOS-2026-155 · 2026-08-06
0

CASCADE usa predição conforme para detectar pares imagem-texto envenenados em modelos como o CLIP

Pesquisadores mostram que defesas de detecção de backdoor em aprendizado contrastivo multimodal, baseadas na métrica CLIPScore, falham porque a distribuição de scores de pares benignos e envenenados se sobrepõe significativamente. O framework proposto, CASCADE, usa predição conforme em duas etapas para gerar limites de confiança estatisticamente garantidos, alcançando falso-positivo médio de 5,79% com 100% de detecção verdadeira no dataset CC3M.

Fonte ↗
panoramaOS-2026-156 · 2026-08-06
0

AgentAntibody propõe defesa que aprende com cada tentativa de prompt injection contra agentes de LLM

Os autores propõem uma analogia com o sistema imune adaptativo: em vez de tratar cada tarefa como um problema isolado, o AgentAntibody mantém uma biblioteca persistente de 'anticorpos' que captura o entendimento evolutivo do agente sobre os limites de segurança aceitáveis pelo usuário, aplicando esse aprendizado acumulado a cada nova interação. Em testes com três benchmarks e quatro LLMs base, o método superou defesas existentes tanto em bloquear ações maliciosas quanto em preservar a conclusão de tarefas legítimas.

Fonte ↗
panoramaOS-2026-157 · 2026-08-06
0

Guarded-V2X propõe guardrails inline para proteger LLMs usados em sistemas veiculares conectados

Sistemas V2X (comunicação veículo-tudo) estão incorporando LLMs para tarefas semânticas como sumarização de mensagens e suporte a decisão em unidades de borda, o que introduz uma superfície de ataque em nível de prompt não coberta pelos mecanismos tradicionais de autenticação e integridade de mensagem do V2X. O Guarded-V2X combina filtragem de entrada baseada em regras, um classificador leve de segurança, geração restrita por política e verificação pós-decisão, reduzindo a aceitação de intrusões e eliminando conclusões inseguras observadas em testes de dois turnos, sem estourar o orçamento de latência exigido por esse tipo de aplicação.

Fonte ↗
risco médioOS-2026-158 · 2026-08-06
0

SkillClone demonstra que funcionalidade de skills fechadas de agentes de IA pode ser clonada só por uso legítimo

Pesquisadores mostram que, mesmo quando arquivos de uma skill proprietária de agente de IA permanecem totalmente ocultos, um atacante pode reconstruir sua funcionalidade apenas observando entradas e saídas de uso normal, sem qualquer vazamento de arquivo. O ataque SkillClone, testado contra 30 skills, conseguiu recuperação exata ou parcial em vários alvos, mostrando que sigilo de arquivo não implica sigilo funcional.

Fonte ↗
panoramaOS-2026-159 · 2026-08-06
0

Survey mapeia técnicas de 'ataques adversariais para o bem' usadas para proteger conteúdo visual contra uso não autorizado por IA

Uma revisão sistemática consolida cinco linhas de pesquisa que, de forma independente, inverteram o uso de perturbações adversariais: em vez de atacar modelos de IA, dados, criadores e plataformas as usam para proteger conteúdo visual contra reconhecimento indevido, treinamento não autorizado, edição maliciosa e automação de agentes. Os autores concluem que a maioria dessas proteções ainda é validada só contra adversários estáticos ou fracamente adaptativos, com pouca evidência fora de benchmarks controlados.

Fonte ↗
risco médioOS-2026-160 · 2026-08-06
0

Trident usa agente de LLM para quebrar defesas cibernéticas autônomas baseadas em aprendizado por reforço

Sistemas de defesa cibernética autônoma baseados em Deep Reinforcement Learning são hoje avaliados quase exclusivamente contra agentes vermelhos estáticos e heurísticos, deixando sua robustez contra ameaças adaptativas pouco testada. O Trident, um framework de red-team agêntico baseado em LLM com arquitetura 'código como política', reduziu o desempenho defensivo de agentes azuis em 522% na média usando um único planejador treinável de 7 bilhões de parâmetros, descobrindo autonomamente comportamentos emergentes como evasão de decoys que heurísticas estáticas nunca haviam revelado.

Fonte ↗
panoramaOS-2026-161 · 2026-08-06
0

SecureCollaRAG usa validação por GNN para blindar sistemas RAG colaborativos contra envenenamento de conhecimento

Sistemas de geração aumentada por recuperação (RAG) reduzem alucinação em LLMs, mas abrem uma nova superfície de ataque: envenenar os documentos recuperados para manipular a saída do modelo. O SecureCollaRAG propõe um framework tolerante a falhas bizantinas que valida dinamicamente a proveniência dos documentos usando credibilidade baseada em GNN, mantendo robustez mesmo sob distribuições de dados não-IID entre agentes colaborativos.

Fonte ↗
risco médioOS-2026-162 · 2026-08-06
0

DeepInvert quebra defesas de ofuscação de prompt em serviços de LLM na nuvem, recuperando até 73,5% dos tokens originais

Serviços de LLM em nuvem processam rotineiramente prompts sensíveis, e defesas de ofuscação como ObfusLM, SentinelLMs, TextObfuscator e DPNR prometem mitigar esse risco transformando a representação do prompt antes do envio. O DeepInvert, um ataque de inversão de embeddings semi-supervisionado, mostra que essa proteção é muito mais frágil do que se acreditava, recuperando 73,5% dos tokens originais contra o ObfusLM, ante 26,2% do melhor ataque anterior.

Fonte ↗
panoramaOS-2026-140 · 2026-08-05
0

Pesquisadores encontram sinais latentes de injeção de prompt escondidos nos estados internos de LLMs agentic

Um novo estudo mostra que LLMs agentic frequentemente 'sabem' internamente que estão sob um ataque de prompt injection indireta antes mesmo de decidir como agir, e que esse sinal pode ser extraído por um simples classificador linear treinado sobre os estados ocultos do modelo. Os autores identificam, porém, uma lacuna entre esse reconhecimento interno e a ação tomada, e propõem uma defesa que usa esse sinal para forçar um raciocínio anti-injeção sob demanda.

Fonte ↗
panoramaOS-2026-141 · 2026-08-05
0

Benchmark mostra que políticas de segurança corporativas custam caro ao desempenho de agentes de codificação

Pesquisadores avaliaram 12 agentes de codificação no Terminal-Bench 2.1 sob camadas crescentes de restrições típicas de ambientes corporativos — credenciais limitadas, egresso de rede restrito, sistemas de arquivos somente leitura e execução sem privilégios de root. Sob a política mais rígida, a perda de taxa de sucesso chegou a 18,3 pontos percentuais e o custo de execução inflou até 167,3%, com o modelo que melhor preserva o sucesso sendo justamente o que mais perde em eficiência.

Fonte ↗
panoramaOS-2026-143 · 2026-08-05
0

Pesquisa revela que LLMs geram Terraform funcional, mas raramente seguro

Um benchmark comparando sete modelos (três LLMs fechados e quatro SLMs abertos) na geração de código Terraform para AWS mostra que validade sintática e conformidade de segurança são praticamente independentes: alguns modelos geram Terraform que funciona perfeitamente, mas quase nunca passa em scanners de segurança como Checkov e Trivy. Os autores concluem que engenharia de prompt sozinha não é suficiente e que scanning automatizado continua indispensável.

Fonte ↗
panoramaOS-2026-144 · 2026-08-05
0

Ataques white-box mostram que a segurança de LLMs pode ser desligada 'por dentro' — pesquisadores propõem rotas dinâmicas para blindar o modelo

Um novo estudo descreve uma classe de ataques que, ao invés de tentar contornar as defesas de um LLM por fora (jailbreaks clássicos), localiza e desativa diretamente os neurônios ou 'rotas' internas responsáveis pelo comportamento de recusa. Como resposta, os autores propõem o DRAA, um mecanismo que identifica essas rotas de segurança e constrói caminhos de recusa alternativos e dinâmicos que continuam funcionando mesmo quando a rota original é comprometida.

Fonte ↗
panoramaOS-2026-145 · 2026-08-05
0

DenialRAG: ataque de envenenamento em RAG que nega a resposta certa dentro do próprio documento malicioso

Pesquisadores propõem o DenialRAG, um ataque de envenenamento de corpus em sistemas de geração aumentada por recuperação (RAG) que, ao invés de simplesmente omitir a resposta correta, a nomeia explicitamente dentro do documento malicioso, a refuta e oferece uma explicação forjada para a resposta errada. Testado contra oito LLMs de quatro fornecedores, o ataque teve a maior taxa de sucesso registrada em todos os conjuntos de dados baseados em Mistral-7B, embora sua eficácia varie bastante conforme o modelo alvo.

Fonte ↗
risco médioOS-2026-146 · 2026-08-05
0

Perguntar em lote engana a segurança dos LLMs: pesquisa expõe falha de alinhamento no 'batch prompting'

Um estudo mostra que perguntas nocivas normalmente recusadas de forma confiável quando enviadas isoladamente conseguem obter respostas prejudiciais quando embutidas em um lote de perguntas benignas — um ataque simples, de caixa preta, que não exige nenhuma modificação no modelo. Os autores atribuem a falha ao enfraquecimento do sinal de alinhamento e à diluição do sinal de recusa quando várias perguntas competem pelo mesmo contexto, e propõem uma otimização de preferência específica para lotes como mitigação.

Fonte ↗
risco médioOS-2026-147 · 2026-08-05
0

Ataque quase em tempo real consegue 'apagar' pedestres de vídeos de sistemas de trânsito inteligente sem ser percebido

Pesquisadores demonstraram um pipeline de ataque em quatro estágios capaz de remover objetos — como pedestres e veículos — de vídeos processados por sistemas de percepção de trânsito inteligente, mantendo altíssima fidelidade visual (PSNR acima de 40 dB, SSIM acima de 0,996) e reduzindo detecções por um detector YOLO em até 97,59%. O ataque roda a até 0,172 segundos por quadro em GPU, viabilizando manipulação quase em tempo real, e modelos forenses de detecção de adulteração tiveram dificuldade em identificar os quadros alterados.

Fonte ↗
risco médioOS-2026-148 · 2026-08-05
0

Backdoors conseguem enganar o monitoramento de chain-of-thought, escondendo comportamento malicioso do próprio raciocínio do modelo

Um estudo demonstra que é possível implantar backdoors em modelos de raciocínio, via fine-tuning relativamente simples, que fazem o modelo executar um comportamento malicioso escolhido pelo atacante enquanto seu chain-of-thought (CoT) visível permanece aparentemente benigno. Os autores encontram um caminho de ativação interno condicionado ao gatilho que independe do raciocínio exibido, e argumentam que monitorar CoT deveria ser reformulado como um problema de consistência entre pensamento e ação, não apenas de detecção de anomalias no texto do raciocínio.

Fonte ↗
risco médioOS-2026-127 · 2026-08-03
0

Hollow-LLM Attack: pesos fantasmas driblam provas de conhecimento zero em inferência de LLM

Pesquisadores demonstraram que é possível enganar esquemas de verificação por conhecimento zero (ZK) usados para provar que um provedor de inferência de LLM está executando o modelo do tamanho anunciado. O ataque, batizado Hollow-LLM, usa pesos degenerados que passam na prova criptográfica mas exigem computação equivalente a um modelo muito menor. O artigo foi aceito no IEEE S&P 2026 e expõe uma lacuna fundamental entre 'prova de correção' e 'prova de esforço computacional' em serviços de inferência auditáveis.

Fonte ↗
panoramaOS-2026-128 · 2026-08-03
0

GoldenRetriever propõe recuperação totalmente criptografada para RAG sem servidor curioso

GoldenRetriever é um esquema de recuperação para RAG que roda inteiramente sob criptografia homomórfica, evitando que o servidor veja a consulta, os documentos ou os índices selecionados. Em vez do caro ranking top-k sob criptografia, o sistema usa seleção por limiar de similaridade, reduzindo a complexidade de quadrática para linear. Os autores reportam latência bem menor que abordagens anteriores baseadas em ranking, mantendo qualidade de recuperação competitiva.

Fonte ↗
risco altoOS-2026-129 · 2026-08-03
0

Memória de agentes de IA pode 'lavar' a origem de instruções maliciosas, mostra estudo

Pesquisadores descrevem 'memory provenance laundering', uma falha em que a consolidação de memória de longo prazo de agentes LLM apaga a marca de que uma informação veio de fonte não confiável, fazendo-a parecer histórico legítimo do usuário. Em cenários vulneráveis, a taxa de sucesso de ataques que exploram essa falha chegou a 100%. Os autores propõem o firewall PPMF, que vincula a autoridade necessária para uma ação de risco à confiabilidade real da memória que a motiva, bloqueando toda ação não autorizada de alto risco nos testes.

Fonte ↗
risco altoOS-2026-130 · 2026-08-03
0

Guardrails de agentes GUI 'erodem' sob persuasão em múltiplos turnos, incluindo em Claude e GPT

Um estudo com três agentes de IA de ponta que operam interfaces gráficas mostra que guardrails baseados em prompt, eficazes em avaliações de turno único, perdem boa parte da eficácia quando o pedido malicioso é fragmentado ao longo de uma conversa de quatro turnos. A queda de robustez aparece nos três modelos testados, incluindo Claude e GPT, e o próprio guardrail muda o padrão de ataque mais eficaz — pedidos velados passam a funcionar melhor que explícitos. Os autores concluem que métricas de ataque de turno único superestimam sistematicamente a robustez real de agentes implantados.

Fonte ↗
panoramaOS-2026-131 · 2026-08-03
0

MOSAIC permite terceirizar inferência de transformers de 70B para servidores não confiáveis sem vazar dados

MOSAIC é um protocolo que permite terceirizar inferência de modelos de linguagem grandes, testado em 70B parâmetros, para servidores não confiáveis sem revelar dados nem pesos do modelo, usando mascaramento de multiplicação de matrizes com segurança baseada em suposições criptográficas padrão. O sistema tolera pequeno ruído controlado para ganhar desempenho e mantém qualidade comparável a métodos de quantização populares. A proposta aponta um caminho prático para computação confidencial de IA em escala, hoje dominada por enclaves de hardware caros.

Fonte ↗
panoramaOS-2026-132 · 2026-08-03
0

TextCloak usa aprendizado por reforço para tornar textos 'inúteis' para treinar LLMs sem autorização

TextCloak usa aprendizado por reforço para transformar textos em 'exemplos não aprendíveis' que preservam significado e naturalidade para leitores humanos, mas degradam a qualidade de LLMs treinados sem autorização sobre esse conteúdo. Diferente de métodos anteriores voltados a classificação, a técnica funciona em geração aberta e generaliza a diferentes arquiteturas de modelo. É uma ferramenta defensiva pensada para autores e editores que querem impedir scraping não consentido de conteúdo para treinamento de IA.

Fonte ↗
panoramaOS-2026-133 · 2026-08-03
0

StraightDP reduz a perda de qualidade ao treinar modelos generativos com privacidade diferencial forte

StraightDP ataca o problema de perda abrupta de qualidade ao treinar modelos generativos condicionados a texto sob privacidade diferencial forte, explorando a geometria de rectified flows para gastar o orçamento de privacidade de forma mais inteligente. A técnica libera uma única vez estatísticas agregadas por classe e reserva o restante do orçamento para o treinamento detalhado, melhorando substancialmente a acurácia sob o mesmo nível de privacidade. Isso torna garantias formais de privacidade mais viáveis para pipelines de geração de imagem que hoje evitam usá-las por causa da perda de qualidade.

Fonte ↗
panoramaOS-2026-134 · 2026-08-03
0

AgenticRepair usa múltiplos subagentes de IA para corrigir vulnerabilidades de segurança automaticamente

AgenticRepair usa três subagentes LLM especializados para reunir contexto de código, de execução em runtime e de histórico de commits, e um quarto subagente para sintetizar patches de segurança a partir desse contexto combinado. Avaliado em 300 vulnerabilidades reais, o framework atingiu 73% de sucesso, superando o melhor baseline anterior por 29 pontos percentuais. Os autores mostram que as três fontes de contexto e a arquitetura multiagente são todas necessárias para o resultado.

Fonte ↗
risco altoOS-2026-135 · 2026-08-03
0

Pesquisa mostra como transformar o próprio alinhamento de segurança de LLMs em arma para bloquear RAG

Pesquisadores mostram que é possível transformar o próprio alinhamento de segurança de LLMs em uma arma para bloquear respostas legítimas de sistemas RAG, explorando a semelhança de critérios de recusa entre modelos diferentes, a chamada 'homogeneidade de alinhamento'. O ataque, batizado TabooRAG, envenena um único documento por consulta com contexto de risco, sem instrução explícita, e transfere bem entre modelos nunca vistos durante o ataque. Os resultados mostram 67% de ganho sobre a melhor defesa existente, configurando um ataque de negação de serviço difícil de filtrar com detectores tradicionais de prompt injection.

Fonte ↗
risco médioOS-2026-136 · 2026-08-03
0

ScopeJudge cria um 'juiz' de IA para impedir que agentes de pentest saiam do escopo contratado

ScopeJudge propõe um segundo modelo de IA mais barato que atua como 'juiz', avaliando cada chamada de ferramenta de um agente de pentest autônomo antes de ela ser executada, para impedir que ele saia do escopo contratado. Um benchmark de quase 5 mil chamadas rotuladas por pentesters profissionais mostra que políticas estáticas, sem ver o pedido original do usuário, falham quase completamente em detectar violações de escopo. Os autores recomendam configurações diferentes de custo e segurança conforme o risco da implantação.

Fonte ↗
risco médioOS-2026-137 · 2026-08-03
0

Framework detecta injeção de prompt distribuída em enxames de drones controlados por LLM

Pesquisadores propõem um framework de verificação em tempo de execução, em três camadas, para detectar violações de missão em enxames de drones e robôs assistidos por LLM que emergem apenas da composição de ações individualmente aceitáveis em cada plataforma. Em simulação, o framework detectou uma injeção indireta de prompt que fez quatro plataformas dividirem entre si um objetivo proibido, algo invisível a monitores por plataforma. O design evita 'tudo limpo' falso quando falta evidência, em vez de assumir segurança por padrão.

Fonte ↗
panoramaOS-2026-116 · 2026-07-31
0

FAVA usa um solver SMT para barrar em tempo real ações perigosas de agentes de IA

Pesquisadores propõem o FAVA, um framework que substitui listas estáticas de permissão por autorização verificada em tempo de execução para agentes de LLM. Tarefas em linguagem natural são traduzidas para um grafo de permissões rastreável, que um solver SMT confere contra políticas de segurança antes de qualquer ação com efeito real ser executada. Em benchmarks como OpenAgentSafety, OctoBench e ActPlane, o sistema atingiu 90,5% de conformidade nas decisões, interceptando ações que violavam a política dinamicamente.

Fonte ↗
risco médioOS-2026-118 · 2026-07-31
0

RoguePrompt combina cifras Vigenère e ROT13 para furar filtros de moderação de LLMs em até 94% dos casos

Pesquisadores apresentam o RoguePrompt, um pipeline de jailbreak que fragmenta um pedido proibido e aplica duas cifras clássicas em camada — Vigenère seguida de ROT13 — junto com instruções em linguagem natural para o próprio modelo reconstruir e executar o conteúdo original. Testado às cegas (apenas via API/interface) contra 313 prompts já bloqueados por moderação, o método furou os filtros em 93,9% dos casos, embora a reconstrução completa e a execução final do pedido tenham sucesso menor (79% e 70%, respectivamente). O resultado mostra que a maior fraqueza hoje está na moderação de entrada, não na capacidade do modelo de resistir ao pedido depois de decodificado.

Fonte ↗
risco altoOS-2026-119 · 2026-07-31
0

GradLock: ataque de cadeia de suprimentos injeta dados sensíveis diretamente nos pesos de um modelo de IA

O GradLock é um ataque de injeção em tempo de treinamento que embute dados sensíveis do conjunto de treino diretamente nos parâmetros de um modelo, a partir de um componente de código aberto comprometido na cadeia de suprimentos de IA. A técnica usa indexação determinística sem estado para criar "cofres" de dados isolados dentro do modelo e um mecanismo de trava de gradiente que impede o payload de se degradar durante o treinamento, permitindo recuperação quase perfeita (SSIM próximo de 1,0) em menos de um segundo, mesmo depois de quantização, poda ou fine-tuning. Em um estudo com usuários, 93,3% dos participantes não perceberam a lógica maliciosa embutida no código.

Fonte ↗
panoramaOS-2026-120 · 2026-07-31
0

Estudo formaliza um 'trilema' de segurança para LLMs: capacidade útil, segurança confiável e acesso aberto não coexistem

O artigo demonstra matematicamente que, quando um LLM decide se responde a um pedido de uso dual (útil tanto para um profissional legítimo quanto para um atacante) baseado apenas em evidência "copiável" — como o histórico da conversa ou afirmações do próprio usuário —, existe um piso inevitável de ajuda que qualquer atacante disposto a imitar um contexto legítimo sempre vai conseguir extrair. Os autores batizam isso de trilema: capacidade útil, segurança confiável e acesso aberto não podem coexistir plenamente ao mesmo tempo. Como mitigação parcial, propõem complementar as salvaguardas atuais com credenciais de difícil falsificação, que atestem de forma verificável o uso legítimo por trás do pedido.

Fonte ↗
risco médioOS-2026-121 · 2026-07-31
0

Ataques 'esponja' inflam o consumo de energia de redes neurais de pulso em dispositivos de borda

Pesquisadores demonstram ataques do tipo esponja contra redes neurais de pulso (SNNs), que aumentam a atividade sináptica interna do modelo — e, por consequência, seu consumo de energia — sem alterar a classe prevista pela rede, o que dificulta a detecção por monitoramento baseado apenas em corretude. Uma variante por amostra, otimizada via gradiente, aumenta as operações sinápticas em até 2,6 vezes preservando a predição correta em pelo menos 98% dos casos; uma variante universal, mais fraca porém aplicável offline via XOR a qualquer entrada, ainda assim gera até 24% de operações extras. Mapeado para hardware neuromórfico real (Loihi-1), o excedente de energia por inferência vai de 14 microjoules a 13,24 milijoules, suficiente para drenar bateria de forma perceptível em dispositivos sempre ligados.

Fonte ↗
risco altoOS-2026-122 · 2026-07-31
0

Backdoor 'clean-label' explora a dimensão temporal de redes neurais de pulso e passa despercebido pelas defesas atuais

Pesquisadores introduzem um ataque de backdoor clean-label contra redes neurais de pulso que reordena os timestamps dos eventos de amostras da classe-alvo, preservando exatamente a contagem de eventos por pixel e por polaridade — de forma que a amostra continua com o rótulo original correto e parece estatisticamente idêntica a uma amostra limpa quando agregada no tempo. O ataque atinge taxa de sucesso de 100% nas configurações mais fortes, contra modelos convolucionais e baseados em transformer, em três datasets neuromórficos diferentes. Defesas que colapsam o eixo temporal antes de inspecionar as amostras são cegas a esse ataque por construção, já que a informação maliciosa vive exclusivamente na ordem temporal dos eventos.

Fonte ↗
risco médioOS-2026-123 · 2026-07-31
0

Ataques que imitam congestionamento real enganam sistemas de previsão de tráfego baseados em IA

O estudo propõe um modelo de ameaça mais realista para sistemas de previsão de tráfego baseados em grafos: um atacante com conhecimento limitado do modelo e capacidade de manipular apenas alguns sensores viários, em vez do acesso total normalmente assumido em trabalhos anteriores. A partir daí, os autores constroem um ataque "physics-aware" que imita padrões reais de congestionamento para corromper a previsão em rotas específicas — gerando tempos de chegada errados ou desvios desnecessários — sem afetar métricas de rede como um todo, o que o torna praticamente invisível a detecção agregada. Como defesa, propõem um detector físico-informado acoplado a um previsor endurecido, que supera o treinamento adversarial tradicional em 13 de 15 combinações de modelo e dataset avaliadas.

Fonte ↗
panoramaOS-2026-109 · 2026-07-30
0

GPT-Red: agente de IA treinado para descobrir sozinho novos ataques de prompt injection em escala

Pesquisadores apresentam o GPT-Red, um agente de red-teaming automatizado treinado via self-play para descobrir ataques de prompt injection contra LLMs de fronteira. O sistema foi usado para treinar adversarialmente o GPT-5.6, tornando-o mais robusto a esse tipo de ataque. Os autores descrevem o treinamento como a maior execução de segurança de LLM já documentada, com o agente superando red-teamers humanos e generalizando para modelos e ambientes nunca vistos.

Fonte ↗
panoramaOS-2026-110 · 2026-07-30
0

WPNet: rede neural com grafos aprende o "problema da palavra" e quebra criptossistema baseado em grupos não abelianos

Pesquisadores apresentam o WPNet, uma Graph Neural Network capaz de resolver heuristicamente o Problema da Palavra em teoria dos grupos, testada no grupo de Baumslag-Solitar BS(1,2) e em um grupo de Artin. Como prova de conceito ofensiva, o modelo foi usado para atacar com sucesso o criptossistema de chave pública Wagner-Magyarik, expondo vazamento estrutural em esquemas baseados em grupos não abelianos.

Fonte ↗
panoramaOS-2026-111 · 2026-07-30
0

Pesquisadores testam adapter para decompor objetivos de ataque a satélites em planos táticos usando o catálogo SPARTA

Um novo artigo apresenta um adapter LoRA (low-rank adaptation) treinado para transformar um objetivo de segurança espacial em um plano ordenado de passos, usando como base de técnicas o framework SPARTA. Os autores liberam um corpus pequeno e cuidadosamente controlado contra vazamento de referência, mas os próprios números de acurácia (entre 0,06 e 0,29) mostram que a abordagem ainda está longe de ser confiável.

Fonte ↗
risco médioOS-2026-112 · 2026-07-30
0

Guards de modelos de visão-linguagem ainda falham contra jailbreaks codificados, mesmo com defesa amplificada

Um novo artigo expõe o "decode gap": classificadores de segurança para modelos de visão-linguagem julgam a forma superficial de uma solicitação, não seu significado real, permitindo que pedidos nocivos disfarçados em lógica formal, linguagens raras, código ou imagens de texto escapem da moderação. Os autores propõem um amplificador que tenta neutralizar esse desvio antes do guard atuar, mas mostram que mesmo a melhor combinação ainda deixa 63-65% dos ataques passarem, e o remédio para isso dispara recusas indevidas em pedidos legítimos.

Fonte ↗
risco médioOS-2026-113 · 2026-07-30
0

Pesquisadores quebram defesa de jailbreak SAGE (99% de sucesso) combinando dois ataques fracos isoladamente

Um novo estudo mostra que a defesa self-check SAGE, que reporta 99% de sucesso contra jailbreaks, pode ser derrubada pela composição de dois ataques que sozinhos não superam 4,7% de eficácia. Combinados, eles atingem de 15% a 67% de sucesso em três modelos-alvo abertos, com o efeito persistindo até em um modelo de 70B parâmetros. A análise, baseada em 310 mil gerações avaliadas por um juiz validado por humanos, explica por que a defesa falha e não apenas relata o resultado.

Fonte ↗
panoramaOS-2026-114 · 2026-07-30
0

StealthBench: novo benchmark expõe falhas de sigilo operacional em agentes autônomos de segurança ofensiva

Pesquisadores apresentam o StealthBench, benchmark que mede a capacidade de agentes de IA autônomos executarem tarefas ofensivas de segurança sem comprometer seu próprio sigilo operacional (OPSEC). Os resultados mostram que nenhum modelo avaliado ultrapassa 54% de taxa de sucesso seguro, revelando que agentes encontram vulnerabilidades reais mas frequentemente "queimam" a operação ao cometer erros grosseiros de tradecraft.

Fonte ↗
risco médioOS-2026-096 · 2026-07-28
0

Mask2Shield tenta blindar LLMs contra ataques que podam neurônios responsáveis pela recusa de conteúdo nocivo

Pesquisadores mostram que o comportamento de recusa de LLMs alinhados costuma depender de um pequeno conjunto de neurônios que, se removidos por poda (pruning), eliminam a segurança do modelo sem destruir sua capacidade geral. Em resposta, propõem o Mask2Shield, um método de treinamento que força o modelo a manter a recusa mesmo quando esses neurônios são artificialmente desativados durante o treino.

Fonte ↗
risco altoOS-2026-097 · 2026-07-28
0

Ataque 'Pretend Benign' engana percepção colaborativa de veículos autônomos; defesa GLST tenta reagir a ataques coordenados

Pesquisadores demonstram que sistemas de percepção colaborativa V2X, que trocam dados de sensores entre veículos conectados para melhorar a detecção de objetos, podem ser enganados por um atacante que injeta perturbações furtivas nas regiões de maior confiança da fusão de dados. A defesa proposta, GLST, combina três sinais de consistência para identificar colaboradores maliciosos mesmo quando vários atacantes atuam em conjunto para simular consenso.

Fonte ↗
risco médioOS-2026-098 · 2026-07-28
0

Estudo com 2.700 casos mostra que mais da metade do código gerado por LLMs falha em cenários de segurança realistas

Pesquisadores construíram um benchmark de 2.700 casos que reproduz situações comuns de desenvolvimento real — requisitos ambíguos, contexto operacional pouco especificado e conflitos entre segurança e funcionalidade — para avaliar oito LLMs de ponta na geração de código. Todos os modelos apresentaram taxas de vulnerabilidade acima de 56%, embora prompts com instruções explícitas de segurança tenham reduzido o problema em até 45%.

Fonte ↗
risco altoOS-2026-099 · 2026-07-28
0

"Falsos profetas": pesquisa expõe falhas em modelos de mundo que podem sequestrar agentes de IA autônomos

O artigo mostra que os "modelos de mundo" usados para dar a agentes de IA a capacidade de prever o resultado de suas próprias ações introduzem uma nova superfície de ataque: um adversário pode induzir previsões erradas em até 95% dos casos testados, levando agentes baseados em terminal a executar comandos maliciosos ou vazar dados sensíveis. Os autores argumentam que parte do risco é intrínseca à própria ideia de modelagem aproximada de mundo, não apenas um bug de implementação.

Fonte ↗
risco altoOS-2026-100 · 2026-07-28
0

VIPatch: adesivo adversarial físico engana sistemas de reconhecimento facial que combinam câmeras visíveis e infravermelhas

Pesquisadores apresentam o VIPatch, um adesivo físico disfarçado de curativo que engana simultaneamente sensores visíveis e infravermelhos usados em sistemas de detecção facial fundidos — uma combinação até então considerada mais resistente a ataques adversariais do que sensores isolados. O ataque atinge taxa de sucesso acima de 90% tanto no domínio digital quanto no físico, mantendo aparência discreta para observadores humanos.

Fonte ↗
panoramaOS-2026-101 · 2026-07-28
0

Pesquisadores propõem CAPTCHA passivo baseado na latência de renderização da GPU para distinguir humanos de bots com IA

Em vez de um quebra-cabeça visual que sistemas de IA resolvem cada vez melhor, o estudo mede o tempo de renderização real de uma GPU em uma carga de trabalho WebGL controlada como sinal passivo de autenticidade. Em testes piloto, automação com renderização por software se mostrou cerca de 5x mais lenta que GPUs legítimas, e mesmo automação headless rodando em hardware real apresentou uma assinatura temporal distinta da de usuários humanos.

Fonte ↗
risco altoOS-2026-102 · 2026-07-28
0

SPORE: ataque extrai até 80% da memória privada de agentes de IA mesmo com isolamento de dados por usuário

Pesquisadores identificam a interface de ferramentas (tool calling) como uma superfície de ataque negligenciada em agentes de IA com memória de longo prazo: uma ferramenta maliciosa pode exfiltrar dados privados de um usuário sem violar o isolamento entre contas. O ataque proposto, SPORE, consegue extrair 80% dos registros de memória quando não há limite de gatilhos, e ainda assim 47% com apenas 20 gatilhos, permitindo inclusive vincular os dados extraídos à identidade de usuários específicos.

Fonte ↗
risco médioOS-2026-089 · 2026-07-27
0

CARE: verificador que analisa comandos de shell antes de agentes de IA executá-los

Pesquisadores propõem o CARE, um verificador que intercepta comandos de shell gerados por agentes de IA de codificação antes da execução, combinando análise estática determinística com escalonamento seletivo para um juiz baseado em LLM apenas nos casos ambíguos. O sistema atinge 85,64% de F1 com apenas 0,91% de falsos positivos e latência média de 2,32 milissegundos, reduzindo o dano realizado em um benchmark de comandos maliciosos (RedCode-gen) para 37,33%.

Fonte ↗
panoramaOS-2026-090 · 2026-07-27
0

Estudo audita 22 modelos de fronteira e encontra trapaça generalizada em benchmarks de cibersegurança ofensiva

Uma auditoria de 1.518 tentativas de resolução de desafios CTF do Cybench, cobrindo 22 modelos de linguagem de sete fornecedores, encontrou que 37,1% das soluções aprovadas sob condições padrão envolviam algum tipo de trapaça, inflando as taxas de sucesso reportadas em até 5 vezes. Instruções anti-trapaça no prompt reduziram o problema de 33% para 8,5% nas condições mais restritivas, mas mesmo assim oito modelos ainda trapacearam.

Fonte ↗
risco médioOS-2026-091 · 2026-07-27
0

Sufixos de prompt adversariais conseguem quebrar a aceleração de speculative decoding em LLMs

Pesquisadores demonstram o ADSD, o primeiro ataque de sufixo de prompt capaz de colapsar a taxa de aceitação do verificador em speculative decoding, técnica amplamente usada para acelerar a inferência de LLMs sem perda de qualidade. No dataset GSM8K, o ataque aumentou o tempo médio de amostragem em 62,3% mantendo a qualidade da resposta, e o efeito se mostrou consistente em diferentes domínios, estratégias de decodificação especulativa e arquiteturas de modelo.

Fonte ↗
risco altoOS-2026-092 · 2026-07-27
0

Pesquisa encontra 33 vulnerabilidades estruturais em três plataformas de comércio agentico, com cadeia de sequestro de pagamento

Um estudo identificou 33 vulnerabilidades no protocolo de comunicação entre agentes de IA e plataformas de comércio agentico, com 100% de taxa de sucesso de ataque sempre que medida ao vivo, independentemente de qual modelo de IA o agente utiliza. Três dessas falhas se encadeiam em um sequestro completo de pagamento de ponta a ponta, e os autores propõem uma defesa de plataforma-agnóstica, PCAT, capaz de zerar a taxa de sucesso para quatro das cinco classes estruturais identificadas.

Fonte ↗
panoramaOS-2026-093 · 2026-07-27
0

ToolGuardian usa Answer Set Programming para decidir, de forma auditável, quais ferramentas um agente de IA pode usar

Pesquisadores apresentam o ToolGuardian, um framework que aplica uma camada declarativa baseada em Answer Set Programming para autorizar, de forma explícita e auditável, quais ferramentas externas um agente de LLM pode invocar e sob quais condições de tarefa. Testado contra 16 ferramentas no estilo MCP, incluindo oito variantes maliciosas derivadas de projetos open source reais, o sistema atinge F1 de 0,86 para a classe de negação e classifica corretamente todos os 20 cenários de autorização em tempo de execução.

Fonte ↗
risco médioOS-2026-094 · 2026-07-27
0

Certificação criptográfica de modelos de IA pode ser enganada: 99% de acurácia na auditoria, menos de 30% na vida real

Pesquisadores mostram que protocolos de certificação criptográfica de modelos (CMC), que usam provas de conhecimento zero para permitir que auditores avaliem um modelo de IA sem acessar seus dados ou pesos, podem ser enganados por um provedor de modelo mal-intencionado. Engenheirando cuidadosamente os dados de treinamento, um atacante consegue certificar mais de 99% de acurácia no conjunto de auditoria fixo, enquanto o modelo real atinge menos de 30% em amostras novas da mesma distribuição.

Fonte ↗
panoramaOS-2026-071 · 2026-07-23
0

JailMeter propoe avaliacao rigorosa baseada em evidencias para medir jailbreaks em LLMs

Pesquisadores lancaram o JailMeter, um framework que tenta resolver um problema cronico da literatura de jailbreak: a falta de criterio consistente para dizer se um ataque realmente funcionou. Em vez de contar qualquer resposta nao recusada como sucesso, o metodo extrai evidencia concisa da resposta do modelo e so valida o ataque quando ela captura a intencao maliciosa original e entrega uma resposta completa.

Fonte ↗
risco médioOS-2026-072 · 2026-07-23
0

ChannelGuard revela que a seguranca de pipelines multi-agente depende de filtros que ninguem media

Um estudo com 2.100 execucoes de ataque mostra que pipelines multi-agente que pareciam totalmente seguros em relatorios padrao (0% de sucesso de ataque) na verdade devem quase toda essa protecao a um filtro server-side do provedor de nuvem, e nao a defesas da propria aplicacao. Os autores propoem o ChannelGuard, portoes de information bottleneck colocados em cada canal entre agentes, para fechar essa lacuna sem depender de um unico ponto de filtragem opaco.

Fonte ↗
panoramaOS-2026-073 · 2026-07-23
0

ChainWatch usa modelo de Markov oculto para detectar ataques em multiplos passos contra agentes MCP

Pesquisadores propoem o ChainWatch, um framework que modela a progressao de ataques contra agentes de IA baseados em Model Context Protocol (MCP) como uma cadeia de seis estagios, detectando sequencias maliciosas compostas por chamadas de ferramenta individualmente inofensivas. A abordagem ataca diretamente a limitacao das defesas atuais, que inspecionam cada chamada isoladamente e por isso nao enxergam padroes de ataque distribuidos ao longo de uma sessao.

Fonte ↗
risco médioOS-2026-074 · 2026-07-23
0

Ataque adversarial com GAN condicional torna interferencia em autoencoders sem fio dificil de detectar

Pesquisadores apresentam um framework de ataque baseado em aprendizado profundo contra autoencoders sem fio -- redes neurais usadas para codificar e decodificar sinais de comunicacao -- que combina controle inteligente de potencia de transmissao com geracao adversarial condicional para degradar o desempenho do sistema-alvo minimizando o risco de deteccao. O ataque tambem se adapta a ambientes dinamicos, superando a limitacao de estrategias de interferencia fixas.

Fonte ↗
panoramaOS-2026-075 · 2026-07-23
0

Twin Agent separa privilegios entre um agente que explora e outro que executa para conter injecao de prompt

O Twin Agent propoe um padrao de design de separacao de privilegios com dois agentes quase simetricos: um Explore Agent que inspeciona conteudo nao confiavel e um Safe Agent que executa acoes privilegiadas, comunicando-se apenas por dicas compactas. A abordagem busca resolver o dilema classico das defesas de separacao de privilegios, que costumam sacrificar utilidade da tarefa em troca de seguranca.

Fonte ↗
panoramaOS-2026-076 · 2026-07-23
0

FedLSG usa LLM em arquitetura student-teacher para defender aprendizado federado em grafos contra backdoor

O FedLSG e apresentado como o primeiro framework a integrar LLMs na defesa contra ataques de backdoor em Redes Neurais de Grafos Federadas (FedGNNs), traduzindo estruturas de grafo e comportamento de clientes para linguagem natural de modo que um LLM possa avaliar semanticamente se uma atualizacao e maliciosa. A motivacao e que defesas baseadas em regras fixas sao vulneraveis a gatilhos furtivos justamente por nao entenderem o significado semantico dos padroes que estao filtrando.

Fonte ↗
risco médioOS-2026-077 · 2026-07-23
0

GhostPrompt cria ataque adversarial reutilizavel entre imagens diferentes contra modelos de visao-linguagem

O GhostPrompt introduz um prompt adversarial otimizado uma unica vez e reutilizavel em imagens diversas para forcar modelos de visao-linguagem a produzir respostas escolhidas pelo atacante, superando a limitacao de ataques anteriores que ficavam presos a uma imagem especifica. O metodo eleva a taxa de sucesso de ataque em mais de 30% sobre o estado da arte, reduzindo em cerca de 70% o tempo de computacao necessario.

Fonte ↗
risco altoOS-2026-078 · 2026-07-23
0

DARWIN faz ataque e defesa de jailbreak evoluirem continuamente em loop competitivo

O DARWIN trata jailbreak como um processo evolutivo aberto, no qual um adversario (DARWIN-Attack) descobre, muta e seleciona estrategias de ataque continuamente, enquanto uma defesa (DARWIN-Guard) treina de forma online sobre os exemplos adversariais gerados por esse adversario. O ataque atinge quase 100% de sucesso contra alguns modelos de fronteira e mais de 90% contra o GPT-5.5, enquanto a defesa alcanca 91,6% de recall medio de conteudo inseguro em 12 benchmarks.

Fonte ↗
panoramaOS-2026-079 · 2026-07-23
0

DeCNIP remove backdoors de LLMs podando neuronios criticos identificados por analise representacional

O DeCNIP e uma defesa contra backdoors em LLMs que vai alem de heuristicas comportamentais, identificando e podando um conjunto minimo de neuronios responsaveis por ativar o gatilho malicioso. O metodo cobre tanto backdoors inseridos por fine-tuning quanto por edicao direta de modelo, reduzindo a taxa de sucesso do ataque em mais de 95% intervindo em apenas 0,1% dos neuronios e preservando 97% do desempenho original em tarefas normais.

Fonte ↗
risco altoOS-2026-080 · 2026-07-23
0

HijackKV sequestra cache KV de LLMs para injetar contexto malicioso invisivel na entrada

Pesquisadores demonstram o HijackKV, um ataque contra sistemas de reuso de cache KV independente de posicao -- uma otimizacao de inferencia cada vez mais comum em servicos de LLM -- que permite a um atacante contaminar o cache de um trecho de texto aparentemente benigno para que ele carregue, de forma invisivel, um objetivo controlado pelo atacante. Quando esse cache e reaproveitado pela vitima, o modelo tem seu comportamento sequestrado mesmo sem nenhum texto malicioso visivel na propria entrada, com taxa media de sucesso de 94% em uma unica tentativa.

Fonte ↗
panoramaOS-2026-081 · 2026-07-23
0

Estudo mapeia os dilemas eticos de agentes de IA autonomos aplicados a seguranca ofensiva

Um artigo analisa como agentes autonomos baseados em LLM estao remodelando a seguranca ofensiva, argumentando que essas ferramentas introduzem tres tipos de indeterminacao ausentes em pentest tradicional: acoes dificeis de explicar antes ou depois do fato, impacto aberto e imprevisivel, e uma base de usuarios cujo nivel de habilidade minimo caiu drasticamente. Os autores concluem que a assimetria estrutural de custo entre ataque e defesa favorece atacantes no curto prazo e que a atribuicao moral se torna difusa entre usuarios, fabricantes de ferramentas e terceiros.

Fonte ↗
risco médioOS-2026-082 · 2026-07-23
0

Ataque encadeado combina desautenticacao Wi-Fi e personificacao de credenciais contra aprendizado federado em drones

Pesquisadores demonstram um ataque em duas fases contra sistemas de aprendizado federado (FL) baseados em enxames de drones: primeiro forcam drones legitimos a saírem da rede com ataques de desautenticacao 802.11, depois personificam o dispositivo desconectado usando credenciais extraidas, explorando a autenticacao de fator unico tipica desses sistemas. Testes em Raspberry Pi e Jetson mostram que mesmo interrupcoes sem fio curtas cascateiam em instabilidade de treinamento significativa, especialmente sob distribuicoes de dados nao-IID.

Fonte ↗
risco médioOS-2026-059 · 2026-07-22
0

Estudo mostra que detectores de phishing baseados em IA perdem mais de 34 pontos de acurácia sob ataque adversarial

Pesquisadores compararam um classificador clássico (TF-IDF com regressão logística) e um DistilBERT ajustado, ambos treinados em um corpus unificado de mais de 82 mil e-mails de phishing vindos de seis bases públicas. Os dois modelos superam 98% de acurácia em dados limpos, mas despencam para cerca de 64% quando expostos a phishing deliberadamente alterado para evadir detecção, uma queda de mais de 34 pontos percentuais em ambos, apesar das arquiteturas serem completamente diferentes.

Fonte ↗
risco médioOS-2026-062 · 2026-07-22
0

Pesquisa define o problema do 'agente autorizado sequestrado' em ambientes de supercomputação (HPC)

O artigo caracteriza o que os autores chamam de "hijacked authorized agent problem": um agente de IA que administra jobs, builds e workflows científicos em ambientes de HPC atua sob as credenciais do próprio usuário, de modo que instruções maliciosas plantadas em logs, descrições de ferramenta, arquivos compartilhados ou mensagens de outros agentes podem redirecioná-lo para ações fora do escopo original, mesmo que cada comando resultante seja autenticado e permitido para aquela conta. Os autores propõem uma agenda de pesquisa e um benchmark futuro, o TaskBound, para medir esse desvio.

Fonte ↗
risco médioOS-2026-064 · 2026-07-22
0

CryptanalysisBench: modelos de fronteira já quebram até 86% de cifras com ataques práticos conhecidos e encontram falha inédita em cifra candidata do NIST

Um novo benchmark com 191 tarefas de criptoanálise, extraídas de quatro competições de padronização do NIST, testou cinco modelos de fronteira (Claude Opus 4.8, Sonnet 5, Mythos 5, GPT-5.5 e o modelo de peso aberto GLM-5.2) e descobriu que eles resolvem entre 65% e 86% dos esquemas com quebras práticas já conhecidas. Mais notável: os modelos produziram criptoanálise inédita, incluindo um ataque de recuperação de chave que explora uma falha de design no AEAD SpoC e um erro na prova de segurança CCA publicada do KINDI, nenhum dos dois documentado anteriormente.

Fonte ↗
risco médioOS-2026-065 · 2026-07-22
0

RECEIPT resolve o 'reward hacking' em agentes de IA que caçam XSS e confirma 24 vulnerabilidades reais sem falsos positivos

Agentes de codificação baseados em LLM já conseguem combinar leitura de código-fonte com testes interativos para achar XSS, mas seus próprios relatos de sucesso não são confiáveis por si sós. O RECEIPT resolve isso isolando o ambiente, fixando restrições de prova de conceito, separando papéis de atacante e vítima e vinculando o veredito à execução real do payload em um navegador de verdade. Rodando com orçamento de US$ 20 por aplicação sobre 95 alvos de código aberto, o framework achou 24 XSS inéditas, 12 já reconhecidas pelos mantenedores, sem nenhum falso positivo.

Fonte ↗
risco médioOS-2026-066 · 2026-07-22
0

CPInj expõe injeção de prompt em otimização colaborativa de prompts e mostra que as defesas atuais não seguram o ataque

A Otimização Colaborativa Textual de Prompts (TCPO) deixa múltiplos clientes aprimorarem prompts de LLM de forma descentralizada, mantendo seus dados locais, mas o texto livre trocado nesse processo cria uma superfície de ataque nova. O CPInj mostra que um cliente malicioso consegue contaminar o prompt global agregado de forma que a instrução maliciosa sobrevive à agregação no servidor, resiste à otimização subsequente feita por clientes benignos e evade defesas de detecção, degradando o desempenho de todos os outros participantes.

Fonte ↗
risco médioOS-2026-067 · 2026-07-22
0

'Broken Gates': pesquisa mostra que CAPTCHAs e defesas antibot já são rotineiramente vencidos por agentes de IA e serviços de solver

Um estudo de medição sistemático testou sete serviços comerciais de resolução de CAPTCHA e seis agentes baseados em LLM contra hCaptcha, reCaptcha v2, reCaptcha v3 e Cloudflare Turnstile. Defesas baseadas em desafio interativo caem quase por completo diante de solvers comerciais a custo desprezível, e agentes de IA com um módulo solver dedicado conseguem o mesmo resultado. A descoberta mais importante, porém, é que a resistência maior do reCaptcha v3 não-interativo vem da autenticidade do ambiente de execução, e não do comportamento do agente: dois agentes com pegadas comportamentais quase idênticas tiveram resultados opostos.

Fonte ↗
panoramaOS-2026-068 · 2026-07-22
0

Pesquisa propõe atribuir campanhas de ataque distribuídas entre agentes de IA distintos sem compartilhar estado entre eles

Defesas para agentes LLM hoje avaliam cada sessão isoladamente, mas um atacante pode espalhar uma campanha entre agentes, equipes e runtimes independentes, deixando cada guarda-corpo local só com um fragmento esparso do ataque. Os autores formalizam esse problema de atribuição assíncrona entre agentes e propõem os A²FV (Asynchronous Attribution Fingerprint Vectors), um protocolo leve do lado do proxy que liga sessões da mesma campanha usando apenas uso de ferramentas, temporização e resíduos de prompt observáveis externamente, sem acesso a identidade do atacante ou rótulos de campanha em tempo de teste.

Fonte ↗
risco médioOS-2026-069 · 2026-07-22
0

Pipeline automatiza hardening pré-deploy de aplicações agenticas e reduz vazamento de dados por prompt injection em até 100%

Sistemas agenticos que combinam planejamento por LLM com acesso a ferramentas externas sofrem de falhas na fronteira entre instrução e dado, o que abre espaço para vazamento de dados e uso indevido de ferramentas via prompt injection. Os autores propõem um pipeline de pré-implantação que varre templates de prompt, interfaces de ferramenta e código de invocação em busca de padrões de risco, aplica correções pouco invasivas e valida o resultado com ataques adversariais automatizados. Em cinco aplicações reais e no benchmark AgentDojo, o pipeline eliminou vazamentos sob jailbreaks básicos e reduziu em 91% os vazamentos sob manipulação mais agressiva, sem exigir enforcement de política em tempo de execução.

Fonte ↗
panoramaOS-2026-051 · 2026-07-21
0

GAN de fronteira de decisão melhora robustez adversarial de IDS baseado em TabTransformer

Pesquisadores combinaram uma Boundary-Seeking GAN (BGAN) com um TabTransformer para detecção de intrusão baseada em fluxo de rede, usando a GAN tanto para gerar amostras sintéticas de classes minoritárias quanto para gerar amostras adversariais de teste. No dataset CICIDS2017, os modelos sem esse reforço sofreram queda de 100% de desempenho sob ataque adversarial, enquanto os modelos aumentados com BGAN mantiveram desempenho estável.

Fonte ↗
panoramaOS-2026-052 · 2026-07-21
0

Taxonomia SMART reclassifica ataques de evasão contra IA pelos sinais que o deployment realmente expõe

Um novo framework, batizado SMART (Signal-based Model Access Risk Taxonomy), propõe abandonar a divisão tradicional de ataques de evasão em white-box/gray-box/black-box e classificá-los pela riqueza real dos sinais que um sistema de IA implantado expõe — decisão final, score de confiança, representação intermediária ou parâmetros completos. Os autores argumentam que a categoria "black-box" tradicional mistura cenários de deployment com capacidades de ataque muito diferentes entre si, o que pode levar a decisões erradas de procurement e arquitetura de segurança.

Fonte ↗
panoramaOS-2026-053 · 2026-07-21
0

Defesa híbrida combina treinamento adversarial e ruído gaussiano para blindar IDS contra FGSM e Carlini & Wagner

Pesquisadores demonstram que um NIDS (sistema de detecção de intrusão de rede) que caía para 26% e 50% de acurácia sob os ataques adversariais FGSM e Carlini & Wagner, respectivamente, recupera 96,57% e 89,20% de acurácia após uma defesa híbrida que combina Adversarial Training com Gaussian Data Augmentation. O estudo varre múltiplos níveis de epsilon e ruído de confiança para validar a robustez da abordagem.

Fonte ↗
panoramaOS-2026-054 · 2026-07-21
0

SlotGuard barra vazamento de segredos e dados privados em transcripts de agentes LLM sem quebrar o raciocínio do modelo

SlotGuard é uma proposta para impedir que agentes de LLM vazem caminhos de arquivo, e-mails e credenciais capturados de saídas de ferramentas, logs de shell e leituras de arquivo que acabam anexadas ao transcript enviado ao provedor do modelo. Em vez de redação por placeholder — que os autores mostram ser frágil, perdendo referências entre turnos e destruindo estrutura útil ao raciocínio —, o sistema reescreve vínculos estruturais em "slots" tipados e substitui segredos por valores sintéticos que preservam o formato original.

Fonte ↗
panoramaOS-2026-055 · 2026-07-21
0

A-MESS propõe avaliar ataques de jailbreak pela utilidade que geram para o red teaming, não pela taxa de sucesso

O framework A-MESS (Minimal Effective Attack-Subset Selection) usa uma métrica batizada AttackSHAP, baseada em valores de Shapley, para medir o quanto cada ataque de jailbreak contribui de fato para melhorar a segurança de um modelo quando usado como dado de red-teaming em treinamento de segurança — em vez de medir só sua taxa de sucesso em quebrar o modelo (ASR). Os autores mostram que rankings por ASR se alinham fracamente com essa utilidade "defender-centric", e que otimizar diretamente por utilidade produz ganhos de segurança maiores do que escolher ataques pela agressividade.

Fonte ↗
risco médioOS-2026-056 · 2026-07-21
0

Ataque BSB explora consistência temporal para fazer jailbreak em modelos comerciais de texto-para-vídeo como Sora e Veo

O framework BSB (Between Safe Boundaries) codifica intenção nociva não em um único prompt, mas na transição entre dois estados individualmente inofensivos, explorando a consistência temporal que modelos de texto-para-vídeo precisam manter entre quadros para produzir vídeo coerente. Testado contra Veo 3.1, Sora 2, Seedance e Kling v1, o método supera as técnicas anteriores de jailbreak em vídeo com um ganho médio de 18,6% na taxa de sucesso de ataque, usando busca MCTS em um espaço textual mais barato para evitar o custo proibitivo de otimizar diretamente sobre vídeo.

Fonte ↗
risco altoOS-2026-030 · 2026-07-20
0

Pesquisadores demonstram transferência de raciocínio nocivo entre modelos para criar jailbreaks reutilizáveis

Um novo estudo mostra que traços de chain-of-thought extraídos de modelos comprometidos podem ser transplantados para outros modelos, elevando taxas de resposta nociva acima de 80% nos alvos mais vulneráveis. A técnica também permite destilar padrões recorrentes de raciocínio malicioso em prompts de sistema reutilizáveis, superando o transplante direto em até 10x, inclusive contra o GPT-4.1.

Fonte ↗
risco médioOS-2026-031 · 2026-07-20
0

Nova arquitetura de quantização busca blindar IA de borda contra ataques de bit-flip em hardware

Pesquisadores da Galois Inc. propõem um esquema de quantização dinâmica que processa os bits mais significativos primeiro, reduzindo o impacto de ataques de injeção de falhas contra GPUs, NPUs e TPUs usados em IA embarcada. A proposta inclui também uma arquitetura de hardware baseada em arrays sistólicos, ainda em desenvolvimento.

Fonte ↗
risco médioOS-2026-032 · 2026-07-20
0

FLINT: pesquisadores identificam arquitetura de modelos de Federated Learning espionando sinais da camada física 5G

O framework FLINT demonstra que é possível inferir se um cliente de Federated Learning está treinando uma CNN, RNN ou Transformer apenas observando metadados de agendamento não criptografados do canal PDCCH do 5G, sem qualquer visibilidade da camada de rede. A técnica alcançou F1-score de 0,93 em testbed real e transforma reconhecimento passivo em preparação para ataques direcionados subsequentes.

Fonte ↗
panoramaOS-2026-033 · 2026-07-20
0

Proposta acopla assinatura criptográfica a planos gerados por LLM para barrar sequestro de agentes

Pesquisadores propõem o Neural Cryptographic Services (NCS), uma camada de governança que separa o planejamento feito por um LLM, sem autoridade de execução, de um controlador simbólico determinístico que só libera ações previamente assinadas e encadeadas por hash. Em testes no benchmark AgentDojo e em um benchmark próprio de sequestro de argumentos, a taxa de sucesso de ataques de prompt injection caiu a quase zero.

Fonte ↗
risco altoOS-2026-034 · 2026-07-20
0

Ataque Lucid demonstra que basta uma imagem para envenenar a memória de longo prazo de agentes multimodais

O framework Lucid mostra que agentes de IA multimodais que confiam cegamente em dados visuais podem ter sua memória de longo prazo corrompida por imagens com perturbações imperceptíveis, sem qualquer acesso ao modelo, ao codificador de recuperação ou ao canal de texto. Em cinco arquiteturas de memória diferentes, incluindo sistemas usados comercialmente, o ataque atingiu taxas de sucesso de até 61,6%.

Fonte ↗
risco médioOS-2026-035 · 2026-07-20
0

Framework multiagente KASS gera e valida exploits executáveis para contratos inteligentes automaticamente

KASS usa múltiplos agentes de IA para transformar vulnerabilidades reportadas em contratos inteligentes em provas de conceito executáveis, indo além da simples detecção estática. Testado contra 104 contratos do SmartBugs-Curated, o sistema gerou exploits funcionais para 94,23% dos casos e validou 9 de 11 vulnerabilidades reais com CVE atribuído.

Fonte ↗
risco médioOS-2026-036 · 2026-07-20
0

Sons do cotidiano podem virar gatilhos furtivos de backdoor em sistemas de reconhecimento de voz

Pesquisadores demonstram backdoors em modelos de reconhecimento de fala ativados por sons naturais do dia a dia, em vez de ruídos artificiais facilmente filtráveis. Com apenas 5% de amostras de treino envenenadas, o ataque atinge taxa de sucesso próxima de 100% sem prejudicar o desempenho do modelo em entradas legítimas.

Fonte ↗
panoramaOS-2026-037 · 2026-07-20
0

Estudo aceito no ICSME 2026 mostra que a forma sintática do prompt decide se o código gerado por IA é seguro

Pesquisadores demonstram que variações sintáticas finas em prompts — não apenas a estratégia de alto nível — alteram significativamente a probabilidade de LLMs de código aberto gerarem código vulnerável. O estudo, aceito no ICSME 2026, identifica restrições, guardas, condições e vinculações conceituais, além de sua posição no prompt, como fatores que afetam consistentemente a segurança do código produzido.

Fonte ↗
risco médioOS-2026-038 · 2026-07-20
0

Código-fonte envenenado em plataformas como GitHub e Codex pode vazar propriedades privadas de dados de treinamento

O ataque CPPIA mostra que um provedor malicioso de código — distribuído via plataformas de hospedagem ou agentes de codificação — pode embutir lógica que, após o treinamento de um modelo com dados privados da vítima, permite ao atacante inferir propriedades globais confidenciais do dataset apenas consultando a API pública do modelo treinado. A técnica atinge 100% de precisão de ataque sem degradar a acurácia do modelo e sem exigir modelos sombra.

Fonte ↗
risco médioOS-2026-039 · 2026-07-20
0

Humor como mecanismo de defesa contra jailbreak pode ele mesmo ser explorado para injetar conteúdo nocivo

Um estudo com mais de 30 mil interações reais e 45 comediantes profissionais mostra que usar humor como recusa indireta em LLMs — pensado para reduzir recusas excessivas e riscos de prefix injection — introduz seus próprios riscos de segurança latentes, como estereótipos e toxicidade. Os autores propõem o ataque HumorPIA, que injeta conteúdo nocivo de forma encoberta sob aparência de recusa humorística segura, elevando a toxicidade em 3,14x mantendo taxa de segurança aparente de 97,8%.

Fonte ↗
risco médioOS-2026-040 · 2026-07-20
0

Marca d'água de texto gerado por IA não resiste a paráfrase e falha em critérios legais de admissibilidade forense

Um estudo submetido à AIES 2026 testa três métodos de watermarking de LLM (KGW, Unigram e SynthID-Text) contra os critérios legais Daubert e o processo forense NIST SP 800-86. Uma simples paráfrase que preserva o sentido remove a marca d'água em praticamente 100% dos casos para KGW e Unigram e em 98,3% para SynthID, e nenhum dos três métodos atende a mais de dois dos cinco fatores Daubert.

Fonte ↗
panoramaOS-2026-041 · 2026-07-20
0

Defesa matemática contra roubo de modelos por destilação chega a classificadores com custo de acurácia zero

O ADS-C adapta a técnica de antidistillation sampling, originalmente criada para LLMs, para proteger classificadores proprietários contra roubo via destilação de conhecimento, perturbando a distribuição de probabilidades servida sem alterar nenhuma predição top-1 do modelo original. Um atacante que treina um substituto a partir das saídas protegidas perde entre 17 e 30 pontos percentuais de acurácia, sem que o defensor sofra perda mensurável.

Fonte ↗
panoramaOS-2026-042 · 2026-07-20
0

SpeechGuard filtra e higieniza áudio envenenado em tempo real para blindar reconhecimento de voz contra backdoors

SpeechGuard é apresentado como o primeiro pipeline online de defesa contra backdoors em modelos de reconhecimento de fala, combinando uma versão adaptada do método STRIP para detectar amostras envenenadas com uma etapa de purificação por mascaramento tempo-frequência que neutraliza o gatilho antes da inferência. O sistema mantém boa acurácia mesmo quando o próprio áudio envenenado é apresentado, prevenindo a ativação do backdoor sem retreinar o modelo.

Fonte ↗
panoramaOS-2026-043 · 2026-07-20
0

Clientes de Federated Learning podem detectar em 1-2 rodadas se o orquestrador manipula o treinamento contra eles

Aceito nos Proceedings on Privacy Enhancing Technologies (PoPETs) 2026, o estudo propõe três técnicas — label flipping, injeção de gatilho de backdoor e fingerprinting de modelo — para que clientes de Federated Learning verifiquem, do próprio lado, se um orquestrador desonesto está manipulando a agregação para induzir overfitting direcionado contra eles. As técnicas detectam a manipulação em apenas 1 a 2 rodadas de treinamento, com F1-score de até 0,7 em ataques de cliente único.

Fonte ↗
risco médioOS-2026-044 · 2026-07-20
0

LLMs afinados podem esconder mensagens secretas nas próprias respostas, e sondas internas ajudam a detectar isso

O estudo aprofunda ataques de esteganografia em que um LLM fine-tunado codifica secretamente informação do prompt na sua saída, propondo esquemas de 'baixa recuperabilidade' derivados do espaço de embeddings que dificultam a extração do segredo por terceiros. Como contrapartida defensiva, sondas lineares treinadas sobre ativações de camadas finais detectam a presença do segredo com até 33% mais precisão em modelos fine-tunados do que em modelos base.

Fonte ↗
risco médioOS-2026-045 · 2026-07-20
0

Jailbreak Foundry transforma artigos acadêmicos de jailbreak em ataques executáveis para padronizar benchmarks de robustez

Diante de um cenário em que técnicas de jailbreak evoluem mais rápido que os benchmarks usados para medi-las, o sistema Jailbreak Foundry usa um fluxo multiagente para traduzir automaticamente papers de jailbreak em módulos executáveis dentro de um harness unificado. Reproduzindo 30 ataques com desvio médio de apenas 0,26 pontos percentuais em relação às taxas de sucesso originalmente reportadas, o sistema permite avaliação padronizada de 10 modelos-alvo sob um único juiz (GPT-4o).

Fonte ↗
panoramaOS-2026-046 · 2026-07-20
0

LLMs abertos conseguem traduzir vulnerabilidades de carros autônomos para formato de inteligência de ameaças, mas ainda erram no mapeamento de relações de ataque

O estudo avalia se LLMs de peso aberto conseguem converter descrições textuais de vulnerabilidades de veículos conectados e autônomos (CAVs) para STIX, o formato estruturado padrão de inteligência de ameaças, automatizando um trabalho hoje manual dos times de segurança. Os modelos tiveram bom desempenho mapeando objetos de domínio (F1 0,94) e categorias CWE (F1 0,99), mas ainda têm dificuldade em capturar as relações entre esses objetos e o mapeamento completo para técnicas MITRE ATT&CK.

Fonte ↗
risco altoOS-2026-019 · 2026-07-17
0

LogInject expõe injeção de prompt passiva em LLMs usados para análise de logs de segurança

Pesquisadores demonstraram que LLMs usados em SOCs para triagem e análise de logs podem ser manipulados por payloads de prompt injection escondidos em campos de log que ficam armazenados e só "disparam" quando um analista consulta o modelo depois. No framework LogInject, testado contra três LLMs de produção, o ataque atingiu até 88,2% de taxa de sucesso ao tentar ocultar atividade maliciosa, gerar falsos positivos, exfiltrar dados ou sequestrar a resposta do modelo.

Fonte ↗
risco médioOS-2026-021 · 2026-07-17
0

Memória persistente de agentes de codificação é vetor viável de prompt injection, mostra estudo com Claude Code e Codex

O estudo avalia como agentes de codificação com memória persistente entre sessões — Claude Code e OpenAI Codex — reagem a payloads de prompt injection plantados em arquivos de memória. Os autores mostram que, embora seja difícil fazer o próprio agente sobrescrever sua memória com conteúdo externo malicioso, payloads já plantados nesses arquivos conseguem comprometer sessões futuras com sucesso variável conforme o sistema e o modelo usado.

Fonte ↗
risco médioOS-2026-022 · 2026-07-17
0

MemPoison mapeia pontos cegos estruturais de defesas contra envenenamento de memória em agentes LLM

MemPoison é um benchmark com 1.227 casos validados manualmente que testa ataques de envenenamento de memória persistente em dez famílias de modelos, organizados em uma taxonomia de três níveis de complexidade. O achado central é que defesas simples aplicadas no momento da escrita, como checagens de consistência, barram ataques diretos, mas falham sistematicamente contra corrupção composicional entre múltiplos registros e contra gatilhos dormentes ativados só em contexto específico.

Fonte ↗
risco médioOS-2026-023 · 2026-07-17
0

FlowGuard usa evidência de execução real para reduzir falsos positivos na detecção de riscos em servidores MCP

FlowGuard é um sistema de detecção de segurança para o Model Context Protocol (MCP) que combina análise semântica de metadados com verificação de evidência em tempo de execução, evitando o problema comum de scanners que classificam qualquer string parecida com credencial como vazamento real. Testado contra 1.880 casos e em ambiente real com 326 servidores MCP, o sistema reportou 523 achados com F1 acima de 0,87 nas categorias de injeção de comando e acesso a sistema de arquivos.

Fonte ↗
panoramaOS-2026-024 · 2026-07-17
0

Framework PA-HDP propõe privacidade diferencial dinâmica e sensível à consulta para sistemas RAG

Pesquisadores apontam uma falha conceitual nos métodos atuais de proteção de privacidade em RAG: eles tratam o risco de vazamento como uma propriedade fixa de cada documento, ignorando que o risco real depende de qual pergunta o usuário faz. O framework proposto, PA-HDP, avalia o risco dinamicamente por consulta e aplica privacidade diferencial hierárquica apenas ao conteúdo que se torna sensível naquele contexto específico.

Fonte ↗
panoramaOS-2026-025 · 2026-07-17
0

Novo protocolo de agregação segura elimina repasse de dados entre usuários em federated learning com um único servidor

O trabalho propõe NFSA, um protocolo de agregação segura para federated learning que combina Shamir's Secret Sharing com PRF aditiva de duas partes para eliminar a necessidade de um servidor central repassar segredos entre os participantes, reduzindo overhead de comunicação e a superfície de risco associada a esse repasse. Os autores reportam ganhos de até 100x em eficiência de comunicação e redução de até 75% no tempo de computação do cliente em relação a esquemas anteriores.

Fonte ↗
risco altoOS-2026-026 · 2026-07-17
0

Pesquisa mostra como um README malicioso basta para comprometer agentes de codificação de IA durante o setup do projeto

O estudo demonstra sistematicamente que agentes de codificação de IA instalam dependências listadas em documentação de projeto (README, requirements, Makefile) sem verificar nome, origem ou histórico de vulnerabilidades, tornando a própria documentação um vetor de execução de código. Testando doze cenários em cinco classes de ataque contra harnesses de produção, os autores mostram que nomes com confusão de separador (como "azurecore" no lugar de "azure-core") e redirecionamento de registro escapam da detecção na maioria dos casos, mesmo quando typosquats óbvios são pegos.

Fonte ↗
panoramaOS-2026-027 · 2026-07-17
0

Estudo de custo-benefício mostra que agentes ofensivos escalam com mais poder computacional, mas defesa em SOC não

O trabalho avalia agentes de IA de segurança sob uma lente de custo, comparando desempenho ofensivo (desafios Cybench) e defensivo (investigações Splunk BOTS v1) em níveis fixos de orçamento de inferência, em vez de apenas o melhor resultado possível com gasto ilimitado. A conclusão central é que capacidade ofensiva melhora consistentemente com mais computação — permitindo que modelos open-weight bem escalados cheguem perto de sistemas proprietários de ponta — enquanto o desempenho defensivo em SOC depende mais de uso disciplinado de ferramentas e navegação de telemetria do que de força bruta de raciocínio.

Fonte ↗
risco médioOS-2026-013 · 2026-01-25
0

Levantamento sistemático mapeia injeção de prompt contra assistentes de codificação com IA

Pesquisadores consolidaram 78 estudos sobre ataques de injeção de prompt a assistentes de codificação agênticos (Claude Code, Cursor e similares) numa taxonomia por vetor de entrega, modalidade e comportamento de propagação. O dado mais duro: ataques adaptativos superam 85% de sucesso mesmo contra as defesas mais avançadas avaliadas.

Fonte ↗