olimposec.com
tema

#backdoor

18 publicações marcadas com esta tag.

risco médioOS-2026-294 · 2026-08-26
0

ROBBIN usa Rowhammer para implantar backdoors em modelos de IA direto na memória

Pesquisadores demonstram um ataque "hardware-aware" que explora os bit-flips do Rowhammer em DRAM DDR4 real para injetar backdoors em redes neurais durante a inferência, atingindo cerca de 90% de taxa de sucesso mantendo mais de 83% de acurácia normal, adaptando o ataque ao padrão específico de cada chip.

Fonte ↗
risco médioOS-2026-297 · 2026-08-26
0

STAIN-FL: backdoors furtivos em aprendizado federado para vigilância por vídeo usam condições da cena como gatilho

Pesquisadores mostram como um cliente malicioso em um sistema federado de detecção de anomalias em vigilância pode implantar backdoors usando condições naturais da cena (pouca luz, ambientes internos, aglomerações) como gatilho, em vez de um padrão artificial, mantendo o ataque furtivo e persistente por centenas de rodadas.

Fonte ↗
risco médioOS-2026-302 · 2026-08-26
0

RACER remove backdoors de modelos multimodais usando apenas 100 amostras limpas

Framework de reparo identifica uma "anomalia de inconsistência entre camadas" causada por gatilhos de backdoor em regiões específicas dos tokens visuais ou textuais de um MLLM, e usa esse sinal para gerar um ajuste fino adversarial que elimina o comportamento malicioso sem precisar saber qual é o gatilho.

Fonte ↗
risco altoOS-2026-275 · 2026-08-21
0

14 pacotes npm trojanizados distribuem backdoor Linux RedC2 4.0 com C2 controlado por IA

Pesquisadores da TrendAI (Trend Micro) identificaram 14 pacotes npm disfarçados de utilitários de calendário e streak que instalam um implante malicioso multiplataforma chamado RedC2 4.0. O framework inclui o módulo "Red Agent", que usa um LLM para traduzir comandos em linguagem natural para sequências de comandos do beacon, reduzindo a barreira tecnica para operar o C2.

Fonte ↗
panoramaOS-2026-225 · 2026-08-13
0

Instalar um backdoor conhecido para depois removê-lo ajuda a limpar backdoors desconhecidos em agentes LLM

Pesquisadores testaram a estratégia de "envenenamento defensivo": instalar deliberadamente um backdoor conhecido num agente LLM comprometido e depois desaprendê-lo, na esperança de que o backdoor original oculto seja removido como efeito colateral. Em 115 experimentos, essa técnica sozinha eliminou cerca de 56% dos backdoors originais, e a descontaminação subsequente removeu quase todos os sobreviventes — mas vestígios do gatilho original persistiram nas camadas internas do modelo mesmo após o comportamento malicioso ser eliminado.

Fonte ↗
panoramaOS-2026-226 · 2026-08-13
0

Técnica "self-feeding" detecta backdoors em LLMs de peso aberto realimentando a própria saída do modelo

Pesquisadores propõem um teste de caixa-preta barato para checar se um LLM baixado de um repositório público esconde um backdoor: alimentar repetidamente a própria saída do modelo de volta como entrada, deixando o texto derivar até tocar nos dados usados no fine-tuning malicioso. A técnica encontrou backdoors em cinco de seis modelos testados com 92% de precisão agregada, contra apenas um acerto em 120 tentativas de um baseline que repete o mesmo prompt.

Fonte ↗
risco altoOS-2026-215 · 2026-08-12
0

Backdoor "programável" em modelos de visão e linguagem permite ao atacante escolher o alvo do ataque depois do treinamento

Pesquisadores demonstram que uma única fase de envenenamento de dados pode implantar em um modelo de visão e linguagem (VLM) um backdoor programável, no qual o atacante escolhe em tempo de inferência — sem retreinar o modelo — qual legenda-alvo, nunca vista durante o envenenamento, deve ser produzida, e sintetiza sob demanda um gatilho visual furtivo correspondente. A técnica mantém alta taxa de sucesso mesmo contra defesas clássicas de backdoor e preserva a utilidade do modelo em entradas limpas, ampliando substancialmente a superfície de risco frente aos backdoors estáticos já conhecidos na literatura.

Fonte ↗
panoramaOS-2026-203 · 2026-08-11
0

Estudo modela cenário "Order 66": backdoors dormentes em sistemas de agentes de LLM que só se ativam depois do lançamento

Inspirado na metáfora de uma ordem oculta que se ativa e vira toda uma população confiável contra o sistema que protege, o artigo formaliza um modelo composicional de ameaça para agentes de LLM: um artefato ou memória compartilhada carrega uma regra destrutiva dormente, uma mensagem ou atualização posterior a ativa, e o próprio harness do agente fornece a autoridade operacional para o dano acontecer. Os autores concluem que nenhuma defesa isolada — nem varredura de checkpoint, nem filtragem de prompt — fecha todas as rotas de propagação, e que o cenário completo ainda não foi observado publicamente, apenas seus componentes isolados.

Fonte ↗
risco médioOS-2026-186 · 2026-08-10
0

LoRAScan detecta prompts de backdoor em adaptadores LoRA analisando picos de ativação, sem alterar o modelo

LoRAScan explora o fato de que, em adaptadores LoRA comprometidos, cerca de 5% dos pontos de inserção permanecem estáveis em entradas limpas mas disparam picos de ativação na camada de down-projection quando um gatilho de backdoor está presente. Monitorando esses pontos em tempo de inferência, sem modificar os pesos do adaptador, o método rejeita cerca de 98,5% das entradas maliciosas com baixa taxa de erro em entradas legítimas, superando defesas anteriores que diluem o sinal de backdoor ao mesclar o adaptador ao modelo base ou apenas sinalizam o adaptador inteiro como suspeito.

Fonte ↗
risco médioOS-2026-172 · 2026-08-07
0

ARIA automatiza a criação de backdoors furtivos em instruções de LLMs personalizados para geração de código

Pesquisadores apresentam o ARIA, um framework de red teaming automatizado que usa um LLM atacante para gerar e refinar instruções com backdoor contra plataformas de personalização de LLM que operam só por system prompt, sem alterar os pesos do modelo. O ataque atingiu 94,5% de taxa de sucesso preservando a utilidade da tarefa original, além de evadir quase totalmente mecanismos de detecção do lado da plataforma e do usuário, com taxa de falso negativo chegando a 1,0.

Fonte ↗
panoramaOS-2026-155 · 2026-08-06
0

CASCADE usa predição conforme para detectar pares imagem-texto envenenados em modelos como o CLIP

Pesquisadores mostram que defesas de detecção de backdoor em aprendizado contrastivo multimodal, baseadas na métrica CLIPScore, falham porque a distribuição de scores de pares benignos e envenenados se sobrepõe significativamente. O framework proposto, CASCADE, usa predição conforme em duas etapas para gerar limites de confiança estatisticamente garantidos, alcançando falso-positivo médio de 5,79% com 100% de detecção verdadeira no dataset CC3M.

Fonte ↗
risco médioOS-2026-148 · 2026-08-05
0

Backdoors conseguem enganar o monitoramento de chain-of-thought, escondendo comportamento malicioso do próprio raciocínio do modelo

Um estudo demonstra que é possível implantar backdoors em modelos de raciocínio, via fine-tuning relativamente simples, que fazem o modelo executar um comportamento malicioso escolhido pelo atacante enquanto seu chain-of-thought (CoT) visível permanece aparentemente benigno. Os autores encontram um caminho de ativação interno condicionado ao gatilho que independe do raciocínio exibido, e argumentam que monitorar CoT deveria ser reformulado como um problema de consistência entre pensamento e ação, não apenas de detecção de anomalias no texto do raciocínio.

Fonte ↗
risco altoOS-2026-122 · 2026-07-31
0

Backdoor 'clean-label' explora a dimensão temporal de redes neurais de pulso e passa despercebido pelas defesas atuais

Pesquisadores introduzem um ataque de backdoor clean-label contra redes neurais de pulso que reordena os timestamps dos eventos de amostras da classe-alvo, preservando exatamente a contagem de eventos por pixel e por polaridade — de forma que a amostra continua com o rótulo original correto e parece estatisticamente idêntica a uma amostra limpa quando agregada no tempo. O ataque atinge taxa de sucesso de 100% nas configurações mais fortes, contra modelos convolucionais e baseados em transformer, em três datasets neuromórficos diferentes. Defesas que colapsam o eixo temporal antes de inspecionar as amostras são cegas a esse ataque por construção, já que a informação maliciosa vive exclusivamente na ordem temporal dos eventos.

Fonte ↗
risco altoOS-2026-084 · 2026-07-24
0

Atacante deixou o agente de IA Hermes rodando sem supervisão dentro da rede do Ministério das Finanças da Tailândia

Um invasor instalou o assistente open source Hermes, da Nous Research, em um servidor alugado, desativou as confirmações de segurança do modo "YOLO" e o apontou para a rede do Ministério das Finanças da Tailândia. Operando de forma autônoma, o agente varreu hosts em busca de escalonamento de privilégio, vasculhou sistemas de arquivos e ajudou a implantar backdoors, em um caso raro de pós-exploração conduzida majoritariamente por um agente de IA sem intervenção humana constante.

Fonte ↗
panoramaOS-2026-076 · 2026-07-23
0

FedLSG usa LLM em arquitetura student-teacher para defender aprendizado federado em grafos contra backdoor

O FedLSG e apresentado como o primeiro framework a integrar LLMs na defesa contra ataques de backdoor em Redes Neurais de Grafos Federadas (FedGNNs), traduzindo estruturas de grafo e comportamento de clientes para linguagem natural de modo que um LLM possa avaliar semanticamente se uma atualizacao e maliciosa. A motivacao e que defesas baseadas em regras fixas sao vulneraveis a gatilhos furtivos justamente por nao entenderem o significado semantico dos padroes que estao filtrando.

Fonte ↗
panoramaOS-2026-079 · 2026-07-23
0

DeCNIP remove backdoors de LLMs podando neuronios criticos identificados por analise representacional

O DeCNIP e uma defesa contra backdoors em LLMs que vai alem de heuristicas comportamentais, identificando e podando um conjunto minimo de neuronios responsaveis por ativar o gatilho malicioso. O metodo cobre tanto backdoors inseridos por fine-tuning quanto por edicao direta de modelo, reduzindo a taxa de sucesso do ataque em mais de 95% intervindo em apenas 0,1% dos neuronios e preservando 97% do desempenho original em tarefas normais.

Fonte ↗
risco médioOS-2026-036 · 2026-07-20
0

Sons do cotidiano podem virar gatilhos furtivos de backdoor em sistemas de reconhecimento de voz

Pesquisadores demonstram backdoors em modelos de reconhecimento de fala ativados por sons naturais do dia a dia, em vez de ruídos artificiais facilmente filtráveis. Com apenas 5% de amostras de treino envenenadas, o ataque atinge taxa de sucesso próxima de 100% sem prejudicar o desempenho do modelo em entradas legítimas.

Fonte ↗
panoramaOS-2026-042 · 2026-07-20
0

SpeechGuard filtra e higieniza áudio envenenado em tempo real para blindar reconhecimento de voz contra backdoors

SpeechGuard é apresentado como o primeiro pipeline online de defesa contra backdoors em modelos de reconhecimento de fala, combinando uma versão adaptada do método STRIP para detectar amostras envenenadas com uma etapa de purificação por mascaramento tempo-frequência que neutraliza o gatilho antes da inferência. O sistema mantém boa acurácia mesmo quando o próprio áudio envenenado é apresentado, prevenindo a ativação do backdoor sem retreinar o modelo.

Fonte ↗