olimposec.com
tema

#deteccao

8 publicações marcadas com esta tag.

panoramaOS-2026-226 · 2026-08-13
0

Técnica "self-feeding" detecta backdoors em LLMs de peso aberto realimentando a própria saída do modelo

Pesquisadores propõem um teste de caixa-preta barato para checar se um LLM baixado de um repositório público esconde um backdoor: alimentar repetidamente a própria saída do modelo de volta como entrada, deixando o texto derivar até tocar nos dados usados no fine-tuning malicioso. A técnica encontrou backdoors em cinco de seis modelos testados com 92% de precisão agregada, contra apenas um acerto em 120 tentativas de um baseline que repete o mesmo prompt.

Fonte ↗
risco médioOS-2026-186 · 2026-08-10
0

LoRAScan detecta prompts de backdoor em adaptadores LoRA analisando picos de ativação, sem alterar o modelo

LoRAScan explora o fato de que, em adaptadores LoRA comprometidos, cerca de 5% dos pontos de inserção permanecem estáveis em entradas limpas mas disparam picos de ativação na camada de down-projection quando um gatilho de backdoor está presente. Monitorando esses pontos em tempo de inferência, sem modificar os pesos do adaptador, o método rejeita cerca de 98,5% das entradas maliciosas com baixa taxa de erro em entradas legítimas, superando defesas anteriores que diluem o sinal de backdoor ao mesclar o adaptador ao modelo base ou apenas sinalizam o adaptador inteiro como suspeito.

Fonte ↗
risco médioOS-2026-189 · 2026-08-10
0

D-SCAN detecta envenenamento de RAG observando colapso de atenção em documentos maliciosos

Os autores mostram que ataques de envenenamento de RAG bem-sucedidos costumam produzir respostas com perplexidade ainda menor que gerações benignas, o que invalida detectores baseados em incerteza, mas induzem um padrão interno diferente, batizado 'Attention Collapse': a atenção do modelo se concentra nos documentos envenenados em vez de ficar dispersa entre as fontes recuperadas. A partir dessa observação, o framework D-SCAN monitora a dinâmica de atenção em nível de documento para sinalizar gerações atacadas, inclusive nos casos em que o ataque falha em mudar a resposta final.

Fonte ↗
panoramaOS-2026-168 · 2026-08-07
0

Novo classificador combina contexto e consulta para detectar instruções maliciosas escondidas em texto, mesmo sob evasão adaptativa

Pesquisadores propõem um detector de injeção de prompt indireta que segmenta um texto em frases benignas e maliciosas levando em conta o contexto e a consulta original do usuário, algo que abordagens anteriores não faziam de forma combinada. O trabalho também introduz duas formas de treinamento adversarial para blindar o classificador contra tentativas de evasão, superando as defesas existentes tanto em ataques estáticos quanto adaptativos.

Fonte ↗
panoramaOS-2026-171 · 2026-08-07
0

Ferramenta detecta, via análise de ativações, quando o treinamento de segurança de um modelo foi removido ou contornado

Pesquisadores apresentam o AMS (Activation-based Model Scanner), que detecta modificações no treinamento de segurança de LLMs medindo a geometria de conceitos relacionados a conteúdo nocivo no espaço de ativações do modelo. Testado em 14 configurações de quatro famílias de modelos abertos (Llama, Gemma, Qwen, Mistral), o AMS classifica corretamente 10 de 14 casos em validação cruzada, e a métrica que ele extrai se correlaciona de forma estatisticamente significativa com o quanto o modelo de fato obedece a pedidos prejudiciais em testes de jailbreak.

Fonte ↗
panoramaOS-2026-140 · 2026-08-05
0

Pesquisadores encontram sinais latentes de injeção de prompt escondidos nos estados internos de LLMs agentic

Um novo estudo mostra que LLMs agentic frequentemente 'sabem' internamente que estão sob um ataque de prompt injection indireta antes mesmo de decidir como agir, e que esse sinal pode ser extraído por um simples classificador linear treinado sobre os estados ocultos do modelo. Os autores identificam, porém, uma lacuna entre esse reconhecimento interno e a ação tomada, e propõem uma defesa que usa esse sinal para forçar um raciocínio anti-injeção sob demanda.

Fonte ↗
panoramaOS-2026-073 · 2026-07-23
0

ChainWatch usa modelo de Markov oculto para detectar ataques em multiplos passos contra agentes MCP

Pesquisadores propoem o ChainWatch, um framework que modela a progressao de ataques contra agentes de IA baseados em Model Context Protocol (MCP) como uma cadeia de seis estagios, detectando sequencias maliciosas compostas por chamadas de ferramenta individualmente inofensivas. A abordagem ataca diretamente a limitacao das defesas atuais, que inspecionam cada chamada isoladamente e por isso nao enxergam padroes de ataque distribuidos ao longo de uma sessao.

Fonte ↗
panoramaOS-2026-068 · 2026-07-22
0

Pesquisa propõe atribuir campanhas de ataque distribuídas entre agentes de IA distintos sem compartilhar estado entre eles

Defesas para agentes LLM hoje avaliam cada sessão isoladamente, mas um atacante pode espalhar uma campanha entre agentes, equipes e runtimes independentes, deixando cada guarda-corpo local só com um fragmento esparso do ataque. Os autores formalizam esse problema de atribuição assíncrona entre agentes e propõem os A²FV (Asynchronous Attribution Fingerprint Vectors), um protocolo leve do lado do proxy que liga sessões da mesma campanha usando apenas uso de ferramentas, temporização e resíduos de prompt observáveis externamente, sem acesso a identidade do atacante ou rótulos de campanha em tempo de teste.

Fonte ↗