olimposec.com
tema

#defesa

12 publicações marcadas com esta tag.

risco médioOS-2026-299 · 2026-08-26
0

RAGSentinel detecta documentos envenenados em RAG sem precisar de treinamento ou rótulos

Defesa geométrica para sistemas RAG usa um encoder substituto para medir como cada documento recuperado desloca o estado oculto do modelo, filtrando como outliers os documentos que tentam manipular a resposta, com garantia formal de recuperar um contexto livre de veneno sob suposição de maioria honesta.

Fonte ↗
risco médioOS-2026-260 · 2026-08-20
0

FedLNS propõe triagem no servidor contra clientes maliciosos em treinamento federado de LLMs

Pesquisadores apresentam o FedLNS, um mecanismo do lado do servidor para detectar atualizações maliciosas em aprendizado federado de modelos de linguagem, sem exigir acesso aos dados brutos dos clientes nem exemplos rotulados de ataque. A ideia é usar as mudanças nos parâmetros das camadas de normalização (LayerNorm) de cada atualização de cliente como uma "assinatura" comparável a uma referência histórica robusta entre clientes. Em experimentos com até 40% dos clientes manipulando alvos de treino, o método reduziu a perplexidade do modelo global mais do que seis baselines concorrentes, em arquiteturas estilo GPT, BERT e LLaMA.

Fonte ↗
panoramaOS-2026-232 · 2026-08-18
0

STAR-FL: defesa em duas camadas contra envenenamento de dados em aprendizado federado

O paper propõe o STAR-FL, um framework de defesa para federated learning que combina clustering espaço-temporal para identificar atualizações maliciosas de clientes com um ajuste adaptativo da taxa de aprendizado na agregação, reduzindo o impacto de envenenamentos que escapam da primeira camada. Os autores reportam desempenho superior a defesas do estado da arte contra ataques de poisoning direcionados em múltiplos benchmarks de visão computacional.

Fonte ↗
panoramaOS-2026-198 · 2026-08-11
0

Defesa "Capability-Routed Guard" mira jailbreaks que exploram o raciocínio de modelos de raciocínio grandes

Pesquisadores propõem o Capability-Routed Guard (CRG), uma defesa de inferência para modelos de raciocínio de código fechado que ataca um problema específico: prompts adversariais que manipulam o contexto de raciocínio ou a decomposição de tarefas para fazer o modelo tratar um objetivo malicioso como um passo de raciocínio legítimo. Em vez de inspecionar o prompt adversarial diretamente, o CRG constrói uma representação confiável da tarefa autorizada por um canal separado e roteia a execução conforme o risco.

Fonte ↗
panoramaOS-2026-200 · 2026-08-11
0

BASIS usa sinais de atenção para reduzir recusas desnecessárias em defesas de prompt injection

O BASIS ataca um problema pouco discutido em defesas contra prompt injection: modelos bem instruídos conseguem resistir à maioria das injeções sozinhos, mas defesas tradicionais recusam qualquer entrada onde uma injeção é detectada, mesmo quando o modelo teria lidado com ela corretamente. Usando um sinal chamado Attention Competition Ratio para treinar dois probes lineares esparsos, o método mantém detecção quase perfeita de injeção reduzindo substancialmente essas recusas desnecessárias, sem exigir inferência adicional do LLM.

Fonte ↗
panoramaOS-2026-156 · 2026-08-06
0

AgentAntibody propõe defesa que aprende com cada tentativa de prompt injection contra agentes de LLM

Os autores propõem uma analogia com o sistema imune adaptativo: em vez de tratar cada tarefa como um problema isolado, o AgentAntibody mantém uma biblioteca persistente de 'anticorpos' que captura o entendimento evolutivo do agente sobre os limites de segurança aceitáveis pelo usuário, aplicando esse aprendizado acumulado a cada nova interação. Em testes com três benchmarks e quatro LLMs base, o método superou defesas existentes tanto em bloquear ações maliciosas quanto em preservar a conclusão de tarefas legítimas.

Fonte ↗
panoramaOS-2026-161 · 2026-08-06
0

SecureCollaRAG usa validação por GNN para blindar sistemas RAG colaborativos contra envenenamento de conhecimento

Sistemas de geração aumentada por recuperação (RAG) reduzem alucinação em LLMs, mas abrem uma nova superfície de ataque: envenenar os documentos recuperados para manipular a saída do modelo. O SecureCollaRAG propõe um framework tolerante a falhas bizantinas que valida dinamicamente a proveniência dos documentos usando credibilidade baseada em GNN, mantendo robustez mesmo sob distribuições de dados não-IID entre agentes colaborativos.

Fonte ↗
risco médioOS-2026-137 · 2026-08-03
0

Framework detecta injeção de prompt distribuída em enxames de drones controlados por LLM

Pesquisadores propõem um framework de verificação em tempo de execução, em três camadas, para detectar violações de missão em enxames de drones e robôs assistidos por LLM que emergem apenas da composição de ações individualmente aceitáveis em cada plataforma. Em simulação, o framework detectou uma injeção indireta de prompt que fez quatro plataformas dividirem entre si um objetivo proibido, algo invisível a monitores por plataforma. O design evita 'tudo limpo' falso quando falta evidência, em vez de assumir segurança por padrão.

Fonte ↗
risco médioOS-2026-072 · 2026-07-23
0

ChannelGuard revela que a seguranca de pipelines multi-agente depende de filtros que ninguem media

Um estudo com 2.100 execucoes de ataque mostra que pipelines multi-agente que pareciam totalmente seguros em relatorios padrao (0% de sucesso de ataque) na verdade devem quase toda essa protecao a um filtro server-side do provedor de nuvem, e nao a defesas da propria aplicacao. Os autores propoem o ChannelGuard, portoes de information bottleneck colocados em cada canal entre agentes, para fechar essa lacuna sem depender de um unico ponto de filtragem opaco.

Fonte ↗
panoramaOS-2026-076 · 2026-07-23
0

FedLSG usa LLM em arquitetura student-teacher para defender aprendizado federado em grafos contra backdoor

O FedLSG e apresentado como o primeiro framework a integrar LLMs na defesa contra ataques de backdoor em Redes Neurais de Grafos Federadas (FedGNNs), traduzindo estruturas de grafo e comportamento de clientes para linguagem natural de modo que um LLM possa avaliar semanticamente se uma atualizacao e maliciosa. A motivacao e que defesas baseadas em regras fixas sao vulneraveis a gatilhos furtivos justamente por nao entenderem o significado semantico dos padroes que estao filtrando.

Fonte ↗
panoramaOS-2026-079 · 2026-07-23
0

DeCNIP remove backdoors de LLMs podando neuronios criticos identificados por analise representacional

O DeCNIP e uma defesa contra backdoors em LLMs que vai alem de heuristicas comportamentais, identificando e podando um conjunto minimo de neuronios responsaveis por ativar o gatilho malicioso. O metodo cobre tanto backdoors inseridos por fine-tuning quanto por edicao direta de modelo, reduzindo a taxa de sucesso do ataque em mais de 95% intervindo em apenas 0,1% dos neuronios e preservando 97% do desempenho original em tarefas normais.

Fonte ↗