olimposec.com
tema

#treinamento-adversarial

1 publicação marcada com esta tag.

panoramaOS-2026-168 · 2026-08-07
0

Novo classificador combina contexto e consulta para detectar instruções maliciosas escondidas em texto, mesmo sob evasão adaptativa

Pesquisadores propõem um detector de injeção de prompt indireta que segmenta um texto em frases benignas e maliciosas levando em conta o contexto e a consulta original do usuário, algo que abordagens anteriores não faziam de forma combinada. O trabalho também introduz duas formas de treinamento adversarial para blindar o classificador contra tentativas de evasão, superando as defesas existentes tanto em ataques estáticos quanto adaptativos.

Fonte ↗