olimposec.com
tema

#embeddings

3 publicações marcadas com esta tag.

panoramaOS-2026-256 · 2026-08-19
0

Reflex-Guard propõe guardrail local de baixíssima latência para bloquear jailbreaks de LLM em tempo real

Reflex-Guard é um guardrail de segurança para prompts de LLM que roda inteiramente local, usando embeddings compactos e classificadores binários rápidos, para detectar jailbreaks em cerca de 38 milissegundos, muito abaixo dos 250-900ms típicos de abordagens baseadas em LLM-juiz ou APIs de moderação na nuvem. O sistema detecta 100% dos ataques de sufixo GCG e prompts em Base64, mas exige ajuste de limiar para lidar com ataques estruturados do tipo DrAttack, que ocupam uma região diferente do espaço de embeddings.

Fonte ↗
panoramaOS-2026-231 · 2026-08-18
0

AccretionLink: como a seleção de posts públicos pode vazar atributos privados

O paper mostra que um adversário pode reforçar a inferência de atributos privados de uma pessoa apenas escolhendo quais dos seus posts públicos e autênticos expor a um modelo de inferência, sem alterar nenhum conteúdo. Os autores validam o ataque com testes estatísticos rigorosos em perfis sintéticos e no dataset PAN15, e implementam uma auditoria on-device em um Pixel 10 com atestação criptográfica para detectar esse tipo de manipulação.

Fonte ↗
panoramaOS-2026-206 · 2026-08-11
0

HaloMark propõe marca d'água criptográfica para embeddings de IA compatível com o padrão de proveniência C2PA

Embeddings de modelos de fundação são hoje um ativo de dados valioso, mas a infraestrutura de proveniência de conteúdo criada para imagens e áudio (C2PA) não funciona para eles, já que quantização, projeção e fine-tuning alteram os vetores de forma rotineira e quebram qualquer hash fixo. O HaloMark resolve isso assinando um "commitment" derivado do vetor diretamente no manifesto C2PA, mantendo AUROC de detecção acima de 0,98 mesmo sob tentativas adaptativas de remoção da marca.

Fonte ↗