olimposec.com
tema

#interpretabilidade

1 publicação marcada com esta tag.

risco médioOS-2026-044 · 2026-07-20
0

LLMs afinados podem esconder mensagens secretas nas próprias respostas, e sondas internas ajudam a detectar isso

O estudo aprofunda ataques de esteganografia em que um LLM fine-tunado codifica secretamente informação do prompt na sua saída, propondo esquemas de 'baixa recuperabilidade' derivados do espaço de embeddings que dificultam a extração do segredo por terceiros. Como contrapartida defensiva, sondas lineares treinadas sobre ativações de camadas finais detectam a presença do segredo com até 33% mais precisão em modelos fine-tunados do que em modelos base.

Fonte ↗