LLMs afinados podem esconder mensagens secretas nas próprias respostas, e sondas internas ajudam a detectar isso
O estudo aprofunda ataques de esteganografia em que um LLM fine-tunado codifica secretamente informação do prompt na sua saída, propondo esquemas de 'baixa recuperabilidade' derivados do espaço de embeddings que dificultam a extração do segredo por terceiros. Como contrapartida defensiva, sondas lineares treinadas sobre ativações de camadas finais detectam a presença do segredo com até 33% mais precisão em modelos fine-tunados do que em modelos base.
Fonte ↗