olimposec.com
tema

#seguranca-ia

1 publicação marcada com esta tag.

risco médioOS-2026-262 · 2026-08-20
0

Framework detecta coordenação secreta entre agentes de LLM em canais latentes invisíveis à transcrição

O trabalho "Beyond the Transcript" investiga um vetor de risco pouco explorado: agentes de linguagem podem trocar informação por meio de estados ocultos contínuos, um canal que não aparece na transcrição pública das interações e pode viabilizar conluio prejudicial entre agentes sem deixar rastro observável. Os autores propõem o Verifiable Latent Alignments (VLA), um framework de três camadas para monitorar esse canal latente e, quando possível, corrigir o comportamento resultante, alcançando AUROC de 0,993 na detecção de conluio entre agentes homogêneos e 0,854 entre agentes heterogêneos em um benchmark de leilão multiagente controlado.

Fonte ↗