olimposec.com
tema

#desinformacao

2 publicações marcadas com esta tag.

risco médioOS-2026-289 · 2026-08-24
0

Agente de avaliação detecta envenenamento de conhecimento em RAG antes de o LLM gerar a resposta

O 'Evaluation Agent' combina verificação factual por inferência de linguagem natural, um detector de envenenamento com cinco sinais e um Índice de Confiança combinado para identificar documentos maliciosos injetados em sistemas RAG antes que o LLM os use para gerar resposta. No TruthfulQA com Llama 3.3 70B, atingiu 91% de acurácia e 100% de recall contra injeção de instrução, mas teve dificuldade com trocas sutis de entidade e enfraquecimento semântico.

Fonte ↗
risco médioOS-2026-040 · 2026-07-20
0

Marca d'água de texto gerado por IA não resiste a paráfrase e falha em critérios legais de admissibilidade forense

Um estudo submetido à AIES 2026 testa três métodos de watermarking de LLM (KGW, Unigram e SynthID-Text) contra os critérios legais Daubert e o processo forense NIST SP 800-86. Uma simples paráfrase que preserva o sentido remove a marca d'água em praticamente 100% dos casos para KGW e Unigram e em 98,3% para SynthID, e nenhum dos três métodos atende a mais de dois dos cinco fatores Daubert.

Fonte ↗