olimposec.com
tema

#toxicidade

1 publicação marcada com esta tag.

risco médioOS-2026-039 · 2026-07-20
0

Humor como mecanismo de defesa contra jailbreak pode ele mesmo ser explorado para injetar conteúdo nocivo

Um estudo com mais de 30 mil interações reais e 45 comediantes profissionais mostra que usar humor como recusa indireta em LLMs — pensado para reduzir recusas excessivas e riscos de prefix injection — introduz seus próprios riscos de segurança latentes, como estereótipos e toxicidade. Os autores propõem o ataque HumorPIA, que injeta conteúdo nocivo de forma encoberta sob aparência de recusa humorística segura, elevando a toxicidade em 3,14x mantendo taxa de segurança aparente de 97,8%.

Fonte ↗