Humor como mecanismo de defesa contra jailbreak pode ele mesmo ser explorado para injetar conteúdo nocivo
Um estudo com mais de 30 mil interações reais e 45 comediantes profissionais mostra que usar humor como recusa indireta em LLMs — pensado para reduzir recusas excessivas e riscos de prefix injection — introduz seus próprios riscos de segurança latentes, como estereótipos e toxicidade. Os autores propõem o ataque HumorPIA, que injeta conteúdo nocivo de forma encoberta sob aparência de recusa humorística segura, elevando a toxicidade em 3,14x mantendo taxa de segurança aparente de 97,8%.
Fonte ↗