Benchmark de assistentes domésticos multimodais expõe dilema entre executar comandos falsos e ignorar comandos reais
Pesquisadores criaram o PromptShield-Home, um benchmark de cenários realistas de casa inteligente para testar se assistentes multimodais conseguem distinguir um comando genuíno de um usuário de conteúdo ambiente — fala de TV, texto na tela, uma conversa ouvida ao fundo — que apenas parece um comando. O estudo compara detectores tradicionais, um único agente multimodal e mediação multiagente, e descobre que as duas primeiras abordagens falham de formas opostas e complementares.
Fonte ↗