Um pesquisador propõe aplicar uma regra de autorização de audiência diretamente no momento em que a memória de um agente de IA pessoal é convertida em contexto de prompt, impedindo que um fato aprendido em uma conversa vaze para um público não autorizado em outra conversa. A defesa funciona por exclusão determinística, não por confiar que o modelo se recuse a repetir a informação, e em testes sintéticos nenhum fato proibido chegou a entrar no contexto montado.
Fonte ↗Pesquisadores propõem o FAVA, um framework que substitui listas estáticas de permissão por autorização verificada em tempo de execução para agentes de LLM. Tarefas em linguagem natural são traduzidas para um grafo de permissões rastreável, que um solver SMT confere contra políticas de segurança antes de qualquer ação com efeito real ser executada. Em benchmarks como OpenAgentSafety, OctoBench e ActPlane, o sistema atingiu 90,5% de conformidade nas decisões, interceptando ações que violavam a política dinamicamente.
Fonte ↗O artigo caracteriza o que os autores chamam de "hijacked authorized agent problem": um agente de IA que administra jobs, builds e workflows científicos em ambientes de HPC atua sob as credenciais do próprio usuário, de modo que instruções maliciosas plantadas em logs, descrições de ferramenta, arquivos compartilhados ou mensagens de outros agentes podem redirecioná-lo para ações fora do escopo original, mesmo que cada comando resultante seja autenticado e permitido para aquela conta. Os autores propõem uma agenda de pesquisa e um benchmark futuro, o TaskBound, para medir esse desvio.
Fonte ↗