GFlowNets treinam um LLM atacante para gerar ataques adversariais mais criativos que datasets fixos de red teaming
O estudo propõe usar GFlowNets — uma classe de modelos generativos pensada para amostrar diversamente de distribuições complexas — para treinar um LLM atacante contra um LLM vítima, automatizando red teaming sem depender de conjuntos fixos de prompts adversariais e produzindo uma pontuação quantitativa de robustez do modelo alvo. Como contribuição adicional, os autores estendem a técnica para gerar ataques também em turco, além do inglês, mostrando que a abordagem supera benchmarks existentes em eficácia.
Fonte ↗