-Rec: A Verifiable Benchmark for Agentic Recommender Systems
O artigo introduz o -Rec, um benchmark verificável para sistemas de recomendação agênticos que substitui as avaliações subjetivas baseadas em LLM por recompensas estruturadas e um mecanismo de elicitação com marcação de revelação, revelando uma lacuna significativa de confiabilidade nos atuais agentes conversacionais, onde mesmo os melhores modelos lutam para atender consistentemente às restrições da tarefa.