TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning
本文介绍了 TREK,这是一个具有确定性评估器和大规模合成旅行数据集的严谨且完全可复现的基准测试,旨在评估大语言模型智能体生成可行且符合约束条件的行程的能力,并揭示了即使是尖端模型在处理多约束规划和满足未说明的用户需求方面也存在显著困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何规划一次度假。在人工智能的世界里,这些机器人被称为“LLM智能体”(LLM agents)。它们就像数字旅行社,能够阅读你凌乱的文本信息,理解你的需求,然后去互联网上预订机票、寻找酒店并安排观光行程。但问题在于:仅仅因为一个机器人能“谈论”一次完美的旅行,并不意味着它真的能“构建”出一次旅行。一个真实的度假计划是一个精密的拼图。每一趟航班必须真实存在,酒店必须处于营业状态,城市间的行驶时间必须在合理范围内,且总费用必须符合你的预算。如果机器人编造了一个航班号,或者忘记了博物馆下午5点关门,整个计划就会崩塌。长期以来,我们一直在通过让这些机器人写关于旅行的故事来测试它们,但我们一直缺乏一种严格的方法来检查它们的计划在现实世界中是否真的可行。
这正是名为 TREK(旅行推理与评估工具包)的一项新研究所发挥作用的地方。把 TREK 想象成一个针对旅行规划机器人的大规模、高风险“飞行模拟器”。研究人员没有让机器人靠猜,而是构建了一个完全一致的虚拟世界,其中包含分布在375个城市的212,530条航班、酒店和景点的记录。随后,他们给15个不同的AI智能体布置了800个旅行挑战。其中一些挑战是可能的,而另一些则是无法实现的(比如试图飞往一个没有机场的城市)。机器人必须使用一套特殊的工具来构建计划,然后由一个严格的、基于计算机的裁判(没有任何人类或AI“法官”来宽容处理)来检查每一个细节。其目标是观察这些机器人能否生成一个不仅是一个动听的故事,而且是一个完美可执行、无误的行程,同时尊重旅行者隐藏的需求,例如是否无障碍通行或是否宠物友好。
研究结果带来了一次现实的警示。即使是这项在2027年研究中表现最强的模型 GPT-5.6,也仅能为所有可能的旅行创造出完全完美、可用的计划,成功率仅为 46.2%。平均水平的机器人表现要差得多,中位成功率仅为 6.6%,有些甚至完全失败,得分为 0.0%。研究发现,机器人在处理“枯燥”事务方面其实做得相当不错:它们很少编造虚假航班(幻觉),并且通常能识别出某次旅行是否无法实现。然而,当涉及到理解旅行者“个人需求”时,它们撞上了一堵巨大的墙。最大的瓶颈在于满足“隐性需求”——即那些未言明的愿望,比如“我是一个美食爱好者,想住在米其林星级餐厅附近”或者“我是一名残障旅行者,需要一家有坡道的酒店”。即使是最优秀的机器人,在满足这些隐藏需求方面也有一半以上的失败率。
研究人员还测试了给机器人更多“思考”时间或允许它们使用更多计算能力是否会有所帮助。令人惊讶的是,事实并非如此。在他们可以对比的一对模型中,那个花更多时间进行“推理”的模型表现反而比那个仅仅遵循指令的模型更差。此外,投入更多的资金购买计算Token并不保证能获得更好的计划;有些最弱的机器人反而最昂贵,而最好的那个却出奇地高效。研究结论指出,虽然AI智能体在遵循规则方面正变得越来越好,但由于它们还无法完美地同时平衡旅行中所有复杂的人类化约束,因此在成为真正可靠的旅行规划师方面仍面临困难。一个“谈论”旅行的机器人与一个能“预订”完美旅行的机器人之间的差距,依然清晰可见。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。