← 最新论文
💬 NLP

ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons

本文介绍了 ComboShoppingBench,这是一个旨在通过结合语义评估与确定性验证来评估大语言模型(LLM)智能体在复杂且受预算限制的购物车购物任务上的表现的新型基准测试,以解决验证可行、优惠优化且兼容的产品组合所带来的挑战。

原作者: Adrian Li, Kelong Mao, Yudong Guo, Heming Xia, Xinwei Yang, Lirui Luo, Jace Wong, Pu Yao, Sulong Xu, Simiu Gu

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Adrian Li, Kelong Mao, Yudong Guo, Heming Xia, Xinwei Yang, Lirui Luo, Jace Wong, Pu Yao, Sulong Xu, Simiu Gu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人去超市购物。在早期,你可能会要求机器人寻找“特定品牌的牛奶”。这是一个简单的任务:观察、寻找、抓取。但现实生活很少如此简单。通常,你需要构建一整套“组合”餐食:一份主菜、一份与之完美搭配的配菜、一杯相得益彰的饮料,同时还要控制在特定的预算内,并使用一叠可能互相抵消的复杂优惠券。这就是 LLM Agents(作为数字助手的语言大模型)的世界。这些智能计算机程序可以阅读你的请求,搜索数百万种产品,并尝试完成购买。科学家们提出的核心问题是:这些数字购物者是否真的能够处理构建完整购物篮这种混乱且复杂的现实情况,而不至于感到困惑、超支或买到互不匹配的东西?

于是有了 ComboShoppingBench,这是一个由京东研究人员设计的全新“考试”,旨在测试这些 AI 购物者到底有多出色。请不要将这个基准测试仅仅看作是一场简单的测验,而要把它看作是一个高难度的障碍赛。研究人员创建了一个充满真实产品、优惠券和严格规则的模拟世界。他们不仅仅是让 AI 挑选几件物品;他们给了它复杂的任务,比如“组装一台能装进小型机箱的游戏电脑”或者“为五个人订购一份套餐,要求饮料必须与食物来自同一家店”。难点在于,AI 必须确保每一件物品都能与其它所有物品协同工作(比如确保电脑配件能够相互兼容)、以最聪明的方式使用优惠券来省钱,并保持在紧凑的预算之内。这就像是要求一个机器人同时成为一名顶级大厨、一名精明的会计师和一名优惠券裁剪高手。

这次考试的结果给科技界带来了一次现实的警示。研究人员测试了 11 种不同的 AI 智能体,其中包括当今一些最强大的模型。即使是表现最出色的“优等生”——一个开启了思考模式的名为 GPT-5.5 的模型,也仅在约 61.2% 的情况下通过了完整测试。这意味着它在每 10 个任务中就有近 4 个失败了。论文指出,虽然这些 AI 在寻找单个商品方面正在变得更好,但在处理“组合”任务时仍然显得力不从心。它们经常忽略产品之间微妙的联系(比如买了一个与手机型号不匹配的手机壳),或者在计算叠加优惠券的数学逻辑时出错。它们可能会选对物品,但无法正确计算最终价格,或者可能会选择一个看起来不错但实际成本更高的优惠券。

研究人员使用了一种巧妙的“方案先行”方法来构建这项测试。他们并没有先去猜测一个购物清单是否可行,而是先让一个计算机智能体找到一个有效的物品篮,然后根据这个有效的购物篮反向推导出购物请求、预算和优惠券。这确保了测试既公平又是可解的。他们还结合了类人评委(其他 AI 模型)和严格的规则检查器来对答案进行评分。规则检查器就像一位严厉的收银员,负责核实数学计算是否正确以及优惠券是否合法;而评委则负责检查购物清单是否真正符合用户的需求。

研究发现,对 AI 而言,最难的部分不是寻找单一产品,而是同时处理多个约束条件。当一个任务要求 AI 既要记住“物品 A 必须适配物品 B”,又要记住“物品 C 必须与物品 D 来自同一家店”,还要满足“总价必须低于 100 美元”时,AI 经常会在其中一项规则上掉链子。“思考”模式确实帮助一些智能体进行了更好的规划,但并不能解决所有问题。事实上,对于某些模型来说,过度思考反而导致它们在使用计算器工具时表现更差,从而引发更多的数学错误。论文结论认为,尽管我们正在取得进展,但如今的购物智能体距离我们所期望的那种可靠、全能的私人购物助手还有很长的路要走。它们就像是那些知识渊博但仍需人类来复核账单并确保拼图碎片能够完美契合的、热情的实习生。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →