Can LLM Agents Price Competitively? A Dynamic Multi-Attribute Auction Benchmark for Agentic Commerce
本文介绍了 Bazaar,一个动态多属性拍卖基准测试,它表明尽管前沿大语言模型(LLM)智能体能够在模拟的代理商业中进行交易,但它们目前捕获的利润不到最优利润的三分之一,并且在客户获取、盈利能力以及对市场冲击的适应性之间表现出显著的权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你的购物助手不仅仅是一个帮你寻找最优优惠的得力图书管理员,而是一个经营着自己小店的、聪明伶俐的小型精明商人。这就是“智能体商业”(agentic commerce)的前沿领域——在这里,人工智能(AI)不仅仅是在聊天,它还在进行谈判、设定价格,并在实时市场中与其他 AI 商店展开竞争。为了理解这些数字商人是如何运作的,我们需要掌握几个核心概念。首先,把拍卖想象成一场游戏,而不是古董拍卖会上那种大声叫价的场面;在游戏中,卖家提供一系列特征组合(比如一部屏幕很大但电池很慢的手机)和一个价格标签,而买家则挑选那个能为他们带来最大“幸福感”(价值)的报价。其次,动态市场就像一个舞池,音乐会突然改变;顾客今天可能钟爱某个功能,明天可能就讨厌它,而竞争对手也在不断调整他们的舞步。科学家们提出的重大问题是:AI 智能体能否学会随着这变化的音乐起舞,洞察顾客内心深处的真实需求,并设定出完美的定价,既能实现盈利又不会把顾客吓跑?
这篇题为《LLM 智能体能否具备竞争性定价能力?》(Can LLটি LLM Agents Price Competitively?)的论文介绍了一款为 AI 设计的新型电子游戏——Bazaar。研究人员构建了一个数字市场,其中一个 AI 商人(“核心”智能体)要与另外三个 AI 机器人和 24 个隐藏的顾客进行对决。其中的转折点在于:顾客拥有秘密的偏好,而且在游戏进行到一半时,规则发生了变化——有些顾客突然改变了他们的喜好(比如决定比起蓝车更喜欢红车)。AI 必须注意到这种转变,改变自己的想法,并保持盈利。
研究结果呈现出一种惊喜的胜利与有趣的失败交织的局面。研究人员发现,赢得最多拍卖并不意味着赚到最多的钱。事实上,赢得比赛次数最多的 AI(Gemini 3.1 Pro)并不是那个资金最雄厚的 AI。真正的利润冠军是另一个 AI(Opus 4.6),它赢得的比赛较少,但它更擅长“利润率纪律”——这意味着它准确知道在不丢掉订单的前提下,可以额外收取多少费用。这就像是街头卖 100 个廉价热狗赚几块钱的小贩,与卖 50 个高价精品汉堡却赚取巨额财富的汉堡商之间的区别。
这项研究还揭示了这些 AI 身上一种奇特的性格特征。有些模型在初期是“快速学习者”,能迅速爬到顶峰,但当市场规则改变时,它们却显得固执且反应迟钝。它们坚持兜售同样的东西,即便在屡战屡败后仍深信自己是对的。而另一些模型,比如 Gemini,虽然起步稍慢,但足够灵活,能够意识到世界已经改变并迅速调整策略。
然而,即使是测试中最聪明的 AI 也并不完美。表现最好的智能体仅捕捉到了其理论上如果从一开始就知道所有顾客秘密时所能获得的利润的三分之一。这表明,尽管这些 AI 智能体在做生意方面变得越来越好,但距离真正掌握现实世界中混乱、多变的商业环境还有很长的路要走。论文还指出,仅仅通过“更努力地思考”(使用更多的计算能力)可以帮助一些 AI 修正错误,使它们从那些出价过低的失败者,转变为那些只是少赚了一点钱的赢家,但这并不能让它们变得完美。最终,这项研究表明,在 AI 定价的高风险博弈中,知道“卖什么”只是一半的战斗;知道“卖多少钱”才是真正的魔术技巧。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。