← 最新论文
🤖 machine learning

Benchmarking In-context Experiential Learning Through Repeated Product Recommendations

本文介绍了 BELA,这是一个针对重复性产品推荐场景中经验学习的基准测试,该基准测试使用了真实世界的产品和合成客户画像,并揭示了尽管目前的基于大语言模型的智能体可以在单次交互内进行适应,但它们在通过推断共享潜在结构来跨多个回合改进其策略方面仍存在困难。

原作者: Gilbert Yang, Yaqin Chen, Thomson Yen, Hongseok Namkoong

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Gilbert Yang, Yaqin Chen, Thomson Yen, Hongseok Namkoong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名试图破解谜题的侦探,但线索隐藏在对话之中。在人工智能的世界里,解决单个谜题与随着时间的推移学习如何更好地解决谜题之间有着巨大的区别。当今大多数 AI 测试就像是给学生一道已经写好了所有数字的数学题;目标仅仅是现在就得到正确答案。但现实生活更加复杂。它更像是一名侦探,先与一名证人交谈,问了几个问题,得到了一个答案,然后必须利用这次经验来更有效地采访下一位证人。这篇论文深入探讨了人工智能研究中一个特定的领域——“经验学习”(experiential learning)。它提出了一个简单但棘手的问题:AI 是否能通过一次又一次地与人交谈,从而变得更擅长洞察人类的需求?研究人员正在测试这些数字智能体是否能从过去的对话中学习,从而在未来成为更出色的侦探,而不仅仅是擅长解决一个孤立的案例。

这篇论文的作者们(来自哥伦比亚商学院和中山大学的一个团队)决定使用一个我们都熟悉的场景来测试这个想法:购买产品。他们构建了一个巨大的虚拟游乐场,名为 BELA(经验学习与主动探索基准测试)。你可以把 BELA 想象成一个巨大的、无限的购物中心,AI 在其中扮演销售员的角色。在这个购物中心里,AI 必须与成千上万个不同的“顾客”(实际上是具有特定品味的特定人群的计算机模拟)交谈,以弄清楚他们应该购买哪种产品。转折点在于,AI 不仅仅只有一次机会。它与一位顾客交谈,做出推荐,获得反馈,然后转向一位新顾客。重大的测试在于,AI 是否能记住它从第一位顾客那里学到的东西,并利用这些知识向第二位、第三位和第十位顾客提出更好的问题。

为了使这项测试既公平又宏大,研究人员并没有凭空捏造一些假人。他们创建了一个包含来自亚马逊的 71,000 件真实产品2,000 个不同产品组(例如发胶组或米饭类食品组)的系统。然后,他们将这些产品与 100 万种不同的客户人格(由其他 AI 模拟,具有非常具体且一致的喜好和厌恶)相匹配。这创造了 20 亿种“顾客 + 产品组”的可能组合。这就像拥有一个包含了你能想象到的每一次购物行程的图书馆,让研究人员能够观察 AI 是否能在人群中发现规律。

研究人员使用当今最智能的 AI 模型进行了实验,包括像 GPT-5.4、Gemini-3.1 和 Claude-Opus 这样的巨头。他们观察这些模型在连续 10 次购物行程(称为“回合”)中的表现。他们想看两件事:首先,AI 能否在单次对话过程中进行学习(提出正确的后续问题)?其次,AI 能否跨对话进行学习(通过积累经验来提升工作能力)?

以下是令人惊讶的结果:AI 模型在第一部分表现得相当不错。在与单个顾客交谈时,它们可以从对话中学习,并在聊天过程中提出更好的问题。然而,它们在第二部分完全失败了。在与九个不同的顾客交谈后,AI 在猜测第十个顾客想要什么方面的能力,并不比面对第一个顾客时更好。这就像是一个销售员,虽然很擅长弄清楚一个人的喜好,但每当新顾客进来时,他都会从零开始,忘掉了之前九个人教给他的所有东西。

论文指出,这些目前的“前沿”模型缺少一项关键技能:它们无法回顾过去的经验并说:“哦,我发现了一个模式;下次我应该问这类问题。”相反,它们似乎把每一位新顾客都当作一个全新的谜团,即使五分钟前刚遇到过一个品味非常相似的人。研究人员还发现,AI 并未学会如何判断自己的信心程度;它始终询问相同数量的问题,即使在应该学会减少提问的时候也是如此。

为了证明这项任务并非仅仅因为太难,研究人员创建了一条“理想路径”。他们手动引导 AI 走过最佳的提问路径,并展示了如果 AI 确实正确使用了过去的经验,它本可以极大地改善其推荐质量并减少提问次数。这证明了信息就在那里,是可以被学习的,但目前的模型只是没有捕捉到它。

简而言之,这篇论文表明,虽然我们目前的 AI 在进行单次智能对话方面做得非常好,但它尚未掌握如何成为一台在整个职业生涯中不断进化的“学习机器”。这有点像一个学生,如果他在考试前夜苦读,可以考出高分,但一旦铃声响起就会忘掉一切,无法利用周一学到的知识来帮助周二的学习。作者总结道,要让 AI 真正处理复杂多变的现实世界,它需要发展出这种跨多个回合从经验中学习的能力,而目前的顶尖模型在掌握这项技能方面仍面临挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →