← 最新论文
💬 NLP

Comparing Exploration-Exploitation Strategies of LLMs and Humans: Insights from Standard Multi-armed Bandit Experiments

本研究比较了大型语言模型、人类和算法在多臂老虎机任务中的探索与利用策略,发现尽管引入“思考”机制使大型语言模型在静态环境中更接近人类行为,但在复杂非静态环境中,它们仍难以匹敌人类的适应能力和定向探索能力。

原作者: Ziyuan Zhang, Darcy Wang, Ningyuan Chen, Rodrigo Mansur, Vahid Sarhangian

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyuan Zhang, Darcy Wang, Ningyuan Chen, Rodrigo Mansur, Vahid Sarhangian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正穿行在一片巨大而神秘的森林中,面前有四条不同的路径。你不知道哪条路通向宝箱(高回报),哪条路通向死胡同(低回报)。为了找到最佳路径,你必须每隔几分钟就做出一次选择:

  1. 利用(Exploit): 坚持走那条你已经走过且感觉尚可的路,希望它就是最好的。
  2. 探索(Explore): 尝试一条新的、未知的路径,看看它是否可能更好。

这就是“探索 - 利用”权衡。这是一个决策的基本谜题,人类通常凭直觉解决,往往是通过将随机猜测与明智的、经过计算的风险相结合来实现的。

本文提出了一个简单的问题:大型语言模型(LLMs)——即 ChatGPT 等工具背后的 AI 大脑——能否像人类一样解决这个森林谜题?

实验:数字老虎机

研究人员并没有仅仅让 AI 猜测,而是将其置于一个“多臂老虎机”(Multi-Armed Bandit)游戏中。你可以将其想象成一排老虎机。

  • 简单游戏: 两台机器。其中一台的 payout 略高于另一台,但金额是随机的。你拉动杠杆 10 次。
  • 困难游戏: 四台机器。最佳的机器会随时间变化(就像每隔几分钟重置一次赔率的老虎机)。你拉动杠杆 300 次。

他们测试了三组对象:

  1. 人类: 在实验室中真实参与游戏的人。
  2. 标准 AI: 顶级模型(如 GPT-4o-mini 或 Gemini)的“基础”版本,它们直接输出答案。
  3. “思考”AI: “智能”版本(如 GPT-o3-mini 或 DeepSeek-R1),它们被强制在回答前写出推理步骤,或开启了特殊的“思考模式”。

发现:AI 的表现如何

1. “基础”AI 像个紧张的赌徒

当标准 AI 模型参与游戏时,它们表现得有点像紧张的赌徒。

  • 过多的随机猜测: 它们在机器之间毫无计划地剧烈跳跃。
  • 过少的智能搜索: 它们很少使用“定向探索”。这是指人类会想:“我有一会儿没尝试 C 机器了,也不确定它表现如何,所以我试试它来获取更多信息。”基础 AI 大多只是随机猜测或固守已知内容。
  • 结果: 在简单游戏中,它们表现尚可。但在复杂、变化的游戏中,它们迷失了方向,不断犯错,最终获得的“宝藏”(即遗憾值更高)远少于人类。

2. “思考”AI 是更好的侦探

当研究人员开启“思考”功能(迫使 AI 写出其想法或使用推理引擎)时,其行为发生了巨大变化。

  • 转变: AI 开始表现得更像人类。它停止了随机猜测,转而使用“定向探索”。它开始说出这样的话:“我不确定这台机器,所以我要测试它以了解更多。”
  • 简单游戏: 在简单的双机游戏中,“思考”AI 变得几乎与人类无法区分。它迅速找出最佳机器并坚持使用。
  • 困难游戏: 在复杂的多机游戏中,“思考”AI 显著改善,更接近人类的表现,但仍不完美。当游戏规则改变时,它难以像人类那样迅速适应。

3. “遗憾”分数

研究人员测量了“遗憾”,即玩家因未每次都选择最佳机器而“损失”的金额(或积分)。

  • 人类: 始终拥有最低的遗憾值。他们在尝试新事物和坚持赢家之间取得了最佳平衡。
  • 基础 AI: 在复杂游戏中遗憾值很高。它们在糟糕的机器上浪费了大量时间。
  • 思考 AI: 遗憾值大幅降低。通过在行动前“思考”,它们减少了错误,更接近人类的表现水平。

核心结论

该论文得出结论:AI 在探索方式上并非天生像人类。 默认情况下,它往往要么过于随机,要么过于僵化。

然而,赋予 AI 一个“思考轨迹”(即让它大声推理)就像是一种超能力。 它迫使 AI 放慢速度,计算不确定性,并以更聪明、更像人类的方式进行探索。

  • 在简单、稳定的情境中: 思考型 AI 可以完美模仿人类。
  • 在复杂、变化的情境中: 思考型 AI 表现大幅提升,但人类在适应性方面仍略胜一筹。

研究人员强调,这并不意味着 AI 已准备好在每一个复杂决策中取代人类,但这确实表明,提示 AI 去“思考”是一种强大的方法,能够使其决策策略更加可靠且更像人类。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →