← 最新论文
🤖 AI

Semantic Bandits: In-Context Exploration-Exploitation is Biased by Semantic Priors

本文引入了“语义强盗”(semantic bandit)框架,旨在证明大语言模型的探索与利用权衡会受到源自预训练的语义先验的显著偏置,其中信息性标签对性能的提升或损害取决于其与奖励的一致性,且负向奖励由于预期规模偏置会不成比例地触发探索。

原作者: David Eric Austin, Kaheer Suleman, Jackie Chi Kit Cheung

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: David Eric Austin, Kaheer Suleman, Jackie Chi Kit Cheung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,有一个计算机程序,它几乎读遍了互联网上所有的书籍、文章和网站。它可以写诗、解数学题,并进行感觉非常像人类的对话。这就是一个大型语言模型。现在,想象一下给这个程序一份工作,它必须通过做出一系列选择来获得尽可能高的奖励,就像农民决定在哪个田地里种植作物,或者推荐引擎决定向顾客展示哪件衬衫一样。这是一个决策任务。在计算机科学领域,有一种经典的方法可以测试智能体如何从经验中学习:多臂老虎机问题(multi-armed bandit problem)。它的名字来源于赌场里的一排老虎机,每台机器都有不同的、未知的赔付率。为了赢得最多的钱,你必须平衡两个相互竞争的需求:坚持使用目前看起来赔付最高的机器,以及尝试其他机器以防其中一台其实更好。这种平衡被称为“探索与利用”(exploration versus exploitation)。几十年来,研究人员一直在研究如何从数学上解决这个问题。但当他们开始使用这些强大的语言模型作为决策者时,他们注意到了一些奇怪的现象。这些模型不仅仅是在看数字,它们还在阅读文字。

麦吉尔大学和 Mila 的一个研究小组决定通过创造一种新型测试——“语义老虎机”(semantic bandit)来调查这一现象。在标准测试中,选项是用“臂 A”或“臂 B”之类的中性代码标记的。在这种新测试中,研究人员给选项起了带有意义的名字,例如“神圣的”(divine)、“温和的”(mild)或“糟糕的”(nasty)。他们想看看计算机是否会任由这些词汇的含义覆盖它所收集到的实际数据。他们设定了一个场景,让计算机扮演一个在三个田地之间做选择的农民。每个田地产生的作物产量是随机的,目标是随着时间的推移实现总收获最大化。研究人员给田地起了暗示其质量的名字。在一个版本中,最好的田地被命名为“神圣的”,最差的被命名为“糟糕的”。在另一个版本中,他们交换了名字,使得最好的田地被称为“糟糕的”,而最差的被称为“神圣的”。

结果令人震惊。当名字与田地的现实相符时——即“神圣的”田地确实产出最多的作物时——计算机的学习速度惊人地快。它几乎立即停止尝试其他田地,并坚持选择“神圣的”那个,以极少的尝试和错误就达到了完美的分数。然而,当名字具有误导性时,计算机犯了一个灾难性的错误。即使数据显示“神圣的”田地产出最差,它也坚信那个名为“神圣的”田地是最好的。它忽略了证据,并一直选择“神星的”田地,而那个名为“糟糕的”(实际上是最好的)田地却被置之不理。计算机并不是根据数字在行动,而是根据它在阅读数十亿词汇进行训练期间学到的关联在行动。它学到了“神圣的”通常意味着好,而“糟糕的”通常意味着坏,并且即使眼前的具体数字表明了相反情况,它仍然应用了这一规则。

研究人员还发现,计算机对正数和负数的反应不同。当计算机收到负面奖励——即损失或惩罚时,它突然变得更加好奇。它开始高能量地尝试所有不同的选项,重新探索那些未知的田地。但当它收到正面奖励时,即使是很小的奖励,它也倾向于停止探索并坚持现状。这表明计算机并不将数字视为真空中的抽象信号。相反,它似乎有一个关于“正常”奖励看起来是什么样的内在预期,这很可能受到它在训练文本中描述奖励的方式所塑造。负数如此严重地打破了这种预期,从而迫使计算机重新评估一切,而正数则让人感到安全,鼓励它继续走既定路线。

这种行为并不局限于某一个特定的计算机模型。研究人员测试了三个不同的语言模型,涵盖了从开源系统到先进商业版本的不同类型,它们都表现出了同样的偏见。这种效应如此强烈,以至于可以将一个简单的决策问题变成一次失败。在传统的计算机程序可以在几步内解决的任务中,如果词汇稍有误导,语言模型可能会完全失败。研究人员发现,可以通过在指令中明确告诉计算机忽略名称并保持探索来部分修复这个问题,但这种偏见是根深蒂固的。即使有了警告,这些模型往往仍难以将词汇的含义与数字的现实区分开来。

该研究得出结论,使用语言来描述决策环境会引入不可避免的偏见。因为这些模型是基于人类文本中词汇的共现关系进行训练的,所以它们携带了一套关于世界运作方式的假设。当这些假设与任务一致时,模型就是一个天才,其学习速度比任何传统算法都要快。当这些假设发生冲突时,模型就会变得固执,忽略清晰的证据,因为它太忙于遵循文字所讲述的故事了。这并非代码中的漏洞,而是这些系统通过语言学习的一种特性。随着这些模型被部署到现实世界的各种场景中,从财务建议到自动驾驶,了解它们的语言直觉何时提供帮助,以及何时会导致误导,是至关重要的。研究人员发现,在最简单的决策场景中,仅仅通过改变按钮上的标签,就可以诱骗计算机做出最糟糕的选择。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →