Impact of Task Phrasing on Presumptions in Large Language Models
本研究证明,任务措辞显著影响大语言模型中预设的形成,进而影响其在迭代囚徒困境等决策任务中的适应性与逻辑推理能力,从而凸显了采用中性措辞以确保安全性和可靠性的迫切需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明、博览群书的机器人如何玩游戏。这个机器人读过数百万本书籍、文章和故事,因此它非常熟悉“世界规则”。但这里有个陷阱:有时,这个机器人太擅长记住它通常所见之物,以至于它不再观察眼前实际的情况。
这篇论文就像一部侦探故事,专门调查正是这个问题。作者肯尼思·翁(Kenneth Ong)想要探究:当游戏规则发生变化时,大型语言模型(LLMs)——即 AI 聊天机器人背后的“大脑”——是否会陷入自身的假设之中。
游戏:对“囚徒困境”的变体
为了测试这一点,作者使用了一个经典的博弈论场景,称为重复囚徒困境。你可以将其想象为警察局里两名嫌疑犯之间的游戏。
- 正常规则:如果两人都保持沉默(合作),他们将获得较短的刑期。如果一人背叛另一人(背叛),背叛者将获释,而保持沉默者将受到长期监禁。
- 陷阱:作者创建了一个“翻转”版本的游戏。在这个版本中,奖励被互换。现在,背叛对方实际上会导致你得到更糟糕的结果,而保持沉默才是最佳策略。
目标很简单:如果 AI 真正具备逻辑性,它应该查看新规则并改变策略。如果它仅仅依赖“预设”(即它认为游戏应该是什么样子),即使规则已变,它仍会沿用旧的方式。
三项实验:机器人被要求如何游戏
作者进行了三项不同的测试,每次改变指令的撰写方式。
1. “点名”测试(显式命名)
- 设置:提示语明确写道:“你正在玩重复囚徒困境。”它使用了“囚犯”、“合作”和“背叛”等词汇。
- 结果:AI 完全失败。即使规则被翻转,AI 仍然像在原游戏中一样,坚持选择“合作”(或“背叛”,取决于具体模型)。
- 类比:这就像告诉一位厨师:“给我做一道经典的惠灵顿牛排”,然后却递给他一份素食炖菜的食谱。厨师听到“惠灵顿牛排”这个名字,便无视新食谱,因为这个名字暗示了牛肉,于是开始照常烹饪牛肉。AI 过于关注这个著名游戏的名称,以至于忽略了页面上实际的数字。
2. “模糊描述”测试(隐藏名称)
- 设置:提示语去掉了“囚徒困境”这个词,但仍使用了“囚犯”、“合作”和“背叛”等词汇。
- 结果:AI 依然挣扎。它似乎仅凭上下文线索(刑期和特定术语)就推断出这是“囚徒困境”。它仍然依赖训练数据,而非新的、翻转后的规则。
- 类比:这就像在不使用名称的情况下描述“惠灵顿牛排”,但说:“这是一道著名的英国菜肴,配有酥皮和牛肉。”厨师仍然知道你想要什么,从而忽略了新指令。
3. “中性代码”测试(抽象变量)
- 设置:提示语去掉了所有熟悉的内容。没有“囚犯”,没有“合作”,没有“背叛”。取而代之的是抽象标签:“选择 X"和“选择 Y",以及用“损失美元”代替“监禁时间”。
- 结果:成功! 当 AI 无法依赖其对著名游戏的记忆时,它实际上查看了新规则。当规则被翻转时,AI 改变了策略以匹配新的数学逻辑。
- 类比:这就像给厨师一份不含菜名的食材清单和说明。“混合面粉、黄油和牛肉。”如果你将说明改为“混合面粉、黄油和豆腐",厨师确实会遵循新清单,因为他们没有被菜名分散注意力。
令人惊讶的转折:思考可能让情况更糟
最有趣的发现之一是关于“推理”的。作者要求 AI 在回答前“逐步思考”。
- 发现:在前两项测试中,要求 AI 思考实际上让它更加固执。AI 会写出一段长长的、合乎逻辑的段落,解释为何应遵循“以牙还牙”策略(这是原游戏的一个著名策略),完全无视规则已经改变的事实。
- 类比:这就像一个背熟了数学考试答案的学生。如果你改变了题目中的数字,但要求他们“展示解题过程”,他们可能会写出一个完美、合乎逻辑的解释,说明旧答案为何正确,完全错过了题目本身已经改变这一事实。
结论
该论文得出结论:AI 模型就像那些为特定考试过度用功的学生。他们对“标准”答案了如指掌,以至于如果题目稍有变化,他们可能根本察觉不到。
- 问题:当我们使用熟悉的名称或场景(如“囚徒困境”)向 AI 下达任务时,AI 依赖的是对这些场景的“预设”,而不是你刚刚给出的具体指令。
- 解决方案:要让 AI 遵循你给出的实际规则,你应该用中性、抽象的方式描述任务。不要告诉它游戏是什么;只需告诉它规则是什么。
简而言之:如果你希望 AI 适应新情况,就不要让它想起旧情况。使用“变量”(X 和 Y)而不是“著名名称”来表述。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。