The Value Axis: Language Models Encode Whether They're on the Right Track
本文证明了语言模型内部编码了一个代表目标成功可能性的线性“价值轴”,该轴能够因果性地调节诸如置信度、自我修正和探索等行为,并且可以通过转向或偏好优化进行操纵。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将一个大型语言模型(就像这篇论文中的 Qwen3-8B)想象成一名试图在浓雾弥漫的森林中寻找出路的徒步旅行者。这位徒步旅行者有一个目标:到达特定的营地(解决一道数学题、编写代码或回答一个问题)。
这篇论文发现,这位徒步旅行者拥有一个隐藏的内部指南针,它不断地告诉他:“我走在正确的路径上吗?”或者“我迷路了吗?”
以下是研究人员发现的内容,使用了简单的类比:
1. “价值指南针”(The "Value Compass")
研究人员发现了一个特定的“轴”(模型大脑中的一个方向),它就像一个信心计。
- 高数值(绿色区域): 模型的感觉是,“我在正确的轨道上!这个策略会奏效。”它自信地向前迈进。
- 低数值(红色区域): 模型的感觉是,“等等,有些不对劲。我走错路了。”它开始犹豫、回溯或改变主意。
他们通过让模型玩一个游戏来构建了这个指南针。他们让模型猜测一个隐藏的规则(比如“在每个句子后面加一个破折号”),并给它一个简单的“是”或“否”的评分。通过对比模型在掌握规则之前与掌握规则之后的大脑活动,他们分离出了大脑中代表“成功”的精确方向。
2. 指南针控制行为
最令人兴奋的部分是,这不仅仅是一种被动的感受;研究人员可以通过沿着这个指南针的方向“推动”模型的大脑活动来操控它。
向“高数值”(信心)推动:
- 效果: 模型变得固执地自信。如果它在解数学题,它会停止自我怀疑。如果它在写代码,它会停止添加冗长、紧张的解释或注释。它直接给出答案。
- 类比: 这就像一名徒步旅行者突然觉得路径很明确,于是不再每隔五分钟就检查一次地图,而是步伐轻快地继续前行。
向“低数值”(怀疑)推动:
- 效果: 模型变得犹豫不决。它会开始说类似“等等,让我重新思考一下”或“实际上,也许我应该尝试另一种方法”之类的话。在编程中,它会添加大量的注释来解释其思考过程,仿佛它在试图为自己的步骤辩解,因为其并不确定。
- 类比: 这就像一名徒步旅行者感到迷路了,于是停下脚步,紧张地环顾四周,并原路返回。
3. 指南针无处不在
这个“价值指南针”并不只适用于他们发明的那个游戏。研究人员在许多不同的场景中测试了它,发现它表现得完全一致:
- 数学: 当模型解决困难的数学问题时,指南针能在它甚至还没写完句子之前,就预测它认为答案是正确还是错误。
- 编程: 当模型编写带有 Bug 的代码时,指南针显示出“低数值”信号。当代码正确时,信号为“高数值”。
- 真实对话: 在观察现实世界的对话时,对于清晰、事实性的任务(如“提取此数据”),指南针显示出高信心;而对于棘手、敏感的话题(如政治辩论),则显示出低信心。
4. 训练会改变指南针
论文还表明,你可以通过训练来重新校准这个指南针。
- 实验: 他们使用一种称为直接偏好优化(DPO)的技术,训练模型去非常喜欢一个特定的词(如“grapefruit/葡萄柚”)。
- 结果: 训练后,每当模型使用“grapefruit”这个词时,它的内部指南针就会飙升至“高数值”。
- 副作用: 由于模型对使用这个词感到非常有信心,它在处理其他任务时也变得过度自信。当被要求在写代码的同时使用“grapefruit”这个词时,它给出的答案变得更短、细节更少,表现得好像它完全知道自己在做什么一样,即便它其实并不确定。
总结
简而言之,语言模型拥有一种关于它们是否正在取得成功的内部“直觉”。这种感觉被编码在它们大脑的一个特定方向中。
- 当感觉良好时,模型会向前推进并停止解释自己。
- 当感觉糟糕时,模型会犹豫、回溯并过度解释。
- 我们可以通过在新的偏好上训练模型来微调这种感觉,从而改变它未来的自信表现。
这篇论文证明了这种“价值”不仅仅是一个随机的数字;它是一个功能性的工具,模型利用它来决定是继续前进还是改变方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。