这就像是在机器人开口说话之前,先递给它一张写好的便条,上面写着:“这就是一个聪明思考者开始解决这个问题的方式。”
4. 为什么这很了不起
- 无需训练: 他们不需要重新教导机器人。他们只是利用数学(具体来说是被称为“正交普鲁克分析斯(Orthogonal Procrustes analysis)”的方法,这是一种寻找最佳旋转角度的巧妙方式)找到了那个角度。
- 无处不在: 他们在数学、科学和编程任务上测试了这一方法。在 32 项测试中,有 30 项显示机器人的解题能力得到了提升。
- 速度极快: 它几乎不会增加处理时间,因为它只是一次简单的数学旋转,而不是生成一段长长的文本。
- 甚至对图片也有效: 最令人惊讶的部分是,他们仅通过文本问题来训练这种旋转。当他们将这种“推力”应用到机器人解决视觉数学问题(带有数字的图片)时,它依然奏效!这表明“思考”的方向是机器人大脑中一个基本的部分,而不仅仅是针对文本的特定内容。
核心结论
论文声称,“思考”不仅仅是一长串文字;它是机器人大脑进入的一种特定的几何状态。通过计算出将机器人从“阅读模式”切换到“思考模式”所需的精确旋转,我们可以瞬间激发机器人去更准确地解决更难的问题,而无需额外的训练或成本。
论文中提到的局限性:
- 你需要能够观察到机器人的内部“大脑”状态(它不适用于无法窥探内部结构的“黑盒”模型)。
- 你需要一个能够正确进行“思考”的机器人版本,才能首先学习到这种旋转。
- 它在数学和科学领域效果最好;在编程任务上的提升相对较小。
通过使用模型的 inputs_embeds 接口。
4. 生成最终答案。
该过程不需要梯度更新,不需要微调,也不需要除了提取输入嵌入进行单次前向传播之外的额外推理计算。
核心贡献
- 推理的几何特征表征: 本文确立了输入嵌入与思考嵌入在不同模型家族(Qwen、Phi、Gemma)和基准测试中,均呈现出轴向不一致的近一维锥体结构。一个正交旋转即可实现两者之间的高保真映射(余弦相似度 > 0.96)。
- Rotate2Think 方法: 一种无需训练的推理时技术,通过在正确解决的示例上拟合一个正交 Procrustes 旋转,并注入一个合成的思考向量来引导推理轨迹。
- 跨领域泛化能力: 该方法在 32 个模型-基准测试配置中的 30 个配置上提升了准确率,涵盖数学、科学和代码任务,且无需目标领域数据或针对特定基准进行重新拟合。
- 零样本跨模态迁移: 仅在文本推理基准上拟合的旋转,成功提升了在多模态 MATH-Vision 基准上的表现,这表明输入到思考的几何结构是模型的固有属性,而非输入模态的属性。
实验结果
在四个模型家族(Qwen3 4B, Phi-4 14B, Gemma-4 E4B, Gemma-4 31B)以及五个基准测试(AIME 2025/2026, GPQA Diamond, BigCodeBench, MATH-Vision)上进行了评估:
- 基座模型(Base Models): 向基座模型注入合成向量(Base+R2T)一致地提高了准确率,在 AIME 上的增益高达 +13 个百分点。在某些情况下(例如 Gemma-4 E4B 在 GPQA 上),Base+R2T 的表现甚至超过了该模型自身的完整推理模式。
- 推理模型(Reasoning Models): 使用该引导器增强推理模型(Reasoning+R2T)在所有任务中都取得了持续的提升,且通常没有增加 Token 生成数量,这表明其实现了更有效的推理而非更长的推理。
- 多模态迁移: 在 MATH-Vision (testmini) 上,基于文本拟合的旋转将基座模型的准确率从 30.9% 提升至 38.1%,超过了模型原生的完整推理模式(34.9%)。
意义与主张
本文声称 Rotate2Think 证明了推理能力可能是潜在的且在几何上可访问的。通过在单一节点进行极小的扰动(一个旋转后的嵌入),该方法将模型引导至一个能够更可靠地表达推理的表示状态。
作者认为,跨模态迁移的成功支持了柏拉图表征假设(Platonic Representation Hypothesis),即表示几何结构会随模型规模的增大而趋于统一,且“思考空间”是模型的一种结构性属性,独立于输入模态。该方法提供了一个实用且轻量级的构建模块,无需强化学习或微调的成本,即可提升基座模型和推理模型的推理能力。
局限性
作者承认存在以下限制:
- 对推理变体的依赖: 该方法需要能够访问目标模型的推理能力变体,以便提取用于拟合的初始思考嵌入。
- 任务特异性: 在数学和科学推理方面的提升最为显著;在代码生成方面的增益较为有限。
- 单 Token 注入: 当前实现仅注入一个合成 Token;注入一系列旋转嵌入的潜在益处仍有待探索。
- 白盒要求: 该方法需要访问模型的内部隐藏状态(特别是最后一层),因此无法应用于仅提供 Token 输出的闭源模型。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。