← 最新论文
🤖 AI

Beyond the Trace: Coupling an Interpretable Reasoning-State Readout to Native MoE Routing

本文引入了一种两层内部读取框架,该框架将潜在推理状态蒸馏为 64 维语义帧(J64),并通过原生专家路由统计数据(R64)对其进行重构,从而实现了可解释、低开销的测试时决策,在显著提高推理准确性的同时,也允许通过针对性的机制编辑来纠正模型行为。

原作者: Kang Chen, Sihan Zhao, Yixin Cao, Yugang Jiang

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Kang Chen, Sihan Zhao, Yixin Cao, Yugang Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

当一个旨在解决难题的计算机程序在“大声”说出它的思考过程时,我们通常只能看到它最终选择写下的句子。这些被称为“推理痕迹”的口述思想,就像是一份经过编辑的对话记录,说话者删减掉了所有的犹豫、错误的开端以及内在的争论。对于试图理解这些人工大脑如何运作的研究人员来说,这份记录是令人沮丧地不完整的。它展示了目的地,却隐藏了旅程。真正的疑问在于,计算机的内部状态——即隐藏在文字之下轰鸣着的隐形机制——是否能在它完成答案之前很久,就为它是否正处于正确轨道上提供线索。如果我们能看到这种隐藏状态,我们或许就能在计算机还在思考时就引导它远离错误,而不是在失败尝试完成后才将其丢弃。

复旦大学与上海创新研究院的研究团队构建了一种观察这些思考机器的新方法。他们专注于一种使用“混合专家”(mixture of experts)架构的特定高级计算机模型。想象一个大型办公室,对于每一项任务,经理都会自动将工作分配给一个小型的专业化团队。计算机也进行类似的操作:对于它生成的每一个词,它都会激活一组特定的内部专家。研究人员意识到,虽然计算机在书写它的想法,但它同时也保留了一份关于它使用了哪些专家的详细日志,以及它对这些专家的依赖程度。这份日志通常只是一个关于效率的技术记录,但该团队发现,它可以被转化为一张可读的计算机推理过程图谱。

研究人员首先创建了一种新型仪表盘,称之为“语义框架”。他们训练这个仪表盘,将计算机原始的、隐藏的内部信号转化为六十四个不同的思维类别。这些类别并非随机的标签;它们代表了具体的概念,如“谨慎”、“算术”、“检查约束”或“考虑选项”。至关重要的是,即使计算机从未实际写下对应的词汇,这个仪表盘也能检测到这些概念。例如,计算机可能正在默默地应对一个复杂的约束条件,虽然它没有写下任何相关内容,但仪表盘会亮起,显示“约束”这一概念正在活跃。这揭示了一个被书面文本完全忽略的隐藏思维层。在测试中,这种内部视角比单纯统计计算机已经写下的词数,能更清晰地提供关于解决方案是否会成功的信号。

随后,团队面临一个实际挑战:读取这些隐藏信号通常需要停止计算机并重新播放其整个思考过程,这在实际应用中过于缓慢。他们通过构建第二个轻量级的仪表盘解决了这个问题,该版本仅读取专家分配的日志。这个被称为“路由代理”(routing proxy)的新工具是一个快速、低成本的替代方案。它直接从计算机内部的路由日志中重建相同的六十四个思维类别。研究人员发现,这个代理的表现非常出色,捕捉到了完整、缓慢版本中 69% 到 86% 的详细信息。在其中一个测试模型上,它保留了原版几乎所有的预测能力,证明了计算机自身的内部流量日志包含了对其推理状态的忠实记录。

掌握了这些工具后,研究人员测试了如何在计算机解决问题的瞬间提高其性能。他们利用仪表盘做出了两种类型的决策。首先,在计算机针对单个问题生成多次尝试后,仪表盘帮助他们比随机选择或简单的文本分析更频繁地选出最佳尝试。在标准投票法无法找到正确答案的情况下,这种内部视角帮助他们在约 17% 的此类困难案例中挽救了正确解。其次,他们利用仪表盘提前终止错误的尝试。当计算机生成文本时,仪表盘实时监测其内部状态。如果仪表盘检测到计算机正在陷入死胡同或陷入猜测的循环,系统会立即停止该尝试并开始一个新的尝试。这种“停止并重采样”策略相比于不加干预地运行,将计算机的最终准确率提升了高达 5.9 个百分点。

或许最令人震惊的发现是,他们可以利用这种理解来直接修正计算机的行为。通过识别哪些特定的内部专家负责了某种类型的错误,研究人员可以对计算机分配工作的方式进行微调。在一个案例中,他们识别出一组让计算机陷入不断猜测数字循环的专家。通过稍微抑制该特定组的活动,他们迫使计算机转向一种更精确的符号计算方法,从而使其能够解决之前失败的问题。这证明了仪表盘不仅描述了计算机的状态,还识别出了控制其推理的精确机械杠杆。

这项工作表明,提升人工智能的路径可能不在于让模型变得更大或用更多数据进行训练,而在于学会阅读它们在思考时产生的无声信号。研究人员表明,模型的内部路由不仅仅是一个隐藏的技术细节,更是关于模型实际在做什么的丰富信息源。通过将这些信号转化为可读格式,他们将黑盒变成了透明的过程。这种方法让我们能够在模型思考的过程中进行干预,在它得出错误答案之前纠正其航向。虽然这项研究侧重于数学问题,但该方法为观察和引导复杂系统的推理提供了一种新途径,将机器思维的不可见过程转变为我们可以观察、测量并改进的对象。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →