← 最新论文
🤖 AI

Finding the Evidence: Discovering Decision-Supporting Tokens for On-Policy Reasoning Distillation

该论文提出了 DEAR,一种新颖的在策略(on-policy)蒸馏框架,它通过不仅利用学生模型不确定性来识别决策点,还通过隐藏状态的相似性与差异性来识别关键的支持性证据标记,从而通过提升推理迁移能力,在数学和代码基准测试上超越了标准方法。

原作者: Jinwei Xiao, Zhuowen Han, Yueqing Sun, Zhengxi Lu, Yuxin Liu, Zhiyuan Yao, Wentao Chen, Qi Gu, Xunliang Cai

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinwei Xiao, Zhuowen Han, Yueqing Sun, Zhengxi Lu, Yuxin Liu, Zhiyuan Yao, Wentao Chen, Qi Gu, Xunliang Cai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图通过观察一位大师级匠人(老师)来教导一名年轻的学徒(学生)如何解决复杂的谜题。

在人工智能的世界里,这个过程被称为在策略蒸馏(On-Policy Distillation)。学徒尝试解决问题,而老师则在一旁观察,纠正学徒写的每一个字,从“让我们开始吧”到“答案是 42”。

该论文指出,目前这种做法存在缺陷。这就像老师在纠正学徒写的每一个字,无论是“让我们开始”还是“答案是 42”。这会让学徒被过多的噪声所淹没。

作者发现,并非所有的词都具有同等的重要性。他们发现,推理链实际上包含了两种截然不同的“知识”,而它们需要以两种不同的方式进行教学。

两种类型的知识:“转向”与“证明”

为了理解论文中的发现,请想象学徒正在走迷宫。

  1. 决策标记(转向/Decisions): 这些是学徒必须做出选择的时刻。“我应该向左转还是向右转?”“我应该加法还是减法?”

    • 我们如何找到它们: 当学徒感到不确定时,他们会犹豫。用 AI 的术语来说,这是高不确定性(或高“熵”)。目前的方法擅长捕捉这些时刻,因为学徒在这些时刻表现得明显困惑。
    • 类比: 这些是十字路口。老师知道要在此时停下来并说:“嘿,看这里!这是你需要深入思考的地方。”
  2. 证据标记(证明/Evidence): 这些是学徒在做出决策后采取的步骤。“我选择了向左,所以我将走 10 步。”

    • 问题所在: 有时,学徒会自信地犯错。他们可能会自信地写下“我将走 10 步”,但老师知道实际路径应该是 12 步。因为学徒如此自信,所以他们不会犹豫。他们的“不确定性度量”保持在低水平。
    • 盲点: 目前的教学方法只寻找“不确定”的时刻(即转向)。它们完全忽略了这些“自信地犯错”的步骤。学徒学会了在哪里“转向”,却没学会如何正确地“行走”。他们学会了推理的骨架,却丢失了血肉。

解决方案:DEAR(决策-证据感知推理)

作者提出了一种名为 DEAR 的新方法。DEAR 不仅仅寻找困惑,它还使用一个两步侦探程序来寻找隐藏的“自信地犯错”的步骤。

第一步:寻找转向(决策)
就像之前一样,系统寻找学徒感到不确定的时刻。这些被称为“决策标记”。

第二步:寻找证明(证据)
这是巧妙之处。一旦系统找到了一个“转向”,它会追问:“在这个句子中,还有哪些步骤与这个‘转向’相关联?”

  • 类比: 想象学徒正在写一个故事。“转向”是情节转折。而“证据”则是解释为什么发生这个转折的段落。即使学徒在写解释时表现得很自信(并且可能弄错了一个细节),那个段落仍然与情节转折有着深层的联系。
  • DEAR 如何运作: 它观察 AI 的“隐藏想法”(内部数据)。它会检查这些“自信”的词是否与“不确定”的决策词具有相似的“氛围”或上下文。如果是,DEAR 会将它们标记为重要的证据标记,即使学徒看起来并不困惑,也需要进行纠正。

它还增加了一个“差距检查”:如果老师和学生在某个步骤上存在严重分歧,该步骤会获得额外的关注。

为什么这很重要(结果)

论文在数学问题和编程任务上测试了该方法。

  • 结果: 通过不仅教导学徒在哪里“转向”,还教导他们如何“行走”(即证据),学生的表现有了显著提升。
  • 数据:
    • 数学竞赛中,新方法将分数提高了多达 2.5 个百分点
    • 编程方面,它提高了多达 5.7 个百分点
    • 至关重要的是,它在最难的问题上帮助最大,因为这些问题需要长链条的推理。

简而言 de 总结

你可以把旧方法想象成一位只在学生在十字路口显得迷茫时才停下来的老师。
DEAR 则是一位既会在十字路口拦住学生,也会在学生走完之后的每一步进行检查的老师——即便学生正自信满满地朝着错误的方向走去,老师也会进行纠正。

通过寻找这些“隐藏”的错误,学生学习到的不仅是高层级的选择,更是完整的逻辑过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →