← 最新论文
💬 NLP

Interpretable Traces, Unexpected Outcomes: Investigating the Disconnect in Trace-Based Knowledge Distillation

该论文通过实验发现,基于思维链的知识蒸馏中,推理过程的语义正确性并不能保证最终答案的准确性,且高准确性的冗长推理迹往往牺牲了人类用户的可解释性,从而揭示了模型监督目标与用户可解释性之间的显著脱节。

原作者: Siddhant Bhambri, Upasana Biswas, Subbarao Kambhampati

发布于 2026-04-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Siddhant Bhambri, Upasana Biswas, Subbarao Kambhampati

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常有趣且反直觉的现象:在人工智能(AI)的“思考过程”中,那些看起来最正确、最符合逻辑的“推理步骤”,并不一定能帮助 AI 给出最好的答案;而反过来,那些让人类觉得最难以理解、最啰嗦的“思考过程”,反而可能让 AI 表现得更好。

为了让你更容易理解,我们可以把这篇论文的研究比作**“教一个学生解题”**的故事。

1. 背景:AI 的“自言自语”

现在的先进 AI(比如 DeepSeek R1)在回答问题前,会先进行一段“思考”,也就是生成一段思维链(Chain-of-Thought, CoT)

  • 想象一下:这就好比一个学生在考试时,不仅要在卷子上写答案,还要在旁边写下详细的解题步骤。
  • 目前的假设:人们普遍认为,这些解题步骤必须是逻辑正确的(不能瞎编),而且必须是人类能看懂的(解释清楚为什么这么做),这样 AI 才能变聪明,人类才能信任它。

2. 核心实验:给 AI 喂“假”步骤

研究团队设计了一个巧妙的实验,就像给两个学生(小模型)分别喂了两种不同的“解题笔记”:

  • A 组(正确笔记):笔记里的每一步推理都是完全正确的,逻辑严密,事实准确。
  • B 组(错误笔记):笔记里的推理步骤是完全错误的(比如把时间搞错了,或者引用了假的事实),但最终的答案却是正确的

关键点:他们让 AI 学习这些笔记,然后看 AI 考试时能考多少分。

3. 惊人的发现:两个“反直觉”的结论

结论一:正确的步骤 \neq 正确的答案

  • 比喻:这就好比一个学生,虽然他的解题过程写得全是错别字和错误的公式(比如把 2+22+2 算成 $5),但他最后神奇地写出了正确答案),但他最后神奇地写出了正确答案 4$。
  • 结果:研究发现,让 AI 学习那些步骤错误但答案正确的笔记,AI 最终考出来的成绩,往往比学习那些步骤完全正确的笔记还要好!
  • 原因:AI 似乎并不在乎“过程”是否真的讲得通,它更像是在玩“连连看”。它学会了识别问题的模式结构,只要看到题目长什么样,就能直接跳到正确答案,中间的“错误推理”对它来说只是用来模仿的“噪音”,它甚至能忽略这些噪音直接输出正确答案。
  • 数据:在测试中,只有 28% 的情况是“步骤对,答案也对”。很多时候,步骤错了,答案却对了;或者步骤对了,答案反而错了。

结论二:让人类看懂的 \neq 让 AI 变强的

  • 比喻
    • Verbose R1 痕迹(啰嗦版):就像 DeepSeek R1 生成的笔记,写得像流水账,充满了“嗯……让我想想……"、“也许是这样……"、“等等,我再检查一下……"。这种笔记人类看着很晕(认知负荷高),觉得很难懂。
    • 人类友好版(总结/解释):就像把流水账提炼成清晰的摘要,或者用大白话解释一遍。这种笔记人类看着很爽,觉得逻辑清晰。
  • 结果
    • 让 AI 学习啰嗦、难懂的“流水账”笔记,AI 的解题能力最强(成绩最好)。
    • 让 AI 学习清晰、易懂的“人类友好版”笔记,AI 的解题能力反而变差了
    • 人类反馈:在问卷调查中,人类觉得那些“啰嗦的流水账”最难懂,评分最低;而那些“清晰的摘要”最容易被理解。

4. 这意味着什么?(核心启示)

这篇论文打破了一个我们一直以来的幻想:

我们以为 AI 的“思考过程”是为了像人类一样讲道理,其实它可能只是为了“凑出”正确答案。

  • 对 AI 来说:那些啰嗦、甚至逻辑混乱的“中间步骤”,可能只是它用来计算答案的**“脚手架”**。一旦答案算出来了,脚手架是不是歪的、是不是真的,它根本不在乎。
  • 对人类来说:如果我们直接看 AI 生成的原始“思考过程”,可能会觉得它很混乱、不可信。
  • 未来的方向
    1. 训练目标要分开:如果我们想让 AI 更聪明,可能需要让它去模仿那些“啰嗦但有效”的原始思考;但如果我们想让人类看懂,就需要另外专门训练一个模块,把 AI 的“内心独白”翻译成人类能听懂的“人话”。
    2. 不要过度拟人化:我们不应该把 AI 生成的中间步骤强行解释为“它在像人一样推理”。有时候,那只是它在走一条人类看不懂的捷径。

总结

这就好比做菜

  • AI 的原始思考:就像大厨在厨房里一边切菜一边自言自语,甚至切错了又换一块,最后端出来的菜很好吃(答案对),但过程很乱(人类看不懂)。
  • 人类想要的解释:就像大厨事后写的一张精美菜谱,步骤清晰、逻辑完美。
  • 论文的发现:如果你让学徒(小模型)去模仿大厨乱糟糟的切菜过程,学徒反而能做出最好吃的菜;如果你让学徒去模仿那张精美的菜谱,学徒做出来的菜反而不好吃。

一句话总结:AI 的“思考过程”可能只是为了帮它算出答案,而不是为了讲道理给人类听。想要 AI 变强,和想要 AI 让人类看懂,可能是两件完全不同的事,不能混为一谈。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →