How to Fine-Tune a Reasoning Model? A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data
该论文针对现有利用强模型合成数据进行监督微调(SFT)时因风格差异导致推理模型性能下降的问题,提出了名为 TESSY 的教师 - 学生协作框架,通过交替生成风格与非风格令牌来合成既保留教师推理能力又符合学生分布的合成数据,从而显著提升了代码生成等任务的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文讲述了一个关于如何给“聪明但性格古怪”的 AI 学生找一位好老师,并让他们完美配合的故事。
想象一下,你有一个非常有天赋但性格独特的小学生(学生模型,比如 Qwen3-8B),他擅长解题,但说话方式、思考习惯都很固定。现在,你想让他变得更厉害,于是你请来了一个**世界级的数学天才(老师模型,比如 GPT-OSS-120B)**来教他。
1. 遇到的问题:直接“抄作业”行不通
通常的做法是:让天才老师把解题过程(包括思路、步骤、最终答案)全部写下来,然后让学生照着背(这叫“监督微调”或 SFT)。
但是,论文发现了一个大坑:
- 风格冲突: 天才老师的解题思路虽然完美,但他说话的方式(比如喜欢用复杂的长句、特定的连接词、独特的语气)和小学生完全不一样。
- 后果: 如果强行让学生去模仿老师的“说话风格”,学生会感到极其困惑。就像让一个习惯用方言思考的孩子,突然被迫用莎士比亚的英语风格去写数学题。结果不仅没学会新东西,反而把自己原本擅长的解题能力给“忘”了,甚至考得更差(论文中提到的“灾难性遗忘”)。
2. 解决方案:TESSY 框架(师生合作模式)
为了解决这个问题,作者提出了一个叫 TESSY 的新方法。它的核心思想是:“分工合作,各展所长”。
我们可以把这个过程想象成两个人共同写一份“解题报告”:
- 老师(天才)负责“干货”: 只负责写解题的核心逻辑、数学公式、代码逻辑。这部分是“硬实力”,必须保证正确和高级。
- 学生(小学生)负责“包装”: 负责写连接词、过渡句、语气词(比如“让我们看看”、“嗯”、“举个例子”)。这部分是“软风格”,必须保持学生原本的习惯,让他读起来觉得亲切自然。
具体怎么操作呢?(就像接力赛)
- 学生先开口: 学生先说:“好吧,让我们看看这个问题……"(保持学生风格)。
- 老师接棒: 老师接着说:“首先,我们需要定义一个动态规划方程……"(输出核心逻辑)。
- 学生再插话: 学生接着说:“比如,如果我们去掉第一个字符……"(保持学生风格)。
- 老师再补充: 老师继续输出关键代码或推导。
- 循环往复: 两人像打乒乓球一样,你一句我一句,直到解题结束。
- 最后收尾: 最终的答案部分,完全由学生来写,确保整个回答的“人设”不崩。
3. 关键技术:如何知道什么时候该换人?
这里有个难点:怎么知道老师写的哪句话是“干货”,哪句话是“废话”?怎么知道学生什么时候该接话?
作者设计了一个**“边界预测器”(可以想象成一个智能裁判**):
- 当老师或学生写了一段话后,裁判会立刻检查:“这句话是解题核心吗?还是只是语气词?”
- 如果是“废话”或“风格词”,裁判就把它截断,交给对方去写。
- 如果是“干货”,就保留下来。
- 通过这种“生成 - 检查 - 截断”的机制,确保写出来的每一段话都归对的人管。
4. 实验结果:效果惊人
论文在代码生成任务上做了测试:
- 传统方法(只让老师写): 学生模型不仅没变强,反而在代码测试中成绩大跌(有的甚至跌了 10% 以上)。因为学生被老师的风格“带偏”了。
- TESSY 方法(师生合作): 学生模型的成绩大幅飙升(提升了 6% 到 11% 不等)。
- 结论: 既保留了老师的高超解题能力,又维持了学生原本舒适的思考风格,这才是最好的“因材施教”。
总结
这篇论文告诉我们:给 AI 模型“补课”时,不能生搬硬套强者的内容。
就像教孩子学画画,你不能直接把毕加索的画塞给孩子让他临摹,因为孩子的手法和理解力还达不到。最好的方法是:让毕加索教孩子“怎么观察光影”(核心能力),但让孩子用自己的笔触和色彩去表达(保持风格)。
TESSY 就是这样一个让“大师”和“学徒”完美配合的框架,既学到了真本事,又没有丢掉自己的个性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。