← 最新论文
💬 NLP

A Unifying Lens on Supervised Fine-Tuning Through Target Distribution Design

本文通过提出的 Q-target 框架,将监督微调(SFT)重新诠释为一个目标分布设计问题,并由此开发出 Target-SFT,该方法直接从期望分布构建训练目标,并在各种推理任务中一致地优于现有方法。

原作者: Tong Xie, Yuanhao Ban, Yunqi Hong, Sohyun An, Yihang Chen, Cho-Jui Hsieh

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Tong Xie, Yuanhao Ban, Yunqi Hong, Sohyun An, Yihang Chen, Cho-Jui Hsieh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名非常聪明的学生(即 AI 模型)如何解决复杂的数学问题或回答医学问题。你手里有一本充满了由专家编写的“完美”范例的教科书。

旧方法:僵化的复读机
传统上,当我们教导这个学生时(这个过程被称为监督微调,即 SFT),我们的角色就像一名严厉的教官。我们会说:“看这句话。下一个词必须是‘因此’(therefore)。如果你写成‘于是’(thus)或‘所以’(so),你就错了。你必须逐字逐句地模仿教科书。”

论文指出这种方法是有缺陷的。在现实生活中,并不只有一种“完美的”表达方式。“因此”、“于是”、“所以”和“由此可见”可能都是正确的。此外,有时教科书可能会有错别字,或者专家选择了一种不符合学生自然思维方式的奇怪风格。强迫学生精确复制每一个词,会让他们变得过度自信、困惑,或者在教科书不够完美时无法进行调整。

新理念:设计目标,而非仅仅设计评分标准
作者提出了一种看待教学的新方式。与其仅仅关注“分数”(用于惩罚错误的数学公式),我们应该问:“我们希望学生达到的实际目标是什么?”

他们称之为目标分布设计(Target Distribution Design)。与其瞄准一个单一、僵化的目标(例如 100% 的“因此”),不如设计一个灵活的目标,它规定了:

  1. 我们应该在多大程度上信任教科书?(如果学生已经很有信心,就减少信任;如果学生不确定,就增加信任。)
  2. 如果学生不确定,该怎么办?(不要只是随机猜测;要向“老师”寻求其他优选方案的提示。)

解决方案:TARGET-SFT
论文介绍了一种名为 TARGET-SFT 的新方法。可以把它想象成一个聪明的辅导系统,它使用了两种工具:

  1. 置信度计量器(“信任”开关):
    系统会检查学生对教科书答案的信心程度。

    • 如果学生 99% 确定答案是“因此”,系统会说:“很好,就按这个来。”
    • 如果学生只有 10% 的把握,系统会说:“好吧,别慌。我们会稍微信任一下教科书,但我们不会强迫你完美地复制它。”
  2. 老师的提示(“残差”指南):
    当学生不确定时,系统不会任由其盲目猜测,而是引入一位“老师”(一个更高级的 AI 模型)。这位老师不仅仅是说“写下‘因此’”;老师会说:“如果你不确定用‘因此’,这里还有一些同样合理的词,比如‘于是’或‘由此可见’。”

    系统会将教科书的答案与老师的提示进行融合。如果教科书的答案站不住脚,老师的提示声就会变大;如果教科书的内容很扎实,老师就会保持安静。

为什么有效(结果)
研究人员在包括难题数学题和医学问题在内的 10 个不同场景中测试了该方法。

  • 僵化的复读机(标准 SFT): 经常表现不佳,甚至效果变差,因为它强迫学生去记忆嘈杂或僵化的模式。
  • “只管模仿老师”(知识蒸馏): 表现尚可,但有时会忽略当前具体的问题。
  • TARGET-SFT: 在几乎所有案例中都胜出了。通过保持灵活性——即知道何时信任教科书以及何时倾听老师——它学会了更好的推理,而不会被不完美的数据搞混。

大局观
这篇论文的核心观点很简单:不要仅仅惩罚错误;要设计一个更好的目标。

与其盲目地强迫 AI 复制单一的“正确”答案,我们应该教会它去理解应该在多大程度上信任那个答案,以及如果那个答案不是完美的,还有哪些其他好的选择存在。这使得 AI 变得更聪明、更灵活,并能更好地解决现实世界中并非总有一种唯一正确表达方式的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →