← 最新论文
🤖 machine learning

RIFT: Repurposing Negative Samples via Reward-Informed Fine-Tuning

该论文提出了一种名为 RIFT 的高效对齐框架,通过引入奖励感知的重加权损失函数,将传统方法中丢弃的负样本转化为学习信号,从而在无需昂贵专家数据的情况下,利用自生成的混合质量数据显著提升了模型在数学基准测试中的表现。

原作者: Zehua Liu, Shuqi Liu, Tao Zhong, Mingxuan Yuan

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Zehua Liu, Shuqi Liu, Tao Zhong, Mingxuan Yuan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 RIFT(奖励知情微调)的新方法,旨在让大型人工智能(LLM)变得更聪明、更听话。

为了让你轻松理解,我们可以把训练 AI 想象成教一个学生做数学题

1. 以前的方法:要么“只看好书”,要么“只挑好答案”

在 RIFT 出现之前,教 AI 主要有两种主流方法,但它们都有点“浪费”:

  • 方法一: supervised Fine-Tuning (SFT) —— “只给满分试卷”

    • 做法:老师(人类专家)只把那些完全正确的解题步骤抄下来,让 AI 照着背。
    • 缺点:找这些“满分试卷”非常贵,而且如果 AI 只背正确答案,它可能根本不知道为什么其他答案是错的。就像学生只背了标准答案,一旦题目稍微变个样,或者自己算错了一步,他就不知道哪里出了问题。
  • 方法二:Rejection Sampling Fine-Tuning (RFT) —— “挑挑拣拣”

    • 做法:让 AI 自己做题,做 10 道题,然后老师只把做对的那几道留下来,做错的 9 道直接扔进垃圾桶,只拿做对的去训练。
    • 缺点:太浪费了!那些“做错的题”里其实藏着巨大的价值。它们告诉 AI:“嘿,你刚才在这个步骤掉坑里了,下次别这么干。”直接扔掉,AI 就学不到怎么避坑

2. RIFT 的创意:把“错题本”变成“提分神器”

RIFT 的核心思想是:别扔错题!把错题也利用起来,但要换种方式用。

想象一下,RIFT 就像一位高明的教练,他手里拿着 AI 做的所有题目(无论对错),并给每道题打分:

  • 做对了:奖励 +1 分(大声表扬:“干得漂亮,继续保持!”)。
  • 做错了:惩罚 -0.2 分(温和地提醒:“这里错了,下次注意,但别灰心,继续学。”)。

关键创新:如何“温和地”处理错题?

这里有一个巨大的技术陷阱。如果直接让 AI 去“惩罚”错题(比如强行让 AI 觉得那个错误答案的概率是 0),AI 可能会因为压力太大而崩溃(数学上叫“梯度爆炸”),就像学生被骂得太狠,直接不想学了,甚至把以前学对的东西也忘了。

RIFT 的聪明之处在于它用了一个“线性近似”的魔法:

  • 对于做对的题,它依然用传统的“背诵法”(对数损失),让 AI 牢牢记住。
  • 对于做错的题,它不用那种“要把概率压到 0"的暴力手段,而是用一种温和的线性惩罚
    • 比喻:这就好比老师对学生说:“这个答案不对,我们稍微减一点点分,让你知道它不好,但不会让你觉得天塌了。”
    • 这样,AI 既能学到“什么是对的”,又能学会“什么是错的”,而且不会崩溃

3. 为什么 RIFT 这么厉害?(实验结果)

论文在数学推理任务(比如做奥数题)上测试了 RIFT,发现它比以前的方法都要强:

  1. 更省钱(数据效率高):以前要把错题扔掉,现在全都要。这意味着不需要人类专家花大价钱去标注那么多数据,AI 自己生成的“错题”也能变成营养。
  2. 更聪明(泛化能力强):因为 AI 既学了“正路”,也学了“弯路”,它在遇到没见过的难题时,更能判断哪种思路是行不通的,从而做出更正确的选择。
  3. 更稳定(不崩溃):通过那个“温和惩罚”的数学技巧,RIFT 在训练过程中非常稳定,不会出现以前那种“越学越乱”的情况。
  4. 更省内存:相比其他高级方法(如 DPO),RIFT 不需要加载额外的参考模型,就像学生不需要带两个书包上学,只需要背一个,跑得更快。

总结

RIFT 就像是一个懂得“错题价值”的超级老师。

它不再把 AI 做错的题当成垃圾扔掉,而是把它们变成宝贵的教材。通过一种巧妙的数学方法,它让 AI 在学习正确答案的同时,也能温和地吸取错误教训,最终让 AI 变得更聪明、更稳健,而且不需要花那么多钱去请人教它。

简单来说:别只盯着满分卷,把错题本用好,才是进步最快的秘诀。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →