← 最新论文
🤖 machine learning

Goal-Conditioned Supervised Learning for LLM Fine-Tuning

本文介绍了目标条件监督学习(GCSL),这是一种高效的离线微调框架,它将反馈信号视为明确目标,并利用自然语言引导大语言模型持续达到质量阈值,从而在避免在线强化学习高昂成本的同时,超越标准监督方法。

原作者: Shijun Li, Kaiwen Dong, Xiang Gao, Joydeep Ghosh

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Shijun Li, Kaiwen Dong, Xiang Gao, Joydeep Ghosh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教导一个非常聪明但略带顽皮的机器人助手如何行事。你有一大堆旧日志,记录了机器人回答问题的时刻,以及每个回答的“得分”(例如 1 到 5 星的评分)。

这篇论文提出了一种新的、更简单、更廉价的方法,利用这些日志来教导机器人,而无需昂贵的额外工具或不断的试错。

以下是他们方法的分解,使用日常类比:

当前方法的问题

目前,教导这些机器人主要有两种方式:

  1. “在线”方式(像有教练的视频游戏):

    • 工作原理: 机器人尝试回答问题,一个独立的“教练”(奖励模型)观察并给出评分,然后机器人再次尝试。这个过程会发生数千次。
    • 弊端: 它极其昂贵、缓慢,并且需要雇佣一位“教练”(即另一个 AI),而这位教练甚至可能不理解用户真正想要什么。这就像试图通过开车、获得评分、再开车、如此反复数周来学习驾驶。
  2. “离线”方式(像学习教科书):

    • 工作原理: 你只需向机器人展示日志中的“好”答案,并说:“照此复制。”
    • 弊端: 通常,人们会丢弃“还可以”的答案,只保留“完美”的答案。这就像学生只学习前 10% 的试卷答案。机器人学会变得“平均良好”,但从未学会如何从“好”进阶到“卓越”。它遇到了天花板。

论文的解决方案:“目标条件监督学习”(GCSL)

作者提出了一种更聪明的方法来利用旧日志。他们不再只是说“复制好答案”,而是告诉机器人:“这是你需要达到的具体目标。”

这就像一位健身教练。

  • 旧方式: “这是职业运动员跑步的视频。模仿他们。”(机器人只是模仿平均水平的职业选手。)
  • 新方式: “这是职业选手的视频。你的目标是跑进 0.85 秒以内。”

机器人学会观看视频并理解:“好吧,为了达到那个具体的速度目标,我需要做 X、Y 和 Z。”

两大升级

这篇论文引入了两个具体的技巧,使这种方法效果更好:

1. “超越阈值”技巧

在旧的“教科书”方法中,如果你希望机器人变得“快”,你只展示给它最快的跑步者。机器人学会的是复制那个快速群体的“平均值”。

新方法说:“如果一名跑步者快得足以达到 0.85 秒,那么他也足以达到 0.80、0.70 和 0.60 秒。”

  • 类比: 想象一个学生在考试中得了"A"。在旧方法中,我们只给他们看得"A"的试卷。在新方法中,我们告诉学生:“既然你得了'A',你也知道如何得'B'、'C'和'D'。”
  • 结果: 机器人学会了进步的阶梯。它明白,要获得“更好”的分数,它需要做的不仅仅是复制单个例子,而是要做更多或更好的事情。它学会了改进的方向,而不仅仅是一张静态的图片。

2. “自然语言”技巧

在之前的尝试中,“目标”是一段奇怪的代码,如 [GOAL_TOKEN_5]。机器人必须死记硬背这个代码意味着“跑得快”。

新方法使用** plain English(plain English 译为“普通英语”或“通俗语言”)**。

  • 类比: 教练不再使用秘密代码,而是说:“生成一个非毒性评分大于 0.85 的回复。评分范围从 0 到 1,分数越高越好。”
  • 结果: 因为机器人(大语言模型)已经非常擅长理解人类语言,它瞬间就“懂了”。它利用自己对“毒性”或“高效”含义的现有知识来弄清楚如何实现目标,而不仅仅是死记硬背一个符号。

为什么这很重要

  • 更便宜: 你不需要昂贵的“教练”AI 或无尽的试错循环。你只需使用已有的日志。
  • 更聪明: 机器人不仅仅是复制“最佳”示例;它学会了如何攀登质量阶梯。它可以瞄准一个它从未见过的目标(例如“比我们要有的最佳示例还要好”),因为它理解了目标的概念
  • 处处适用: 作者在三个不同的任务上测试了这种方法:
    1. 礼貌待人: 让机器人减少毒性或冒犯性。
    2. 编程: 让机器人编写运行更快、效率更高的代码。
    3. 推荐: 让机器人推荐人们真正喜欢的产品。

总结

这篇论文是关于教导 AI 使用通俗语言和质量的“阶梯”来瞄准目标,而不是仅仅复制最佳示例或玩昂贵的视频游戏。它使 AI 更聪明,并使训练过程更快、更便宜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →