← 最新论文
💬 NLP

FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale

该论文介绍了 FineInstructions,这是一种从预训练语料库中生成数十亿个合成指令-响应对的方法,它使大型语言模型能够仅通过指令微调目标进行从零开始的预训练,从而在自由形式响应基准测试上比标准预训练方法表现出更优越的性能。

原作者: Ajay Patel, Colin Raffel, Chris Callison-Burch

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Ajay Patel, Colin Raffel, Chris Callison-Burch

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何与人类聊天。通常情况下,我们教它的方式就像是给机器人一间巨大的图书馆,并对它说:“读完所有的书,然后猜下一个词是什么。”这被称为预训练(Pre-training)。这是机器人学习事实、历史以及句子结构的方式。但问题在于:在读完数百万本书后,机器人非常擅长完成句子,但在实际回答问题或遵循指令方面却表现得很糟糕。这就像是一个背下了整部百科全书的学生,但当你问他“附近哪家披萨店最好吃?”时,他却愣住了。

为了解决这个问题,我们通常会给机器人一小套特殊的“指令卡”——即问题和完美的答案——并对它说,“学习这种风格!”但问题是,我们没有那么多这样的卡片。我们可能只有几千张甚至几百万张,这就像是用一本教科书去教整个学校的学生一样。

核心理念:“食谱书”革命
这篇发表于 COLM 2026 的论文作者提出了一个疯狂的想法:为什么不把整座图书馆都变成指令卡呢?

他们构建了一个名为 FineInstructions 的机器。把它想象成一个神奇的厨房。

  1. 原料: 他们从互联网上收集了大量的真实文档(大约 3000 亿词的文本量)。
  2. 食谱卡: 他们从大约 1800 万个真实的人类在线提问和提示词(例如“梅西和C罗相比谁更有影响力?”)开始。他们通过将特定名称替换为空白,将这些问题变成了“食谱卡”(模板)。例如,“在 <空白> 和 <空白> 之间,谁更 <空白> ?”
  3. 烹饪: 机器会查看一份文档(比如一篇关于智能手表的博客文章)并询问:“这篇博客是否符合我们的任何一张食谱卡?”如果该博客谈论的是 Apple Watch 和 Garmin,它就匹配了“哪款更耐用?”这个食谱。
  4. 成品: 机器随后利用这篇博客填充空白,从而创建一个完美的“问题-答案”对。这就像是那篇博客突然变成了一场问答环节。

结果:十亿级的全新课程
通过这种方式,他们创建了一个名为 FineInstructions 的数据集,其中包含超过 10 亿个合成的指令-回答对。这规模巨大!这就像是把整座图书馆变成了十亿张闪卡。

他们的发现(证据)
团队使用这些新的指令卡从头开始训练了小型机器人大脑(参数量为 18 亿的模型)。他们完全没有使用旧的“猜下一个词”的方法。

  • 得分: 当他们在衡量机器人回答真实人类问题能力的基准测试(如 MixEvalMT-Bench-101AlpacaEval)上进行测试时,使用 FineInstructions 训练的机器人碾压了竞争对手。
  • 对比: 他们将自己的方法与其他一些尝试将书籍转化为问题的花哨方法(如 IPTNemotron-CC 方法)进行了比较。FineInstructions 训练出的机器人以显著优势获胜。例如,在 MixEval 基准测试中,它比 Nemotron-CC 方法提高了约 39%,比标准训练提高了约 69%
  • “胜率”: 在与其他模型的面对面聊天对决中,FineInstructions 模型大约在 76% 的情况下战胜了 Nemotron-CC 基准模型。

他们明确表示这“不是”什么
了解这篇论文没有声称的内容非常重要。

  • 它不是关于“困惑度(Perplexity)”: 作者承认,如果你测量机器人预测句子中下一个词的能力(一种标准的测试,称为困惑度),他们的方法可能实际上比旧方法更差。他们并不在意那个测试。他们关心的是机器人对人类是否有用。
  • 它不是“魔法”或“蒸馏(Distillation)”: 一些之前的方法试图使用一个超级聪明的机器人来编写所有的问题。作者认为,这只是让新机器人模仿旧机器人的风格,而没有真正学习新知识。他们的方法不同,因为他们使用的是真实的人类问题,并将答案锚定在真实的文档中,而不是编造的故事。
  • 它不是一个“已解决的问题”: 论文指出,这种方法是一个重大进步,但他们也提到,复杂的模板仍然难以完美匹配。他们还承认,目前的设置仍在使用一些人工微调(例如选择一个特定的匹配分数 0.865),这可能还不是绝对完美的设置。

底线
这篇论文表明,通过改变我们向机器人喂养数据的方式——将原始文本重构为十亿个真实的问答对——我们可以教它们更好地遵循指令并帮助人类,即使这意味着我们必须放弃传统的“猜下一个词”式的训练。这是一种从教机器人成为一名“读者”到教它成为一名“助手”的转变。

作者对他们的结果充满信心,因为他们进行了受控实验,确保每个机器人学习的文本量完全相同,只是格式不同。数据表明,“仅指令”格式能培养出在现实任务中更聪明、更有帮助的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →