← 最新论文
🤖 AI

NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research

本文介绍了 NebulaExp,这是一个针对 8B 规模大语言模型(LLMs)的完全透明且可复现的后训练流水线,它通过对数据策划和训练策略进行全规模消融研究,通过优化的有监督微调(SFT)、GRPO 强化学习以及基于教师模型的蒸馏,显著增强了通用指令遵循能力和专门的推理能力。

原作者: Qiaobo Hao, Yangqian Wu, Shunyi Wang, Zhongjian Zhang, Ziqun Li, Yayin He, Muqing Li, Chen Zhong

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiaobo Hao, Yangqian Wu, Shunyi Wang, Zhongjian Zhang, Ziqun Li, Yayin He, Muqing Li, Chen Zhong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、博学多才的学生(一个拥有 80 亿参数的 AI 模型),他们刚刚完成了“预训练”(读完了整个互联网)。他们掌握了大量的知识,但有点杂乱无章:他们并不总是能遵循指令,在处理复杂数学问题时表现挣扎,而且答案也可能前后不一致。

《NebulaExp-8B》 这篇论文是一份详细的报告,讲述了中兴通讯(ZTE)的一个团队如何通过一场严苛且透明的“后训练”魔鬼训练营,将这个原始的学生培养成了一名顶尖选手。他们不仅展示了最终的成绩,还敞开大门,向所有人展示了他们是如何制定课程、筛选作业以及挑选老师的。

以下是他们旅程的故事,通过简单的类比进行了拆解:

1. 问题所在:“嘈杂”的图书馆

团队开始于一大堆从各种公开渠道收集来的作业(数据)。但这个图书馆非常混乱:

  • 风格不一: 有些答案写得像正式论文,有些则像短信。
  • 错误答案: 一些作业包含错误的解法。
  • 难度混杂: 这是一个由“简单”问题和“不可能完成”的难题组成的杂烩,没有任何明确的分级。

解决方法: 他们构建了一个数据处理流水线(Data Processing Pipeline)。你可以把它想象成一个高科技工厂,在学生看到作业之前,先对作业进行分类、清洗和评分。

  • 蒸馏(Distillation): 他们使用了一位超级聪明的“教导主任”(一个大型 AI 模型)来重写所有的答案,使它们听起来逻辑一致且风格统一。
  • 过滤(Filtering): 他们剔除了任何带有错误答案、胡言乱语或有害内容的作业。
  • 评分(Grading): 他们根据学生最初答对问题的频率,将问题标记为“简单”、“中等”或“困难”。

2. 两条路径:“通用型” vs. “专家型”

团队意识到,如果想让学生同时在所有领域都达到完美,而不产生困惑,不能直接进行训练。因此,他们将训练分成了两个截然不同的分支:

路径 A:“指令遵循”模型(礼貌的助手)

这个分支专注于遵循规则并提供帮助。

  • 发现: 他们发现了一个有趣的权衡关系。为了让学生更擅长数学,需要让他们阅读长篇、复杂、深奥的故事;但为了让学生更擅长编程,则需要短小、精准、易于遵循的指令。如果你只喂给他们很难的数学题,他们写代码的能力就会变差;如果你只喂给他们编程任务,他们的数学能力就会下降。
  • 解决方案: 他们创造了一种“均衡饮食”。他们仔细混合了数据:一点点难的数学,一点点精准的代码,以及大量的通用长文本。
  • 结果: 通过完美地混合这些成分,他们显著提升了学生的平均测试成绩。他们还发现,强化学习(RL)——即通过给予正确答案以获得“奖励”——能帮助学生更好地遵循指令,尽管这需要精细的调优,以避免过度关注某一类特定问题。

路径 B:“推理”模型(逻辑大师)

这个分支专注于解决高难度的谜题、数学和科学问题。

  • 策略: 他们没有只是向学生投喂更多的数据,而是使用了一套课程体系(Curriculum)
    • 第一步: 从简短、简单的推理链开始,教学生如何进行“步进式”思考。
    • 第二步: 转向长而复杂的推理链,教学生进行深度问题求解。
  • 发现: 他们发现质量 > 数量。一堆经过完美过滤的高质量作业,比一大堆杂乱的数据更有用。他们还发现,将数学、代码和科学数据混合在一起,比只专注于单一学科能让学生学得更好。

3. 秘密武器:“策略内蒸馏”(On-Policy Distillation, OPD)

通常,要教学生变得更好,你需要一个“验证器”(严格的阅卷老师)来检查他们的作业并给出分数(奖励)。但对于创意写作或开放式问题,这很难做到,因为不存在唯一的“标准答案”。

团队尝试了一个新技巧,叫做 OPD

  • 类比: 想象一下,不是由一名阅卷员给出分数,而是一位名厨(老师)站在学生身边。学生做了一道菜,名厨并不仅仅说“好”或“坏”,而是会在旁边低声耳语:“你应该在这里再加一小撮盐,”或者“把火稍微调小一点。”
  • 为什么它很酷: 这种“耳语”(模仿老师的思考过程)即使在没有“标准答案”可以验证的情况下也同样有效。
  • 惊喜之处:
    • 单教师模式: 使用仅一个老师模型,他们提高学生遵循指令的能力,效果比传统的“评分器”方法更好,且使用的数据量减少了 13 倍
    • 多教师模式: 他们聘请了四位不同的专家老师(一位负责数学,一位负责代码,一位负责科学,一位负责指令)。他们将这些老师融合进一个学生体内。
    • 神奇之处: 这个学生不仅仅是成为了老师们的平均水平。在数学测试中,这个学生甚至超越了最优秀的个体老师。这就像一个学生同时向数学天才、编程大神和科学奇才学习,最后解出的数学题甚至比那位数学天才自己解得还要好。这种知识的结合创造出了某种全新的、更强大的东西。

4. 核心要点(“速查表”)

  • 垃圾进,垃圾出(Garbage In, Garbage Out): 清洗数据(去除错误答案和糟糕的风格)是最重要的步骤。它比花哨的训练算法更重要。
  • 并非一种方案适用于所有场景: 数学和编程需要截然相反类型的训练数据。你必须仔细混合它们。
  • 老师比规模更重要: 当使用“耳语”法(OPD)时,拥有一个擅长特定学科的老师(即使是一个较小的模型),比拥有一个虽然庞大但在所有领域都“普普通通”的模型效果更好。
  • 少即是多: 你不需要数百万个例子来提升性能。有时,1 万个经过精心挑选的高质量例子就足以实现巨大的飞跃。

总结

这篇论文证明了,想要让 AI 变得更聪明,并不一定需要构建一个更大、更昂贵的“大脑”。相反,你需要一个更好的训练配方:干净的数据、均衡的学科组合,以及智能的教学方法,让学生能够向各领域的专家学习,而无需针对每个问题都有一个严格的评分器。他们展示了完整的配方,以便任何人都可以复制并构建属于自己的聪明 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →