← 最新论文
🤖 AI

daVinci-LLM:Towards the Science of Pretraining

该论文介绍了 daVinci-LLM 项目,该项目通过结合工业级算力与完全开放的科研范式,利用“数据达尔文主义”框架和两阶段自适应课程,在 8T 令牌上训练 30 亿参数模型,并通过 200 多项受控消融实验系统性地揭示了预训练阶段数据处理深度、领域饱和动态及组合平衡对模型能力的关键影响,旨在推动预训练科学的发展。

原作者: Yiwei Qin, Yixiu Liu, Tiantian Mi, Muhang Xie, Zhen Huang, Weiye Si, Pengrui Lu, Siyuan Feng, Xia Wu, Liming Liu, Ye Luo, Jinlong Hou, Qipeng Guo, Yu Qiao, Pengfei Liu

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiwei Qin, Yixiu Liu, Tiantian Mi, Muhang Xie, Zhen Huang, Weiye Si, Pengrui Lu, Siyuan Feng, Xia Wu, Liming Liu, Ye Luo, Jinlong Hou, Qipeng Guo, Yu Qiao, Pengfei Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于如何“教”人工智能变聪明的全新故事。

想象一下,现在的 AI 研究界就像是一个巨大的烹饪大赛

  • 商业巨头(如 OpenAI, Google):他们拥有顶级的食材(海量数据)和巨大的厨房(超级计算机),但他们把食谱锁在保险柜里,只端给你一道菜(API 接口),告诉你“好吃”,却不告诉你怎么做的。
  • 学术界:他们拥有最自由的探索精神,想研究任何原理,但手里只有一个小灶台(算力有限),做不出大菜,只能在小范围内试错。

daVinci-LLM 这个项目,就是试图打破这种僵局。它由 SII(商汤科技)和 GAIR(上海交大)合作,既拥有商业级的大厨房,又保留了学术界的完全透明。他们不仅做了一道菜,还把整个厨房、所有食材的处理过程、甚至做失败的实验记录,全部公开给了全世界

他们的目标是:把训练 AI 从一种“凭感觉的玄学”,变成一门“有数据支撑的科学”。


🍳 核心故事:如何把一只“小麻雀”练成“大鹏鸟”?

他们训练了一个只有 30 亿参数 的小模型(daVinci-LLM-3B)。通常,这么小的模型很难打过那些 70 亿参数 甚至更大的模型。但通过精妙的“训练食谱”,他们让这只小麻雀在数学推理和代码能力上,竟然打败了 70 亿参数的 OLMo-3 模型,表现堪比大模型。

这是怎么做到的?他们用了三个“独门秘籍”:

1. 食材处理:从“洗菜”到“烹饪”的进化 (Data Darwinism)

以前大家觉得,只要数据够多(Volume),AI 就能变强。但这篇论文说:“食材的质量”比“数量”更重要。

他们提出了一个**“数据达尔文进化论” (L0-L9)** 的分级系统,就像处理食材的九个步骤:

  • L0-L2 (洗菜/切菜):把网上乱七八糟的网页、PDF 下载下来,去掉乱码、重复内容,把格式统一。这是基础。
  • L3 (挑菜):用一个小 AI 模型当“质检员”,把那些写得烂、没营养的文章挑出去。
  • L4 (精加工/去骨):这是关键一步!用强大的 AI 把文章里啰嗦的废话、错误的格式去掉,把复杂的科学论文重新组织成逻辑清晰的“教科书”风格。就像把一块带骨头的肉,剔骨、去油,只留下最精华的瘦肉。
  • L5 (烹饪/合成):这步最厉害。AI 不再只是处理现有文章,而是主动创造新的“问答对”。比如,把一篇晦涩的物理论文,自动改写成“老师问、学生答”的对话形式,把隐含的逻辑步骤显性化。

比喻:以前是给 AI 喂了一吨生米(原始数据),现在他们是把米淘洗干净、煮成香喷喷的米饭,甚至做成了营养均衡的便当(L4/L5 处理后的数据)。吃同样的饭量,吃“便当”的 AI 长得更壮。

2. 训练节奏:像“健身”一样分阶段 (Adaptive Curriculum)

他们发现,AI 的学习能力不是均匀发展的。

  • 第一阶段(基础期):先让 AI 广泛阅读各种网页、书籍,建立通用的语言感觉。这时候,通用的知识(General Knowledge)学得很快,但很快就不进步了(饱和了)。
  • 第二阶段(强化期):当通用知识学不动时,他们立刻调整策略。减少普通网页的摄入,大幅增加“代码”和“科学推理”的“高蛋白食物”。
  • 第三阶段(冲刺期):最后,他们引入了大量的**“问答训练” (QA)**。这就好比让 AI 从“看书”变成了“做题”。通过大量的题目和标准答案,专门训练它的逻辑推理能力。

比喻:就像练武术。先练基本功(第一阶段),发现腿法练到瓶颈了,就专门练内功和招式(第二阶段),最后通过高强度的实战模拟(第三阶段)来突破极限。如果一直只练基本功,永远成不了高手。

3. 平衡的艺术:既要“偏科”又要“全能”

在第二阶段,他们面临一个难题:如果只让 AI 疯狂做数学题,它可能会变成“数学天才”,但忘了怎么说话(通用能力下降)。

  • 他们发现,不能一下子把“做题”的比例加到 100%,否则模型会“崩溃”。
  • 他们采用了一种**“渐进式”**策略:先保持 30% 的题目,70% 的基础阅读,稳住模型;等模型基础打牢了,再把题目比例加到 70%。

比喻:就像给植物施肥。刚开始只施一点点肥(QA 数据),防止烧根;等根系发达了,再加大施肥量,让果实(推理能力)长得更大。


🧪 为什么这篇论文很重要?

  1. 它证明了“小模型”也能很强:只要数据质量好、训练方法对,30 亿参数的模型可以打败 70 亿参数的模型。这意味着未来我们可以在更便宜的设备上运行更聪明的 AI。
  2. 它打破了“黑盒”:以前大家不知道大模型是怎么练出来的,只能猜。现在,他们把200 多次实验的失败和成功记录全部公开。
    • 比如:他们发现“用规则过滤数据”效果一般,但“用 AI 改写数据”效果惊人。
    • 比如:他们发现“通用知识”学得很快,但“推理能力”需要更长时间。
  3. 它建立了一套新标准:他们提出的“数据达尔文”分级法,让未来的研究者可以像查字典一样,知道手里的数据处于什么处理水平,该不该继续加工。

🌟 总结

这篇论文就像是一份**“顶级大厨的完全公开食谱”**。

它告诉我们要想做出美味的 AI(大模型),不能只靠堆砌食材(数据量),更要靠精细的食材处理(L4/L5 加工)科学的烹饪火候(分阶段训练)以及合理的营养搭配(数据混合比例)

最重要的是,他们把这份食谱免费发给了所有人,让全世界的科学家都能站在他们的肩膀上,一起探索 AI 的终极奥秘,而不是各自在黑暗中摸索。这就是**“科学的透明度”**带来的力量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →