Mellum2 Technical Report
Mellum 2 是一个开放权重、拥有 120 亿参数的混合专家(Mixture-of-Experts)语言模型,每个 token 激活 25 亿参数,专门用于软件工程和智能体任务,通过多 Token 预测(Multi-Token Prediction)以及跨越 10.6 万亿 token 的三阶段训练课程等架构创新,实现了与更大规模模型相媲敌的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图构建一个住在你电脑里的超级智能编程助手。挑战在于,你希望它既极其聪明(像高级工程师一样),又极其快速且运行成本极低(像一台标准的办公笔记本电脑一样)。通常情况下,你必须做出选择:要么是“聪明”的版本,但规模庞大且运行缓慢;要么是“快速”的版本,但过于简单,无法处理难题。
JetBrains 的团队开发了 Mellum 2 来解决这个难题。以下是他们实现这一目标的原理,用简单的语言进行了解释:
1. “瑞士军刀”般的头脑(架构)
大多数 AI 模型就像是一个做所有事情的单一、巨大的脑细胞。Mellly 2 则不同。它是基于 混合专家模型(Mixture-of-Experts, MoE) 构建的。
- 类比: 想象一座拥有 64 位不同专业领域的图书管理员的大型图书馆。当你提出一个问题时,模型并不会唤醒全部 64 位图书管理员。相反,它有一个聪明的经理,会根据你的具体问题挑选出 8 位最相关的图书管理员。
- 结果: 该模型拥有一个 120 亿参数“巨型”大脑的总知识量,但在编写每一个单词时,它仅以 25 亿参数大脑的强度进行“思考”。这使得它能够运行在标准硬件上,同时依然保持高度智能。
2. “滑动窗口”与“草拟”技巧
为了让它更快,他们添加了两个巧妙的捷径:
- 滑动窗口: 模型不再试图记住你在对话中输入的每一个单词(这会变慢),而是专注于最近的 1,024 个单词,就像火车上的滑动窗口一样。它保持最近上下文的清晰,同时让旧的细节逐渐淡化,从而节省了大量能量。
- “草稿”助手: 模型内置了一个微小的“草拟”助手。在提交最终答案之前,这个小助手会预判接下来的几个词。如果预测正确,主模型就会跳过后续工作并直接接受它。这就像一位作家有一个朋友在耳边低语下一句内容,以便他们能更快地打字。
3. “三阶段”学校课程
他们并没有只是向模型喂入随机数据。他们通过三个特定的阶段来教导它,就像学校的课程体系一样:
- 第一阶段(通才): 他们从大量的通用互联网数据(70%)和一些代码(23%)的混合数据开始。这让模型对人类如何说话和写作有了广泛的理解。
- 第二阶段(专才): 他们将混合比例转向包含更多高质量的代码(42%)和数学。这是模型开始学习编程特定规则的阶段。
- 第三阶段(大师): 在最后的阶段,混合内容几乎完全是代码和数学(59% 的代码)。这是它的“魔鬼训练营”,模型在此磨练技能,成为一名专家。
4. 两种人格:“指令”与“思考”
基于同一个训练好的大脑,他们发布了两个版本的模型:
- “指令”(Instruct)模型: 这是一个直接的工作者。你提问,它立即给出答案。它非常适合快速任务。
- “思考”(Thinking)模型: 这是一个深度思考者。在给出答案之前,它会写出一段“推理轨迹”——即解决问题的逐步解释。这就像学生在数学考试中展示解题步骤一样。研究表明,这种“思考”模式让模型在解决困难逻辑谜题和复杂编程挑战时表现得更好。
5. “证明”(测试)
他们将 Mellum 2 与其他流行的模型进行了对比测试。
- 速度: 它的运行速度与一个 70 亿参数的模型相当(虽然其总规模为 120 亿),但它比同等规模的模型更聪明。
- 编程: 它在编写代码、调试以及使用工具(如搜索网络或执行命令)方面表现出色。
- 权衡: 由于他们专注于将其打造为编程专家,因此与那些旨在成为通用聊天机器人的模型相比,它在通用世界知识(如历史或生物学)方面的知识量略少。然而,对于其预定的工作——辅助开发者——它是一个顶尖的选手。
总结
Mellum 2 是一个专门的编程助手,它利用“专家团队”架构来实现既聪明又快速。它通过精心设计的课程进行训练,以掌握代码和数学,并提供两种版本:一种用于快速回答,另一种用于深度、循序渐进的推理。该团队免费发布了它,以便任何人都可以使用它来构建更好的软件。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。