ZAYA1-8B Technical Report
本文介绍了 ZAYA1-8B,这是一款完全基于 AMD 基础设施训练的高效 80 亿参数混合专家(MoE)推理模型,它通过专有的四阶段强化学习级联训练和创新的马尔可夫 RSA 推理时计算(test-time compute)方法,在数学和编程基准测试中实现了最先进性能,有效缩小了与更大规模模型之间的差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是 ZAYA1-8B 技术报告的通俗化解释,辅以富有创意的类比。
宏观概览:拥有超能力的小大脑
想象一下,你有一位名叫 ZAYA1-8B 的微小却极其聪明的学生。这位学生的大脑仅拥有 7 亿个活跃神经元(对于人工智能而言,这是一个非常小的规模),但他们属于一个拥有 80 亿个总神经元 的更大“学校”。
通常,要解决高难度的数学问题或编写复杂的代码,你需要一个巨大的大脑(例如拥有数十亿参数的巨型人工智能)。ZAYA1-8B 的特殊之处在于,尽管它体型小巧,却能像甚至优于那些更庞大的“天才”学生一样解决这些难题。
它是如何做到的?依靠三件秘密武器:一种新的思维方式、一个特殊的训练营,以及一种独特的自我检查方法。
1. 架构:一支专业化团队
大多数人工智能模型就像是一个试图独自完成所有任务的人。而 ZAYA1-8B 则是基于“混合专家”(MoE)构建的,就像一支 专业化团队。
- 团队构成:想象一个拥有 16 位不同教师(专家)的教室。当问题出现时,一位“路由”(班长)会决定哪位教师最适合回答。
- 新的班长(ZAYA1 路由):在旧模型中,班长只是一个简单的规则遵循者。ZAYA1-8B 使用了一个更智能、多层级的班长,它能更好地决定由谁来教学,确保每次都有正确的专家接手任务。
- 压缩图书馆(CCA):为了阅读长书或记住长故事,该模型使用了一种“压缩图书馆”系统。它不需要在脑海中携带每一页书的内容,而是存储一个节省空间和能量的摘要压缩版本,同时保留所有重要细节。这使它能够处理非常长的对话而不会感到疲惫。
2. 训练:学会思考后再发言
该论文描述了一种独特的训练过程,旨在将这位学生转变为推理机器。
- “答案保留”修剪:教师通常会有冗长详细的解释(推理轨迹),这些内容太长,无法塞进教科书的一页中。ZAYA1-8B 不使用切断故事中间部分(这会破坏逻辑)的方法,而是使用一种特殊技巧:它切断解释的 末尾,但 保留最终答案。这教会了模型如何规划和思考,即使完整的思维过程太长而无法一次性容纳。
- 四阶段训练营:在学习基础知识后,该模型经历了一个严格的“强化学习”(RL)训练营:
- 热身:解决简单的谜题和数学问题,以适应深度思考。
- 健身房:一个包含 400 种不同谜题生成器的定制环境,随着模型能力的提升,谜题难度也会增加。
- 主赛事:应对真实的数学和编程挑战,包括一个特殊的“测试时计算”(TTC)阶段,在此阶段它学习生成多个可能的答案并挑选最佳的一个。
- 抛光:最后一个阶段,学习如何礼貌地聊天并遵循指令,像一个得力的助手。
3. 秘密武器:“马尔可夫 RSA"(群体思维)
这是论文中最具创新性的部分。通常,当人工智能解决难题时,它会尝试在一个长长的连续流中思考答案。如果这个流太长,人工智能就会感到困惑。
ZAYA1-8B 使用了一种称为 马尔可夫 RSA 的方法。把它想象成一场 带有变奏的接力赛:
- 比赛:模型不是让一名选手跑完全程马拉松,而是同时派出 16 名选手(候选者)。
- 交接:每位选手只跑一段短而安全的距离(4000 个词的“尾部”)。他们不携带整场比赛的历史记录;他们只将 最后几步(尾部)传递给下一轮。
- 聚合:一位“教练”查看所有 16 名选手的最后几步,结合最佳想法,并将它们发送出去进行下一轮。
- 结果:通过将思考过程分解为小的、可管理的片段,并由团队投票选出最佳路径,ZAYA1-8B 能够解决极其困难的数学问题(如 AIME 和 HMMT 竞赛),而这些通常只有更大的大脑才能完成。
类比:想象试图拼凑一个巨大的拼图。
- 旧方法:一个人试图一次性在脑海中容纳整个拼图。他们会感到不知所措。
- ZAYA1-8B 方法:你派 16 个人去处理小区域。他们只将自己区域的一小部分传递给下一组。该组将这些小碎片结合起来,构建出完整的画面。这种方法更快,占用内存更少,且能取得更好的结果。
4. 硬件:基于 AMD 构建
整个模型是使用 AMD 计算机芯片(具体为 MI300X GPU)训练的。这是一件大事,因为它证明了训练顶级推理模型并不需要最昂贵、专有的芯片。该团队表明,只要软件和硬件设置得当,AMD 芯片就能承担训练复杂人工智能的重任。
5. 结果:小巧而强大
该论文声称,通过这种设置:
- ZAYA1-8B(仅拥有 7 亿个活跃参数)在数学和编程测试中击败或持平了 DeepSeek-R1(拥有 370 亿个活跃参数)。
- 当使用“马尔可夫 RSA"群体思维方法时,它在高难度数学竞赛中获得的分数非常接近 Gemini-2.5 Pro 和 GPT-5-High 等庞大且昂贵的模型。
总结
ZAYA1-8B 是一个小巧高效的人工智能,它证明了要成为天才并不需要巨大的大脑。通过利用智能的团队结构、一种能安全保留答案的特殊训练方法,以及一种用于思考的“群体接力赛”策略,它能够解决最困难的数学和编程问题,同时仅使用其大型竞争对手一小部分的计算能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。