← 最新论文
💬 NLP

ZAYA1-8B Technical Report

本文介绍了 ZAYA1-8B,这是一款完全基于 AMD 基础设施训练的高效 80 亿参数混合专家(MoE)推理模型,它通过专有的四阶段强化学习级联训练和创新的马尔可夫 RSA 推理时计算(test-time compute)方法,在数学和编程基准测试中实现了最先进性能,有效缩小了与更大规模模型之间的差距。

原作者: Robert Washbourne, Rishi Iyer, Tomas Figliolia, Henry Zheng, Ryan Lorig-Roach, Sungyeon Yang, Pritish Yuvraj, Quentin Anthony, Yury Tokpanov, Xiao Yang, Ganesh Nanduru, Stephen Ebert, Praneeth Medepal
发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Robert Washbourne, Rishi Iyer, Tomas Figliolia, Henry Zheng, Ryan Lorig-Roach, Sungyeon Yang, Pritish Yuvraj, Quentin Anthony, Yury Tokpanov, Xiao Yang, Ganesh Nanduru, Stephen Ebert, Praneeth Medepalli, Skyler Szot, Srivatsan Rajagopal, Alex Ong, Bhavana Mehta, Beren Millidge

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是 ZAYA1-8B 技术报告的通俗化解释,辅以富有创意的类比。

宏观概览:拥有超能力的小大脑

想象一下,你有一位名叫 ZAYA1-8B 的微小却极其聪明的学生。这位学生的大脑仅拥有 7 亿个活跃神经元(对于人工智能而言,这是一个非常小的规模),但他们属于一个拥有 80 亿个总神经元 的更大“学校”。

通常,要解决高难度的数学问题或编写复杂的代码,你需要一个巨大的大脑(例如拥有数十亿参数的巨型人工智能)。ZAYA1-8B 的特殊之处在于,尽管它体型小巧,却能像甚至优于那些更庞大的“天才”学生一样解决这些难题。

它是如何做到的?依靠三件秘密武器:一种新的思维方式、一个特殊的训练营,以及一种独特的自我检查方法。


1. 架构:一支专业化团队

大多数人工智能模型就像是一个试图独自完成所有任务的人。而 ZAYA1-8B 则是基于“混合专家”(MoE)构建的,就像一支 专业化团队

  • 团队构成:想象一个拥有 16 位不同教师(专家)的教室。当问题出现时,一位“路由”(班长)会决定哪位教师最适合回答。
  • 新的班长(ZAYA1 路由):在旧模型中,班长只是一个简单的规则遵循者。ZAYA1-8B 使用了一个更智能、多层级的班长,它能更好地决定由谁来教学,确保每次都有正确的专家接手任务。
  • 压缩图书馆(CCA):为了阅读长书或记住长故事,该模型使用了一种“压缩图书馆”系统。它不需要在脑海中携带每一页书的内容,而是存储一个节省空间和能量的摘要压缩版本,同时保留所有重要细节。这使它能够处理非常长的对话而不会感到疲惫。

2. 训练:学会思考后再发言

该论文描述了一种独特的训练过程,旨在将这位学生转变为推理机器。

  • “答案保留”修剪:教师通常会有冗长详细的解释(推理轨迹),这些内容太长,无法塞进教科书的一页中。ZAYA1-8B 不使用切断故事中间部分(这会破坏逻辑)的方法,而是使用一种特殊技巧:它切断解释的 末尾,但 保留最终答案。这教会了模型如何规划和思考,即使完整的思维过程太长而无法一次性容纳。
  • 四阶段训练营:在学习基础知识后,该模型经历了一个严格的“强化学习”(RL)训练营:
    1. 热身:解决简单的谜题和数学问题,以适应深度思考。
    2. 健身房:一个包含 400 种不同谜题生成器的定制环境,随着模型能力的提升,谜题难度也会增加。
    3. 主赛事:应对真实的数学和编程挑战,包括一个特殊的“测试时计算”(TTC)阶段,在此阶段它学习生成多个可能的答案并挑选最佳的一个。
    4. 抛光:最后一个阶段,学习如何礼貌地聊天并遵循指令,像一个得力的助手。

3. 秘密武器:“马尔可夫 RSA"(群体思维)

这是论文中最具创新性的部分。通常,当人工智能解决难题时,它会尝试在一个长长的连续流中思考答案。如果这个流太长,人工智能就会感到困惑。

ZAYA1-8B 使用了一种称为 马尔可夫 RSA 的方法。把它想象成一场 带有变奏的接力赛

  • 比赛:模型不是让一名选手跑完全程马拉松,而是同时派出 16 名选手(候选者)。
  • 交接:每位选手只跑一段短而安全的距离(4000 个词的“尾部”)。他们不携带整场比赛的历史记录;他们只将 最后几步(尾部)传递给下一轮。
  • 聚合:一位“教练”查看所有 16 名选手的最后几步,结合最佳想法,并将它们发送出去进行下一轮。
  • 结果:通过将思考过程分解为小的、可管理的片段,并由团队投票选出最佳路径,ZAYA1-8B 能够解决极其困难的数学问题(如 AIME 和 HMMT 竞赛),而这些通常只有更大的大脑才能完成。

类比:想象试图拼凑一个巨大的拼图。

  • 旧方法:一个人试图一次性在脑海中容纳整个拼图。他们会感到不知所措。
  • ZAYA1-8B 方法:你派 16 个人去处理小区域。他们只将自己区域的一小部分传递给下一组。该组将这些小碎片结合起来,构建出完整的画面。这种方法更快,占用内存更少,且能取得更好的结果。

4. 硬件:基于 AMD 构建

整个模型是使用 AMD 计算机芯片(具体为 MI300X GPU)训练的。这是一件大事,因为它证明了训练顶级推理模型并不需要最昂贵、专有的芯片。该团队表明,只要软件和硬件设置得当,AMD 芯片就能承担训练复杂人工智能的重任。

5. 结果:小巧而强大

该论文声称,通过这种设置:

  • ZAYA1-8B(仅拥有 7 亿个活跃参数)在数学和编程测试中击败或持平了 DeepSeek-R1(拥有 370 亿个活跃参数)。
  • 当使用“马尔可夫 RSA"群体思维方法时,它在高难度数学竞赛中获得的分数非常接近 Gemini-2.5 ProGPT-5-High 等庞大且昂贵的模型。

总结

ZAYA1-8B 是一个小巧高效的人工智能,它证明了要成为天才并不需要巨大的大脑。通过利用智能的团队结构、一种能安全保留答案的特殊训练方法,以及一种用于思考的“群体接力赛”策略,它能够解决最困难的数学和编程问题,同时仅使用其大型竞争对手一小部分的计算能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →