Fine-Tuning and Serving Gemma 4 31B on Google Cloud TPU: A Technical Comparison with GPU Baselines
本文首次展示了在 Google Cloud TPUs 上对 Gemma 4 31B 模型进行端到端的微调与部署,详细说明了将原生 GPU 工作流移植到 JAX 栈所需的代码适配,并证明与 H100 GPU 基线相比,该 TPU 配置在保持相当推理吞吐量的同时实现了 1.61 倍的训练加速和 1.82 倍的降本,且显著降低了延迟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个聪明但极其昂贵的机器人(一个 AI 模型)一项新技能:为电子电路编写计算机代码(Verilog)。你有两个“学校”可供选择来进行这项训练:
- GPU 学校:由 NVIDIA 运营,使用其著名的 H100 芯片。这是一条标准且成熟的道路,拥有许多经验丰富的教师。
- TPU 学校:由 Google 运营,使用其定制的 TPU 芯片。这是一个较新、高度专业化的校区,速度更快、成本更低,但要求你学习一门全新的语言才能入学。
这份来自 h2loop.ai 的报告是由决定尝试 Google TPU 学校的工程师们撰写的一份“实地指南”。他们使用了一个 310 亿参数的 AI 模型(Gemma 4),教它编写代码,然后将其表现与标准的 NVIDIA 学校进行了对比。
以下是他们旅程的简要分解:
1. 语言障碍(“移植”问题)
最大的障碍并非硬件本身,而是软件。
- GPU 学校使用 PyTorch,这是一种大多数 AI 开发者已经熟悉的流行编程语言。
- TPU 学校使用 JAX,这是一种不同的语言,需要不同的思维方式。
作者们不得不将整个“教学计划”从 PyTorch 翻译成 JAX。他们必须:
- 重新安排模型大脑在多个芯片上的分布方式(就像整理图书馆,将书籍从原本分散在 2 个房间改为分散在 4 个房间)。
- 重命名模型的特定部分,因为 TPU 学校对事物的称呼不同(例如,将"q_proj"称为"q_einsum")。
- 构建一个自定义的“桥梁”来保存他们的工作,因为 TPU 学校使用与外界(Safetensors)不同的归档系统(Orbax)。
类比:这就像搬房子。家具(AI 模型)是一样的,但新房子(TPU)有不同的门道和户型。你必须拆解家具,穿过新门搬运,然后重新组装,否则它无法放入。
2. 训练竞赛(教导机器人)
一旦模型设置完毕,他们便开始了训练竞赛。
- 速度:TPU 学校快了 1.6 倍。它仅用 3.3 小时就完成了培训课程,而 GPU 学校则耗时 5.4 小时。
- 成本:由于 TPU 学校每小时收费更低且完成速度更快,总账单便宜了 2.1 倍。
- GPU 账单:约 119 美元
- TPU 账单:约 56 美元
为什么 TPU 更快?
将 TPU 芯片想象成一支由 4 名跑步者组成的团队,他们通过一条超高速的内部高速公路(ICI)极其迅速地将接力棒(数据)互相传递。GPU 学校只有 2 名跑步者。尽管单个 GPU 跑步者稍快一些,但 TPU 团队协调一致、共同移动数据的能力使得整个团队获胜。
3. 考试(机器人学会了吗?)
训练结束后,他们在 Verilog 编码考试中测试了这些机器人。
- 结果:在 GPU 上训练的机器人在最难的问题上得分略高(约好 5%)。
- 关键点:作者指出,这种差异可能是因为两所学校评分标准略有不同(一所忽略了问题的“提示”部分,另一所没有),而不是因为其中一个机器人天生更聪明。这种差异在统计上并不巨大。
4. 求职面试(模型部署)
训练结束后,模型需要投入工作,实时回答用户问题。这被称为“推理”。他们测试了模型回答不同长度问题的速度。
短问题(简单任务):
- GPU 学校在回答非常短的问题时略快。
- 对于这些快速任务,每个回答的成本也略低。
- 类比:如果你只需要买一杯咖啡,本地商店(GPU)效率稍高。
长问题(复杂任务):
- 当问题变长(4,000 字以上)时,TPU 学校绝对碾压了对手。
- 速度:TPU 在开始回答长问题时的速度(首字生成时间)快了 23 倍。
- 容量:TPU 能够同时处理 4 倍 多的人询问长问题而不会减速。
- 类比:如果你需要写一整部小说,TPU 学校拥有巨大的图书馆和一支可以无缝协作的写作团队。而 GPU 学校则不堪重负,开始掉落书籍。
5. 最终裁决
作者得出结论,对于他们的特定需求(训练大型模型并将其服务于用户),Google 的 TPU 是赢家。
- 训练:TPU 是明确的冠军(更快且便宜得多)。
- 推理:TPU 是处理任何复杂或长任务的冠军。对于非常简单、短小的任务,GPU 仍然略胜一筹。
- 总成本:将训练成本与一天的用户服务成本相加,TPU 设置的总体成本便宜了 1.8 倍。
核心结论:
切换到 TPU 学校需要前期投入大量艰苦工作(学习新语言、拆解家具、搭建桥梁)。但一旦安顿下来,这所学校运行得更快、成本更低,并且在处理大型复杂任务方面比传统的 GPU 学校表现更好。对于从事繁重 AI 工作的公司来说,切换所需的额外努力是值得的,因为它带来了节省和性能的提升。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。