← 最新の論文
🤖 AI

Fine-Tuning and Serving Gemma 4 31B on Google Cloud TPU: A Technical Comparison with GPU Baselines

本論文は、Google Cloud TPU 上で Gemma 4 31B のファインチューニングとサービングを初めてエンドツーエンドで実証し、GPU ネイティブなワークフローを JAX スタックに移行するために必要なコード適応を詳述するとともに、H100 GPU ベースラインと比較して推論スループットは同等でありながらレイテンシが大幅に低減され、トレーニング速度が 1.61 倍高速でコストが 1.82 倍低く抑えられることを TPU 構成が達成していることを実証する。

原著者: Jatin Kishnani, Mayank Goel, Amit Singh, Pulkit Agrawal, Sairanjan Mishra

公開日 2026-05-26
📖 1 分で読めます☕ さくっと読める

原著者: Jatin Kishnani, Mayank Goel, Amit Singh, Pulkit Agrawal, Sairanjan Mishra

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが、非常に優秀だが非常に高価なロボット(AI モデル)に、電子回路のコンピュータコード(Verilog)を書くという新しいスキルを教えようとしていると想像してください。このトレーニングを行う「学校」として、あなたは以下の 2 つの選択肢を持っています。

  1. GPU スクール: NVIDIA が運営し、有名な H100 チップを使用しています。これは、多くの経験豊富な教師がいる、標準的でよく歩かれた道です。
  2. TPU スクール: Google が運営し、独自のカスタム TPU チップを使用しています。これはより新しく、高度に特化したキャンパスで、より速く安価ですが、入学するには全く新しい言語を学ぶ必要があります。

h2loop.aiからのこの報告書は、Google の TPU スクールを試すことを決めたエンジニアたちによって書かれた「フィールドガイド」です。彼らは 310 億パラメータの AI モデル(Gemma 4)をコード作成に訓練し、その性能を標準的な NVIDIA スクールと比較しました。

以下に、彼らの旅路を分かりやすく解説します。

1. 言語の壁(「ポート」の問題)

最大の障壁はハードウェアそのものではなく、ソフトウェアでした。

  • GPU スクールは、ほとんどの AI 開発者が既に知っている人気プログラミング言語であるPyTorchを話します。
  • TPU スクールは、異なる思考様式を必要とする別の言語であるJAXを話します。

著者たちは、PyTorch から JAX へと「授業計画」全体を翻訳する必要がありました。具体的には以下のことを行いました。

  • 複数のチップにまたがるモデルの「脳」の分割方法を再編成しました(これは、本が 2 つの部屋ではなく 4 つの異なる部屋に散らばっている図書館を整理するようなものです)。
  • TPU スクールでは呼び方が異なるため、モデルの特定の部分を名前変更しました(例えば、「q_proj」を「q_einsum」と呼ぶなど)。
  • TPU スクールは世界標準(Safetensors)とは異なるファイルシステム(Orbax)を使用するため、作業を保存するためのカスタム「橋」を構築しました。

比喩: これは家を引っ越すようなものです。家具(AI モデル)は同じですが、新しい家(TPU)には異なるドアの幅や間取りがあります。家具を分解し、新しいドアを通って運び込み、再組み立てしないと、入りません。

2. トレーニング競争(ロボットに教える)

モデルのセットアップが完了すると、トレーニング競争が始まりました。

  • 速度: TPU スクールは1.6 倍速く、トレーニングコースを 3.3 時間で完了しました。一方、GPU スクールは 5.4 時間かかりました。
  • コスト: TPU スクールは時間あたりの料金が安く、かつ完了が早いため、請求総額は2.1 倍安価でした。
    • GPU 請求額: 約 119 ドル
    • TPU 請求額: 約 56 ドル

なぜ TPU は速かったのでしょうか?
TPU チップを、超高速な内部ハイウェイ(ICI)を通じて互いに極めて素早くバトン(データ)を受け渡す 4 人のランナーのチームだと考えてください。GPU スクールには 2 人のランナーしかいませんでした。個々の GPU ランナーはわずかに速かったものの、TPU チームの協調性とデータを一緒に移動させる能力が、チーム全体としての勝利をもたらしました。

3. 試験(ロボットは学習したか?)

トレーニング後、彼らはロボットに Verilog コーディングの試験を受けさせました。

  • 結果: GPU でトレーニングされたロボットは、最も難しい問題でわずかに高いスコア(約 5% 優位)を記録しました。
  • 注意点: 著者たちは、この違いは一方が「プロンプト」部分を無視し、他方が無視しなかったなど、2 つの学校が試験の採点基準をわずかに異ならせたためであり、どちらかのロボットが本質的に賢かったからではないと指摘しました。この差は統計的に大きなものではありませんでした。

4. 就職面接(モデルの提供)

トレーニング後、モデルはリアルタイムでユーザーの質問に答えるために実用化されなければなりません。これを「推論」と呼びます。彼らは、異なる長さの質問にモデルが答える速度をテストしました。

  • 短い質問(単純なタスク):

    • GPU スクールは、非常に短い質問への回答でわずかに速かったです。
    • これらの迅速なタスクに対する回答ごとのコストもわずかに安価でした。
    • 比喩: コーヒー 1 杯を買うだけなら、地元の店(GPU)の方がわずかに効率的です。
  • 長い質問(複雑なタスク):

    • 質問が長くなると(4,000 語以上)、TPU スクールは圧倒的な差をつけました。
    • 速度: TPU は、長い質問への回答開始(Time-to-First-Token)において23 倍速くでした。
    • 容量: TPU は、速度を落とすことなく、同時に長い質問をする人を4 倍多く処理できました。
    • 比喩: 小説 1 冊を書く必要がある場合、TPU スクールには巨大な図書館と、シームレスに協力して働ける作家チームがあります。一方、GPU スクールは圧倒され、本を落とし始めます。

5. 最終判断

著者たちは、彼らの特定のニーズ(大規模モデルのトレーニングとユーザーへの提供)において、Google の TPU が勝者であると結論付けました。

  • トレーニング: TPU は明確なチャンピオンです(速く、はるかに安価)。
  • 推論: TPU は複雑なタスクや長いタスクにおいてチャンピオンです。非常に単純で短いタスクについては、GPU がわずかに優れています。
  • 総コスト: トレーニングコストと 1 日分のユーザー提供コストを合計すると、TPU 構成は全体として1.8 倍安価でした。

結論:
TPU スクールへの切り替えには、新しい言語を学び、家具を修理し、橋を架けるなど、多くの事前の努力が必要でした。しかし、一度落ち着けば、その学校はより速く回り、コストが安く、従来の GPU スクールよりもはるかに大きな複雑なタスクを処理できました。重い AI 作業を行う企業にとって、切り替えのための追加努力は、節約とパフォーマンスに見合う価値がありました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →