React-ing to Grace Hopper 200: Five Open-Weights Coding Models, One React Native App, One GH200, One Weekend
2026 年 4 月の最新オープンウェイトコーディングモデル 5 種を NVIDIA GH200 で評価した本論文は、SWE-Bench 順位が実際のタスク性能を予測しないこと、および「推論モデルの思考痕跡がファイルパス解析に漏洩する」などの 3 つの新たな実運用上の課題と、効率的な小規模モデルが大規模モデルと同等の性能を低コストで達成できる可能性を明らかにしています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
2026 年の「AI 職人」大レース:ベンチマークの予想を覆した驚きの結果
この論文は、2026 年 4 月に行われたある「実験」の記録です。
研究者は、**「5 つの最新の AI coding モデルに、たった一つの週末を使って、スマホと Web で動く『カンガルーの数を数えるアプリ』を作ってもらおう」**と試みました。
まるで、5 人の天才的な料理人に「週末に、完璧なパスタを作ってきて」と頼むようなものです。
そして、その結果は、これまでの「料理のコンテスト(ベンチマーク)」の順位表とは全く違う、意外な結末を迎えました。
1. 実験の舞台:巨大な「AI 厨房」と 5 人の料理人
- 厨房(ハードウェア): 実験に使われたのは、NVIDIA 社の「GH200」という、まるで宇宙船のエンジン室のような巨大なコンピューターです。メモリは 576GB もあり、これは「図書館 1 棟分の本を同時に頭の中で持てる」ほどの容量です。
- 料理人(AI モデル): 5 つの「オープンウェイト(誰でも使える)」AI モデルが参加しました。
- Kimi-K2.5: 1 兆パラメータという超巨大な脳みそを持つ天才(ただし、今回は「圧縮版」で参加)。
- GLM-5.1: 7540 億パラメータの巨匠。
- Qwen3-Coder: 4800 億パラメータの職人。
- DeepSeek-V3.2: 6710 億パラメータの秀才。
- (参考)MiniMax: 100 億パラメータの「効率型」モデル。
2. 予想外の結果:「コンテストの優勝者」は落選した
これまでの「SWE-Bench」という料理コンテスト(コード生成能力を測るテスト)では、GLM-5.1やDeepSeekがトップクラスでした。
しかし、今回の「実戦(アプリ作成)」では、**Kimi-K2.5 の「3 ビット圧縮版(Q3)」**が圧勝しました。
- Kimi-K2.5 (Q3): 完璧なアプリを作りました。ユーザーごとにデータが分かれ、1 日ごとの記録も残ります。
- GLM-5.1 (SWE-Bench 優勝候補): コードは綺麗でしたが、「Firebase(企業向けの本格的な認証システム)を使わないと動かない」という設定にしてしまい、「自宅のキッチンで料理するつもりが、高級ホテルの設備がないと作れない料理」を作ってしまいました。 実用性はゼロです。
- DeepSeek-V3.2: 思考プロセス(「まず App.js から始めよう…」という独り言)が、ファイル名に混入してしまい、「料理の名前が『まず包丁から始めよう』という文章そのもの」になってしまい、厨房(ファイルシステム)が混乱して料理が完成しませんでした。
結論: 「テストの点数が高い=実務ができる」とは限らない、という教訓です。
3. 3 つの「驚きのハプニング」
実験中、研究者は 3 つの新しい発見(トラブル)に遭遇しました。
「無表情な AI」はフリーズする
- 多くのツールは「温度(Temperature)」という設定を「0(完全に論理的・無表情)」に固定しています。しかし、Kimi-K2.5 のような「考える AI」は、この無表情な状態だと**「思考停止」して固まってしまいました。**
- 教訓: 考える AI には、少し「熱意(温度)」を持たせてあげないと、作業が進まないようです。
「独り言」がファイル名を壊す
- AI が「よし、App.js を作ろう…」と思考プロセス(独り言)を喋っている最中に、その文章がそのままファイル名として認識されてしまいました。
- 教訓: AI の「考え」と「実際の出力」の境界線が曖昧だと、システムが混乱します。
「スマホ用」の魔法が「Web」では効かない
- どの AI も、スマホの「アラート(警告)」機能を使おうとしましたが、Web ブラウザではそれが機能しません。
- 教訓: 「スマホ向けに訓練された AI」は、Web 向けの仕様を「知らない」ことが多いです。これはどのモデルも共通の弱点でした。
4. ハードウェアの真実:「巨大な脳」より「賢い頭」?
実験のもう一つの大きな発見は、「サイズ」よりも「設計思想」が重要だということです。
- 巨大派(Scale School): 320 億〜400 億の「アクティブパラメータ」を持つモデル。これらは巨大なサーバー(GH200 など)がないと動きません。
- 効率派(Efficiency School): 100 億〜150 億の「アクティブパラメータ」を持つモデル(例:MiniMax)。これらは、Mac Studio 1 台でも快適に動きます。
驚くべき事実:
「効率派」のモデルは、巨大な「巨大派」モデルと同じくらいの性能を出しながら、必要なハードウェアコストは 1/7 以下でした。
「1 兆パラメータの巨大な脳みそ」を持つ AI が、3 ビット圧縮されても勝つ一方で、「100 億パラメータの賢い頭」を持つ AI は、もっと安価なマシンで同じ結果を出せることがわかりました。
まとめ:私たちが学ぶべきこと
この論文は、2026 年の AI 開発者への重要なメッセージを送っています。
- ベンチマークの点数だけを見てはいけない: 試験の点数が良いからといって、実際の仕事ができるわけではありません。
- 「実戦」で試すことが重要: 自分が作りたいアプリやタスクに特化して、実際に動かしてみないと本当の力はわかりません。
- AI の「性格」を知る: AI モデルはそれぞれ癖があります。「温度」の設定や「思考プロセス」の扱い方など、ツール側の設定を AI に合わせて調整する必要があります。
一言で言えば:
「一番大きな車(巨大モデル)が必ずしも一番速いとは限らない。むしろ、自分の道(タスク)に合った、賢くコンパクトな車(効率型モデル)を選ぶ方が、結果的に安く、早く、目的地にたどり着けるかもしれない」という、2026 年の AI 選びの新しい指針です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。