Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning
本論文は、複雑な市場主導型の物流問題において、大規模言語モデルを大学院生と比較評価するトーナメント形式のベンチマークを提示しており、人間がコーディングしたエージェントがLLM生成のソリューションを大幅に上回ること、そしてほとんどのLLMエージェントが単純なベースラインを超えることに失敗し、さらには改善を促された際に最適な人間による戦略を劣化させてしまうことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
核心となる問い:「バイブ・コーディング(Vibe Coding)」は大学院生に勝てるのか?
想像してみてください。あなたは、言葉で指示を出すだけでコードを書いてくれる、超スマートなロボット助手(大規模言語モデル、またはLLM)を持っています。「配送アプリを作って」と言うだけで、ロボットは数秒でコードを打ち出します。これが「バイブ・コーディング(Vibe Coding)」と呼ばれるものです。
この論文が投げかけている大きな問いはこうです。「このロボットは、本当に複雑でリスクの高いビジネス問題を解決できるほど賢いのか? それとも、見た目は正しいけれど、物事が複雑になると破綻してしまうようなコードを書いているだけなのか?」
これを確かめるために、研究者たちは巨大なコーディング・トーナメントを開催しました。
舞台: 「オークション・ピックアップ・デリバリー」ゲーム
研究者たちは、ロボットに単純な計算問題(「2+2は?」のようなもの)を解かせるのではなく、**「オークション・ピックアップ・デリバリー問題(APDP)」**と呼ばれる複雑なシミュレーションの中に彼らを投入しました。
これは、ハイステークスな**「ロジスティクス・チェス」**のようなものです:
- オークション: いくつかの企業(エージェント)が配送案件に対して入札を行います。仕事は一つずつ販売されます。いくらで入札すべきかを予測しなければなりません。高く bidding しすぎると損をし、低くしすぎると、仕事は獲得できても配送コストで赤字になります。競合他社がどう動くかを予測する必要があります。
- プランニング(計画): 仕事を獲得したら、トラックの最適なルート(荷物の積み込みと配送)を考えなければなりません。トラックの積載容量には限りがあり、ルールを破ることはできません。
- ゴール: 勝者は、最も多くの利益(得られた入札額から走行コストを引いたもの)を出した企業です。
これは単に「エラーが出ないコードを書く」ことではありません。戦略的に考え、未来を予測し、相手を出し抜くようなコードを書くことが求められるのです。
競技者たち
研究者たちは、2つのチームを対戦させました。
- チーム・ヒューマン: AIコーディングツールが存在する前に、スイス連邦工科大学(EPFL)の大学院生たちが手作業で作成した17のエージェント。学生たちは数週間かけて思考し、計画を立て、手書きでコーディングしました。
- チームAI: 世界最高峰のAIモデル(GPT-5、Claude、Geminiなど)を用いて「バイブ・コーディング」によって作成された40のエージェント。研究者は、学生に与えられたものと全く同じ指示をAIにも与えました。
結果: 人間の圧勝
結果は驚くべきもので、明白でした。
- トップ5は人間: すべてのトーナメントにおいて、トップ5の座は人間の学生が独占しました。AIエージェントはトップ5に食い込むことができませんでした。
- AI vs 「何も考えていない」ベースライン: 研究者は、非常に単純で、何も考えていないAIエージェント(基本的にはランダムに推測するだけのもの)を作成しました。40のエージェントのうち33のエージェントが、この単純なエージェントに敗北しました。 AIの戦略性はあまりに低く、基本的な計算機レベルの動きにすら勝てなかったのです。
- 「修正」の悲劇: 最後のテストとして、研究者は「勝利した人間のコード」を取り上げ、最高のAIに「それを改善せよ」と命じました。AIはコードを微調整しようとしましたが、改善するどころか、むしろ悪化させてしまいました。その「改善された」バージョンは、1位から10位へと転落したのです。
なぜAIは失敗したのか?
論文によれば、LLMは構文(Syntax)(スペルミスのないコードを書くこと)には長けていますが、推論(Reasoning)(複雑な戦略の「なぜ」や「どのように」を理解すること)には苦労しています。
- 「許容可能なヒューリスティック」の失敗: より単純なテストにおいて、AIは最適な経路を見つけるための特定の数学的トリック(A*探索)を使うよう求められました。しかし、AIは研究者が明示的に指示したにもかかわらず、そのトリックの最も基本的なルールさえ何度も忘れてしまいました。これは、シェフにケーキの作り方を教えているのに、卵が重要な材料であることを教えた後でも、卵が必要であることを忘れてしまうようなものです。
- 「タイムアウト」のバグ: AIエージェントはしばしばループに陥ったり、考えるのに時間がかかりすぎたりして、時間を使い果たし、オークションに敗北しました。人間のコードにはこのような問題はありませんでした。
- 戦略の欠如: AIエージェントは、盲目に入札したり、燃料を無駄にするルートを計画したりすることがよくありました。彼らは「場の空気」を読んだり、競合他社の動きを予測したりすることができなかったのです。
結論
この論文は、**「LLMはまだ『大学院レベルのコーダー』にはなっていない」**と結論付けています。
LLMは、実行可能なコード(構文エラーのないコード)を書くことには非常に優れていますが、長期的な計画や戦略を必要とする複雑な現実世界のシナリオにおいて、競争力のあるコードを書く能力は現時点では極めて低いのです。
比喩:
ケーキの完璧なレシピを書けるロボットを想像してください。そのロボットは、小麦粉が何カップ必要か正確に知っています。しかし、もし価格が分刻みで変動し、競合他社が顧客を奪おうとし、予算も限られている街で、そのロボットに「ベーカリーの経営」を任せたらどうなるでしょうか。そのロボットはおそらく倒産するでしょう。ロボットはレシピを書くことはできますが、ビジネスを運営することはできないのです。
研究者たちは、コードが「動作するか(テストに合格するか)」を確認するだけでなく、そのコードが現実の世界で実際に「勝てるか」を検証すべき時が来ていると述べています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。