A Showdown of ChatGPT vs DeepSeek in Solving Programming Tasks
本研究は Codeforces のプログラミング課題において ChatGPT 03-mini と DeepSeek-R1 を比較し、両モデルとも易しい問題では同程度の性能を発揮し難しい問題では苦戦する一方で、中程度の難易度の課題においては ChatGPT が DeepSeek-R1 を大幅に凌駕することを明らかにした。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
2 人の非常に才能があるが、大きく異なる学生が、一連のコーディング試験を受ける様子を想像してみてください。一人は、図書館のほぼすべての本を読んだ、よく知られた高度に訓練された学生であるChatGPT(特に o3-mini バージョン)です。もう一人は、論理的推論と数学パズルへの集中的な焦点で知られる、中国発の新しいオープンソースの挑戦者であるDeepSeek-R1です。
ベルゲン大学の研究者たちは、これら 2 人をプログラマー向けの「ジム」とも呼ばれるCodeforcesでテストにかけようと決めました。彼らは両方の学生に、簡単なウォーミングアップから過酷なマラソンまで幅広い 29 の問題を与え、それらを解決する C++ コードの作成を求めました。
以下に、難易度別にこの対決がどのように展開したかを示します。
1. ウォーミングアップ(簡単なタスク)
これらは単純な算数の問題や基本的な論理パズルだと考えてください。
- 結果: 両方の学生は素晴らしい成果を上げました。彼らは 100 メートル走を走るトップクラスの 2 人のアスリートのようであり、両者ともレースを無事に完走しました。
- 注意点: 両者とも正解を得ましたが、DeepSeek は時々 ChatGPT より少し遅く、少し多くの「エネルギー」(メモリ)を使用しました。しかし、両者ともゴールラインを越えました。
2. 中距離走(中程度のタスク)
ここでレースは面白くなりました。これらの問題は、少し多くの戦略と計画を必要としました。
- ChatGPT: この学生はここで明確な勝者でした。彼らはこれらの問題の約**55%**を正しく解決しました。彼らはペース配分を正確に知っているベテランのマラソンランナーのようでした。
- DeepSeek: この学生は大きく苦戦し、中程度の問題の約**18%**しか解決できませんでした。まるでレースの途中で混乱し、自分の足でつまずいたり、ルールを忘れたりしたかのようでした。
- なぜか? 論文は、ChatGPT がトレーニング中にこの特定の種類の「競技プログラミング」データにより多くの練習を積んでいた可能性があり、それが先行利益をもたらしたと示唆しています。
3. ウルトラマラソン(難しいタスク)
これらは、複雑で多段階の論理を必要とする最も厳しい課題でした。
- 結果: 両方の学生は壁にぶつかりました。
- ChatGPTは、9 つの難しい問題のうち1 つしか解決できませんでした。
- DeepSeekは、難しい問題の一つも解決できませんでした(0%)。
- 比喩: 両方の学生に、設計図なしで最初から高層ビルを建設するよう頼んだと想像してください。両者とも行き詰まりました。ChatGPT は構造が崩壊する(ランタイムエラー)前に数階建てようとしましたが、DeepSeek はしばしば基礎さえも築けず(コンパイルエラー)、または完了する前にエネルギーを使い果たしました(メモリ制限)。
「エネルギー」消費(メモリと時間)
研究者たちは、各学生が使用した「燃料」(コンピュータメモリ)と時間にも注目しました。
- ChatGPTは、一般的に簡単および中程度のタスクにおいて、リソースをより速く、効率的に使用しました。
- DeepSeekは、特に難しいタスクにおいて、膨大な量のメモリを使用したり、考えるのに非常に長い時間をかけたりすることがありました。ある事例では、DeepSeek は問題について考えるのに時間をかけすぎて、完全にタイムアウトしました。
結論
この論文は、DeepSeek-R1は簡単なタスクをうまく処理できる強力な新しい挑戦者である一方で、ChatGPT o3-miniが現在、中程度の難易度のコーディング課題に対するより優れた「コーチ」であると結論付けています。しかし、問題が本当に難しくなると、両方のモデルは人間の助けを必要とします。彼らはまだ、最も難しいパズルを単独で解決する準備ができていません。
研究からの重要な注記:
研究者たちは、各学生に問題を1 回だけ(「シングルショット」の試行)試すよう求めました。失敗した場合やヒントを求めることを許可しませんでした。論文は、人間が彼らを導くことを許可された場合、または DeepSeek のより専門的なバージョン(DeepSeek-Coder と呼ばれる)を使用した場合は、結果が異なっていたかもしれないと指摘しています。しかし、この特定のテストに基づけば、ChatGPT は中間層で先行し、両者とも最上位レベルで苦戦しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。