← 最新の論文
🤖 AI

SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

本論文は、現在の大規模言語モデルが科学コードの生成において著しく苦戦していることを示すとともに、このデータセットでの学習がそれらの性能を大幅に向上させることを示すための、128GBの大規模な科学コードコーパスおよび200のタスクからなる実行可能なベンチマークであるSciCodePileを導入するものである。

原著者: Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超高性能なロボットにプログラミングを教えようとしていると想像してください。あなたはすでに、そのロボットに基礎的なことを教えています。簡単なウェブサイトの作り方や、電卓の作り方、あるいはプレイリストの整理の仕方などです。ロボットは、何百万もの本やウェブサイトを読み込んでいるため、こうした「一般的な」タスクについてはかなり優秀です。しかし今、あなたは、このロボットが本当に難しい仕事、つまり科学者のためのコードを書けるかどうかを試したいと考えています。私たちが話しているのは、ウイルスの拡散をシミュレートしたり、タンパク質の折り畳みを計算したり、新しい薬における原子の挙動をモデル化したりするようなコードのことです。これは「科学的コード」です。これは通常のコードとは異なります。なぜなら、単にコンピュータに何かを実行させるだけでなく、コンピュータの数学と論理が、現実世界の、混沌としていて複雑な自然の法則と一致していることを保証しなければならないからです。もしロボットが構文(シンタックス)は正しくても、科学的内容を間違えてしまったら、その結果は単なるバグではなく、実験の失敗や危険な計算ミスになってしまいます。大きな疑問は、標準的なコードを書くのが得意な現在のAIロボットが、果たして科学者のための重労働をこなすことができるのか、ということです。

そこで、SCICODEPILEが登場します。これは、巨大で専門化された訓練場であり、かつ厳格な最終試験として機能する、大規模な新しいプロジェクトです。この論文の著者たちは、AIが科学的コーディングを扱えるかどうかを真にテストするためには、2つのものが必要だと考えました。一つは、AIが学習するための膨大な実世界の科学コードのライブラリであり、もう一つは、コードが単に見た目が優れているだけでなく、実際に「実行」され、動作しなければならないという厳格なテストです。

まず、彼らはライブラリを構築しました。彼らはただランダムにコードを集めたのではありません。彼らはインターネット上の37,737個の公開コード・リポジトリを探索し、特に化学、生物学、物理学、その他の科学に関連するプロジェクトを探し出しました。彼らはジャンクなデータを取り除き、最終的に128GBにおよぶ科学コードの膨大なコレクションを作り上げました。これは、何千もの実際の科学研究所からのあらゆる指示書、設計図、そしてあらゆるコードを含むライブラリのようなものです。彼らはこのライブラリを、生のコードファイル、プロジェクトの概要、特定の関数の指示、そして問題と解決策のペアという4つの異なる方法で整理しました。それは、まるでガレージに散乱した車の部品を、エンジン、マニュアル、そして部品がどのように組み合わさるかの図解が一度にすべて確認できる、完璧にラベル付けされた博物館へと整理するようなものです。

次に、彼らは試験を作成しました。彼らは200のタスクからなるベンチマークを作成しました。しかし、ここでの肝は、彼らがAIに対して、単に人間の回答に似たコードを書くよう求めたのではないという点です。彼らはAIのコードを「サンドボックス」と呼ばれる、安全で隔離されたデジタル的な遊び場に入れ、実際に実行させたのです。もしコードがクラッシュしたり、誤った数値を返したり、テストに失敗したりすれば、それは不合格でした。それは、コードが実際に「動作した」かどうかに基づく、合格か不合格かのテストでした。

さて、ロボットたちはどうだったでしょうか? 結果は、少し厳しい現実を突きつけるものでした。最も賢いAIモデルであっても、科学的な内容にはひどく苦戦しました。「穴埋め」形式のタスクにおいて、最高のモデルが得たスコアは、満点のわずか**38%程度でした。しかし、「動作させる」という試験においては、数字はさらに深刻でした。最高峰のモデルでさえ、合格したのはわずか12.30%**の時だけでした。つまり、100個の科学的コーディング問題のうち、AIは88個を間違えたことになります。これは、AIが「正しく見える」コードを書くことは得意になっていても、科学的に信頼できるコードを書くには、まだ長い道のりがあることを示唆しています。

研究者たちはまた、この新しいライブラリがロボットを教えるために実際に有用であることも示しました。彼らがより小さなAIモデルを取り上げ、彼らの128GBのライブラリを学習させたところ、その性能は大幅に向上しました。それは、学生に数枚のフラッシュカードを与える代わりに、一冊の教科書を積み重ねて与えるようなものです。突然、彼らは教材をずっと深く理解できるようになります。

要するに、SCICODEPILEは、「おいAI、君はコーディングは得意だが、まだ科学者になる準備はできていないぞ」と告げる、大規模な新しいツールなのです。それは、彼らをより良く訓練するためのリソースと、彼らが実際に学んだかどうかを見極めるための厳格なテストを提供しています。これは、私たちが大きな進歩を遂げている一方で、コードを書くことができるロボットと、真の科学を行うことができるロボットの間には、依然として巨大な溝があるということを示す、警鐘なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →