← 最新の論文
💻 computer science

Can LLMs Solve Science or Just Write Code? Evaluating Quantum Solver Generation

本論文は、大規模言語モデルが反復的な改善を通じて量子ソルバの成功率を向上させることができるものの、数値精度の面で依然として困難に直面し、かつ著しい計算オーバーヘッドを伴うことを実証する反復的評価手法であるQ-SAGEを導入し、科学量子ソフトウェア開発の完全な自動化における現在の限界を明らかにする。

原著者: Luciano Baresi, Domenico Bianculli, Maryse Ernzer, Livia Lestingi, Fabrizio Pastore, Seung Yeob Shin

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Luciano Baresi, Domenico Bianculli, Maryse Ernzer, Livia Lestingi, Fabrizio Pastore, Seung Yeob Shin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に才能があり、超高速なロボットアシスタントがいて、コンピュータコードの作成が得意だと想像してください。あなたはそのロボットに、難しい物理学の謎を解くための複雑な機械を構築するよう依頼します。ロボットはコードを入力し、機械が動き出します。クラッシュしません!エラーメッセージも出ません!完璧に機能しているように見えます。

しかし、ここには落とし穴があります:機械は動いていますが、間違った答えを返しているのです。

これが、ミラノ工科大学とルクセンブルク大学の研究者たちが論文「Can LLMs Solve Science or Just Write Code?(LLM は科学を解くことができるのか、それとも単にコードを書くだけなのか?)」で取り組んだ核心的な問題です。彼らは、ChatGPT などのツールの背後にある AI の頭脳である大規模言語モデル(LLM)が、実際に正しい科学問題解決のためのコードを書けるのか、それとも数学的なテストには失敗するが「正しそうに見える」コードを書くだけなのかを知りたがっていました。

「Q-SAGE」ワークショップ

これを明らかにするため、研究者たちはQ-SAGEと呼ばれるテストフレームワークを構築しました。Q-SAGE は、AI コードのための厳格で反復的なワークショップだと考えてください。

  1. 課題: AI に科学的な問題(小さな磁石内の電子の挙動や分子の結合の仕方などを解明するものなど)が与えられます。
  2. ドラフト: AI はそれを解決するための Python スクリプトを書きます。
  3. テスト実行: スクリプトがコンピュータ上で実行されます。
  4. 現実確認: 結果は「ゴールドスタンダード(黄金基準)」と比較されます。これは、正しい答えを与えることが分かっている、信頼できる古典的なコンピュータプログラムです。
  5. フィードバックループ: AI の答えが間違っている場合(またはコードがクラッシュした場合)、ワークショップは単に「不合格」と言うだけではありません。AI に「なぜ失敗したか」を伝えます(例:「数学的なエラーが発生しました」または「コードがクラッシュしました」など)。その後、AI はコードを書き直し、再度挑戦します。

彼らは、量子物理学から化学まで幅広い 5 種類の科学的問題と、オープンソースのものから大手テック企業製のものまで 5 種類の異なる AI モデルを用いて、このワークショップを実行しました。

彼らが発見したこと

1. 「最初のドラフト」の問題
AI にフィードバックなしで一度だけコードを書くよう求めた場合、失敗することがよくありました。まるで、学生に勉強も練習もさせずに最終試験を受けさせるようなものです。多くのスクリプトは即座にクラッシュするか、間違ったツールを使用しました(電球をねじ込むためにハンマーを使うようなものです)。

2. 「試行、失敗、修正」の魔法
研究者たちが AI に反復を許し、ミスを認識して再挑戦させたところ、成功率は劇的に向上しました。

  • 比喩: 料理人がケーキを焼こうとしている様子を想像してください。初めては卵を忘れます。審査員は「卵がない」と言います。料理人は再度挑戦し、卵を加えますが、ケーキを焦がしてしまいます。審査員は「火力を落とせ」と言います。3 回目か 4 回目の挑戦で、料理人はようやく完璧なケーキを焼き上げます。
  • 結果: 単純な問題の場合、AI は約 5 回の試行で自らのミスを修正することに非常に上手になりました。

3. 「静かな殺し屋」:間違った数学
ここが最も重要な発見です:AI モデルが賢くなるにつれて、ミスの種類が変わりました。

  • 愚かな AI: 「構文」エラーを起こしました。コードは実行さえされません。まるで、鍵が間違ったイグニッションに入っているために始動しない車のようです。
  • 賢い AI: コードは完璧に実行されました!しかし、数値が間違っていました。まるで、GPS がわずかにずれているために、スムーズに走行しながらも間違った方向へ曲がってしまう車のようです。
  • 教訓: 最高の AI モデルでさえ、数値的な正確さには苦労します。量子物理学の解決策のように「見える」コードを書くことはできても、内部的な数学がわずかにずれており、科学的に無意味な結果をもたらします。

4. 完璧さの代償
AI にミスを修正させるには時間がかかります。

  • 比喩: 人間にレポートを書くよう頼めば、1 時間かかります。しかし、書かせてフィードバックを受け、書き直し、再びフィードバックを受け、それを 5 回繰り返すよう頼めば、5 時間かかるかもしれません。
  • 結果: 研究者たちは、反復的なフィードバックが機能した一方で、莫大な「時間税」を伴うことを発見しました。正しい答えを得るには、単にコードを一度実行するよりもはるかに長い時間がかかることがよくありました。非常に複雑な問題の場合、AI は試行と失敗のループに陥り、多くのコンピュータ時間を浪費することがありました。

結論

この論文は、AI がコード作成の能力を向上させている一方で、まだ信頼できる科学者ではないと結論付けています。

  • コードは書けるか? はい、特にミスを修正させることを許せば。
  • 科学を解けるか? 単独では信頼できません。実行はするが間違った数値を返すコードを生成することがよくあります。

研究者たちは、現時点では AI は 80% のところまで到達できる優れた「下書き作成者」ですが、最終的な数学を確認するには、人間の専門家(または非常に厳格な検証システム)が依然として必要だと提案しています。科学を AI に任せるだけではいけません。結果を検証する必要があります。なぜなら、プログラムが実行されているからといって、常に正しい答えが出ているわけではないからです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →