Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery
Science Edge Evaluation (SEE) ベンチマークは、現在のマルチモーダル大規模言語モデルが、化学、生物学、および材料科学における実験データからエビデンスに基づいた洞察を確実に導き出すことに苦慮しており、ツール活用を行っても最高で52.7%の精度にとどまっていることを明らかにしており、これは既知の概念を説明することと真の科学的発見を行うこととの間にある決定的な隔たりを浮き彫りにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ただ目撃者の供述を読むのではなく、ぼやけた写真、指紋、化学テストの結果、そして引き裂かれた地図を同時に見なければならない、謎を解こうとしている探偵だと想像してください。これこそが、実際の科学的発見の感覚です。科学者は単に教科書の事実を暗記するのではなく、微細な細胞の画像、機械から出力されたぐにゃぐにゃした線、実験から得られた数値といった、雑多で現実的なデータを見つめ、実際に何が起きているのかを解明しなければなりません。彼らは、自分が「こうあるべきだ」と考えるに基づいて推測するのではなく、証拠が「実際に」示していることに基づいて行動しなければならないのです。
長い間、私たちは「大規模言語モデル(LLM)」と呼ばれるコンピューターの脳が、この探偵のような仕事を手伝うほど賢いかどうかをテストしてきました。これらは、物語を書いたり、トリビアに答えたりできる、あの種のAIと同じものです。しかし、大きな疑問があります。AIは、この雑多で視覚的かつ複雑な現実を扱うことができるのでしょうか?もしAIが新しい薬や材料の発見で科学者を助けたいのであれば、単に「話し上手」であるだけでなく、「観察上手」であり、かつ「まだ手がかりが足りない」と言える慎重な思考家でなければなりません。
偉大なるラボ・テスト:AIは科学を「見る」ことができるか?
研究者チームは、これらのAI探偵たちに究極のテストを課すことにしました。彼らは、Science Edge Evaluation (SEE) と呼ばれる新しい挑戦状を作成しました。SEEを、単に「フランスの首都は?」や「水の公式は?」と問うような試験ではなく、巨大で超難解な試験だと考えてください。その代わりに、AIに本物の科学的な謎を提示します。顕微鏡のスライドの写真、化学実験のグラフ、そしてそれらすべての点をつなぎ合わせて答えを見つけ出す必要がある質問です。
この試験は、化学(物質の変化)、生物学(生命の仕組み)、材料科学(新しいものを作る方法)という3つの大きな分野をカバーしています。問題は、実際に発表された科学論文や実際のラボ実験から引用されています。全部で1,116問あり、それらは非常に巧妙に作られています。グラフから特定の数値を読み取るよう求めるものもあれば、生物学的な図の誤りを見つけさせるもの、あるいは生物学と化学の両方の知識を組み合わせることを要求するものもあります。
結果:現実との直面
研究者たちは、19種類の異なるAIモデルをこの試験にかけてみました。これには、あらゆることをこなせる最も有名で巨大な「汎用」AIと、科学の書籍に特化して訓練された「科学特化型」のAIが含まれています。
ここで大きな驚きがありました。どのモデルも、満点を取って合格することはありませんでした。
実際、最も優れたパフォーマンスを示した GPT-5.6-Sol (Max) という強力なモデルでさえ、正解率はわずか 48.7% でした。これは半分にも満たない数字です!他のモデルはさらに成績が悪く、中には 15.9% しかスコアを出せないものもありました。それは、まるで学生が期末試験を受けて、Dマイナスを付けられたような状態です。
さらに興味深いことに、「科学の授業を熱心に勉強してきた」はずの「科学特化型」モデルは、平均して汎用モデルよりも成績が悪かったのです。汎用モデルの平均正解率は 34.9% でしたが、科学の専門家たちは平均 22.2% でした。このことは、大量の科学的事実を暗記するだけでは不十分であることを示唆しています。AIには、雑多で現実的な画像を見るときに、それらの事実をどのように「使う」かを知る必要があるのです。
「ツール」の問題:計算機があれば助けになるか?
研究者たちはこう考えました。「もしAIに計算機と検索エンジンを与えたらどうなるだろうか?」彼らは、トップ6のモデルに対し、ウェブ検索(事実を調べるため)やコードインタープリター(数学計算や画像分析を行うため)といったツールの使用を許可しました。
ツールを与えることで改善は見られましたが、わずかなものでした。最高ランクのモデルのスコアは、48.7% から 52.7% に上がりました。これは小さな向上ではありますが、それでも合格点には程遠い数字です。ツールはAIにより多くの情報を与えましたが、AIは依然として、どの情報が重要であり、それをどのように組み合わせるべきかを判断することに苦戦していました。時には、ツールがAIを混乱させ、間違った道を選ばせたり、考えすぎてループに陥らせたりすることさえありました。
真の問題:なぜ失敗するのか?
論文は、なぜAIが失敗しているのかという理由を深く掘り下げています。結局のところ、問題はAIが十分な知識を持っていないことではありません。問題は、AIが**「証拠に固執すること」**が苦手であるという点にあります。
- 「盲目的な推測」の癖: 研究者が写真を取り除き、テキストのみをAIに与えたとき、AIは「写真がないとこれは解けません!」と言う代わりに、以前に読んだ内容に基づいてただ推測を行いました。AIは、目の前の手がかりを見るのではなく、自身の記憶を使って謎を解こうとしたのです。実際、AIが「情報が不足している」と認めたケースは、わずか 4.6% しかありませんでした。
- 画像を無視する: もし画像が、AIの予想とは一致しない奇妙なものを示していたとしても、AIはしばしばその画像を無視し、自身の「直感」(学習データから得た知識)に従ってしまいました。それは、まるで探偵が、容疑者の話と一致しないという理由で指紋を無視するようなものです。
- 過剰な自信: AIはしばしば、空白を埋めようとしました。もし実験が不完全であっても、AIはあたかも全てのデータが揃っているかのように結論を捏造しました。本物の科学者は、時には主張を行うための証拠が足りないこともあると知っていますが、AIは答えを出そうと急ぎすぎるのです。
欠けているステップ
論文は、AIを実用的にするために、私たちは決定的なステップを見落としていると結論づけています。私たちはこれまで、AIを**「図書館」(事実を蓄積する場所)や「計算機」(数学を行う道具)にしようとしてきました。しかし、本当の科学には、雑多な証拠を見つめ、答えがわからないときはそれを認め、目に見えるものによって厳密に裏付けられた結論のみを導き出すことができる「探偵」**としてのAIが必要です。
著者らは、AIが真に科学的発見に貢献するためには、証拠を管理する方法を学ぶ必要があると示唆しています。AIは、いつ推測をやめるべきか、そしていつ追加のデータを求めるべきかを学ぶ必要があります。AIがそれを実行できるようになるまでは、レポート作成には優れた助手かもしれませんが、ラボ自体を運営する準備はまだできていないのです。「事実を知っていること」と「証拠から推論すること」の間の溝こそが、真の科学的発見へと向かう道のりで欠けているステップなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。