← 最新の論文
🔢 mathematics

PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems?

本論文は、11,586問のオリンピックレベルの物理問題とステップバイステップの解法を含む大規模なバイリンガル・マルチモーダル・ベンチマークであるPhysEliteを紹介しており、これによって、最も高度なマルチモーダル大規模言語モデルでさえ、これら複雑な推論タスクにおいて現在はわずか33.7%の精度しか達成できていないことを明らかにしている。

原著者: Ruoran Xu, Wending Gao, Liyunfeng Chen, Aixin Shi, Haoyu Cheng, Zixiang Fang, Yiqiang Zou, Qiufeng Wang

公開日 2026-08-27
📖 1 分で読めます🧠 じっくり読む

原著者: Ruoran Xu, Wending Gao, Liyunfeng Chen, Aixin Shi, Haoyu Cheng, Zixiang Fang, Yiqiang Zou, Qiufeng Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

物理学は常に人間の知性の厳格な試練となってきました。それは、単に事実を暗記するだけでは不十分であり、世界の仕組みを理解するためには、図やダイアグラムとして描かれた複雑な状況を捉え、そこに作用する目に見えない力を頭の中で解きほぐす能力が求められる学問です。問題を解くためには、適切な自然法則を特定し、それらをステップ・バイ・ステップで適用し、唯一の正確な答えへと導く論理的な思考の連鎖を編み上げなければなりません。数十年にわたり、このような深く多段階的な思考は、人間特有の強みであり、機械が容易に越えることのできない領域であると考えられてきました。今日、人工知能は驚異的な進歩を遂げ、テキストを読み取り、画像を驚くべき精度で認識できるコンピュータを実現しています。しかし、決定的な問いが残っています。果たしてこれらの機械は、世界最高峰の高校生たちを悩ませるような、困難で現実的な物理の問題を真に推理することができるのでしょうか。

研究チームは現在、その答えを見出すための新しい大規模な試験場を構築しました。彼らは、中国のトップレベルの学生が日常的に使用するトレーニング教材から、1万1千問を超える物理の問題を集めました。これらは、単なる選択肢形式の単純な問題ではありません。解く者にゼロからの導出を要求する、オープンエンドな挑戦状なのです。極めて重要なのは、研究者たちが単に問題を収集しただけでなく、専門家が問題を解く際に用いる詳細なステップ・バイ・ステップの解法や、物理的なセットアップを説明する図解もあわせて収集したという点です。英語と中国語の両方を含むこの新しいデータセットは、惑星の運動から電気の流れ、光の振る舞い、そして原子の世界の謎に至るまで、あらゆる範囲をカバーしています。すべての問題に、その視覚的な図解と完全な論理的導出を組み合わせることで、チームは専門家レベルの物理的推論の真の複雑さを反映したベンチマークを作り上げました。

研究者が最も高度な18の人工知能モデルをテストしたところ、その結果は厳しいものでした。膨大なデータで学習され、複雑な推論タスクを実行できる最強のモデルでさえ、非常に苦戦したのです。最も優れた性能を示したモデルでさえ、最終的な答えを正しく導き出せたのは、ケース全体の約3分の1に過ぎませんでした。これは、困難な物理の問題が3問提示されるたびに、現在利用可能な最も強力な人工知能が2問間違えることを意味します。これらの機械と人間の専門家の間には大きな隔たりがあります。この研究の基準となった学生たちは、問題のほぼ半分を正解しており、人工システムに対して顕著なリードを見せました。研究者たちは、この困難さが特定の種類の問題に限られたものではないことを見出しました。モデルは力学、熱力学、光学のいずれにおいても躓いており、特に光や幾何学的な推論を伴う問題において苦戦する傾向がありました。

研究は単に正解数を数えるだけにとどまりませんでした。研究者たちは、機械の実際の思考プロセスを精査し、解法をステップごとに分解することで、具体的にどこで間違いが生じているのかを調査しました。その結果、エラーは決して単純な計算ミスではないことが判明しました。むしろ、モデルは推論の連鎖の極めて初期の段階で失敗していることが多かったのです。図解を誤解したり、物理的なセットアップを理解できなかったり、あるいは状況に対して誤った物理法則を適用したりしていました。一度初期設定に欠陥が生じると、その後の解法がいかに数学的に洗練されていようとも、結論は誤ったものになります。多くの場合、モデルはもっともらしい導出を生成し、正しい一般的な経路を辿っているように見えながらも、たった一つの根本的な誤解によって崩壊していました。このことは、これらのシステムがパターンマッチングやテキスト生成には優れているものの、人間のように問題を可視化し、どの原理を適用すべきかを知るための、深い直感的な物理的実在把握能力を依然として欠いていることを示唆しています。

研究者たちは、モデルに追加の助けを与えることでパフォーマンスが向上するかどうかもテストしました。一部のモデルに対し、解法の中間ステップを示す追加の図解を提供し、この視覚的なガイダンスが溝を埋めることを期待しました。これはわずかながら効果はありましたが、改善は限定的であり、場合によっては追加のテキストによるヒントを与えることで、モデルの性能が悪化することもありました。このことは、核心的な問題が情報の不足ではなく、その情報を正しく処理することにおける根本的な困難にあることを示しています。モデルは単にデータが足りないのではありません。視覚的な手がかりとテキストの手がかりを、一貫した物理モデルへと統合することに苦慮しているのです。研究は、人工知能が急速な進歩を遂げているにもかかわらず、これらのシステムが、真正かつ高レベルな物理問題を解くために必要な、厳格で多段階的な推論を習得するにはまだ程遠い状態であることを結論付けています。今後の道筋には、機械に単に答えさせるだけでなく、記述を求められている物理的世界を真に理解させるための、新しい手法が必要となるでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →