PHYSICS: Benchmarking Foundation Models on University-Level Physics Problem Solving
本論文は、1,297 件の専門家による注釈が施された大学レベルの物理学問題からなる包括的なベンチマーク「PHYSICS」を導入し、これにより o3-mini のような最先端の基盤モデルでさえ、さまざまな最適化戦略を講じたにもかかわらず、高度な科学的推論においては 59.9% の精度しか達成できず、苦戦していることが明らかになったことを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。信じられないほど賢く、超高速なロボットの大軍を構築したと。これらのロボットは図書館のほぼすべての本を読み込み、人間の電卓よりもはるかに速く複雑な数学パズルを解くことができます。ここで知りたいのは、これらのロボットは本当に物理学者のように考えることができるのか、ということです。
まさにこれが、PHYSICSベンチマークの背後にいる研究者たちが明らかにしようとしたことです。彼らはロボットに単純ななぞなぞを解かせるだけでなく、物理学の「博士課程レベルの最終試験」を与えました。
以下に、彼らの実験の物語を簡潔に分解して示します。
1. 試験:「究極の物理学テスト」
研究者たちはPHYSICSという新しいテストを作成しました。これは1,297 問の難問を含む巨大なデジタル問題集だと考えてください。
- 問題はどこから来たのか? これらは研究者によって作られたものではありません。実際の物理学の博士課程の学生が専門家の科学者になるために合格しなければならない、過酷な資格試験から採取されたものです。
- 試験には何が含まれているのか? 物理学の主要な 6 つの分野を網羅しています。物体の運動(力学)、原子の振る舞い(量子力学)、熱とエネルギー(熱力学)、電気と磁気、光(光学)、そして原子物理学です。
- ひねり: 学校でのテストのように「A、B、C、D」から選ぶだけでなく、これらの問題は自由記述式です。ロボットは人間の子供のように、解答過程を示しながら全体の解答を書き出す必要があります。
2. 採点機:「ロボット教師」
人間の目がすべてのページを読むことなく、ロボットが書いた数学の宿題をどう採点するのでしょうか?チームは超厳格な自動採点システムを構築しました。
- これはSymPyというデジタルツール(数学チェックロボットと考えてください)を使用して、ロボットが少し異なる方法で解答を書いたとしても、その答えが数学的に正しいかどうかを検証します。
- もし数学がロボットにはチェックしにくいほど奇妙な場合は、「バックアップ教師」(より高度な AI)を呼び出して論理を読み、それが理にかなっているかどうかを判断させます。
3. 結果:「ロボットは壁にぶつかった」
研究者たちは、o3-mini、GPT-4o、DeepSeek-R1といった「チャンピオン」を含む、現在利用可能な最も賢い AI モデル 33 種類をテストしました。
スコアボード:
- 最高性能のロボット: 最も賢いモデルであるo3-miniでさえ、問題の約**60%**しか正解できませんでした。
- 平均的なロボット: 他のほとんどのトップモデルは**30% から 40%**程度のスコアでした。
- 人間の基準: 研究者たちは、十分な時間があれば人間の専門家は通常**70% から 80%**のスコアを取ると指摘しました。
大きな教訓: 最も高度な AI でさえ、まだ人間の物理学の専門家のレベルに達することに苦労しています。彼らは教科書を暗記した学生のようなもので、複雑な現実世界のシナリオに規則を適用するよう求められたときに立ち往生してしまいます。
4. なぜ失敗したのか?(「エラーのホール」)
研究者たちは、ロボットがなぜ答えを間違えたのかを詳しく調べました。彼らは 5 つの主な「悪い習慣」を見つけました。
- ルールを捏造する: 時々、ロボットは問題に含まれていない事実を捏造します。これは、教師の心を読もうとして存在しない追加のルールを加える学生のようです。
- 図を無視する: 多くの物理学の問題には図が付いています。ロボットは図を読み違えることが多く、配線が実際には別の方法で接続されているのに、ある方法で接続されていると誤解します。
- 「考えすぎ」の罠: 一部のロボットは、考えすぎて書きすぎた結果、スペースを使い果たしたり、自分自身の長い説明に混乱したりしました。彼らは自分自身の推論の中で迷子になりました。
- 数学のミス: 論理が完璧であっても、複雑な方程式で単純な計算ミスを犯します。これは人間が長い数学の問題でタイプミスをするのと同じです。
- 要点を見失う: 時には、質問が実際に何を求めているのかを誤解し、全く異なる質問に答えてしまいます。
5. 助けを試みたか?(「カンニングペーパー」実験)
研究者たちはロボットがより良くできるようにいくつかの工夫を試みました。
- 自己反省: ロボットに「提出する前に自分の作業をチェックして」と伝えました。これは少し助けになり、答えをわずかに一貫性のあるものにしました。
- 「Google」トリック(RAG): ロボットが作業中にオンラインで情報を検索できるようにしました。これもスコア向上に役立ち、ロボットは時として特定の公式や事実の簡単なリマインダーを必要としていることを証明しました。
しかし、これらの助けがあったとしても、ロボットはまだ人間の専門家とのギャップを完全に埋めることはできませんでした。
結論
PHYSICSベンチマークは、AI が数学や読解において驚異的である一方で、深遠で複雑な科学的問題を解決することは依然として巨大な課題であることを示しています。ロボットは、なぜその数学を行っているのかを時として忘れる、非常に高速な電卓のようなものです。これらを真の物理学者のレベルに引き上げるには、より深く推論し、図をより良く読み、事実を捏造するのをやめるよう教える必要があります。
これは物理学だけの話ではありません。AI が科学者を真に支援するためには、機械のように「計算」するだけでなく、人間の専門家のように「考える」能力を大幅に向上させる必要があるという、目覚まし時計のような警告なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。