Testing the capability and performance of Claude Sonnet 4 on the GRE physics test
本論文は、Claude Sonnet 4が70問のGRE物理学練習試験において、著者らの仮説である正解率90%を大幅に上回る、満点のスケールドスコア990を達成したことを示しており、複雑な科学的問題解決における同モデルの強力な能力を浮き彫りにしている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約:GRE物理学試験におけるClaude Sonnet 4のベンチマーク測定
問題提起
人工知能(AI)がK–12および高等教育にますます統合されるにつれ、複雑な科学的問題の解決能力と批判的思考のデモンストレーションにおける大規模言語モデル(LLM)の能力をベンチマーク測定する必要性が高まっている。先行研究では、汎用AIは上級レベルの大学物理学の問題(光学や熱力学などの分野でわずか35〜39%の正解率)において苦戦することが示されているが、高度な処理能力を備えた新しい特化型モデルは、その潜在能力の向上を示唆している。本研究では、複雑な問題解決タスクにおいて90%の正解率を超えられるかどうかを判断するため、標準化された大学院レベルの物理学評価を用いて、Anthropicが開発したLLMであるClaude Sonnet 4の性能を評価することを目的とした。
方法論
研究者は、Educational Testing Service(ETS)が提供する、公開されている70問のGRE物理学練習問題(フォームGR1775)を利用した。研究では以下のプロトコルを採用した:
- モデル: 当時、Anthropicの最も高度な無料モデルとして特定されていたClaude Sonnet 4。
- 入力: 70問の各質問は、追加のテキストやコンテキストを提供することなく、スクリーンショットとして個別にモデルに送信された。
- 採点プロトコル: 回答は、公式のETS解答キーと比較された。メッセージ制限のため、すべての質問を処理するために複数のチャットセッションを開始した。1回目の試行で誤答したが2回目の試行で正解した場合は部分点を与え、それ以外の場合は完全な誤答とした。
- 分析: 正解数の総計を算出し、公式のGRE換算表を用いてスケールスコアに変換した。また、特定のコンテンツ領域(古典力学、電磁気学、量子力学、原子物理学など)におけるパフォーマンスを分析し、特定の質問に対する人間の受験者の平均正解率と比較した。
主な結果
本研究では、以下の定量的および定性的な知見が得られた:
- 全体的なパフォーマンス: Claude Sonnet 4は70問中65問に正解し、約93%の正解率を達成した。これは、GRE物理学テストの最大可能スコアであるスケールスコア990に相当する。
- コンテンツ領域別の内訳:
- 量子力学および原子物理学: モデルは100%の正解率(16/16問)を達成した。
- 電磁気学: モデルは13問中12.5問正解した。
- 古典力学: これがモデルの最も弱い領域であり、14問中12.5問正解(正解率89%)であった。
- 人間との相関性: モデルのパフォーマンスと人間の受験者の平均正解率との間に相関は見られなかった。人間の正解率が20〜30%であった17問において、モデルは単一の問題でわずか0.5ポイントしか失わなかった。
- エラー分析: エラーが発生した場合、それは概念的な理解の欠如ではなく、比率の計算ミスや問題文内の特定の詳細の分析ミスといった、不適切な合成(synthesis)に起因するものとされた。モデルは選択した回答に対して一貫して詳細な説明を提供しており、それが特定の推論エラーの特定を容易にした。
意義および主張
本論文は、これらの結果が、消費者向けのLLMが高度な科学領域の質問を高い習熟度で解決し、説明できるという仮説を支持していると主張している。著者らは以下のように結論付けている:
- 高度な能力: LLMは大学院レベルの物理学試験で満点を取ることが可能であり、これは科学的研究および教育における変革的な可能性を示唆している。
- 教育的有用性: これらのモデルは、哲学的概念や未解決の宇宙論的質問に関する推論における限界を認識していることを前提として、人間によるエラーなしに複雑な問題を解くための強力なツールとして機能する。
- 将来の軌道: 継続的な機械学習とユーザー・トレーニングを通じて、著者らはモデルが最終的に100%の正解率に達する可能性があることを示唆している。また、パフォーマンスはモデルのバージョン(例:Opus対Sonnet)によって異なる可能性があり、有料サブスクリプションが使用割り当て量やモデルの品質においてさらなる利点を提供する可能性があることにも言及している。
本研究は、AIが顕著な有望性を示している一方で、詳細な合成(synthesis)においては制限があり、ChatGPTのような他の競合モデルに見られるような完全な生成能力(画像や動画の生成など)をまだ備えていないことを強調している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。