Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning
論文「Physics-R1」は、既存のマルチモーダル物理評価パイプラインにおけるデータ汚染、翻訳ドリフト、および多肢選択問題の飽和という決定的な欠陥を特定し、厳格に監査されたコーパスと、新規かつオープンエンドなオリンピックベンチマークで顕著な性能向上を達成する新しい推論モデルを公開することで、それらに対処する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能(AI)の世界を、巨大でハイ・ステークスの料理コンテストだと想像してみてください。その目的は、どの AI「シェフ」が複雑な物理学の問題(ロケットの飛行原理や電気の動きの解明など)を解決できるかを競うことです。審査員は、彼らを評価するために一連のテスト問題を与えます。
あなたが読んでいるこの論文「Physics-R1」は、本質的に内部告発報告書であり、新しいレシピブックです。著者の楊山(Shan Yang)氏は、現在の料理コンテストが不正に操作されていると主張しています。なぜなら、テスト問題が汚染されており、審査員にバイアスがあるからです。以下に、これを平易な言葉で解説します。
1. 問題:テスト問題が「漏洩」している
数学のテストを受ける学生を想像してください。もし彼が、先生が最終試験でも使用する練習問題集の答えを偶然丸暗記してしまった場合、満点を取れるでしょう。しかし、それは彼が実際に数学を理解していることを意味しません。
この論文は、多くの AI モデルがまさにこれを行っていることを発見しました。
「漏洩」: 著者らは、これらの AI を教育するために使用される公開の「トレーニングプール」(練習問題集)を監査しました。その結果、AI が評価されているテスト問題の多くが、彼らが学習した練習問題集の中に隠されていることが分かりました。
「言い換え」のトリック: 単なる完全なコピーだけではありません。AI が「10 メートルからボールが落下する」という問題を見て、テストで「10 メートルの高さから球体が落下する場合」と問われることもあります。従来の不正検知プログラム(同一の単語を探すもの)は、これらを見逃していました。
新しい監査: 著者らは、3 段階のセキュリティガードを構築しました。
- 単語カウンター: 完全な単語の一致をチェックします。
- 意味スキャナー: 単語が異なっていても、文の意味が同じかどうかをチェックします。
- 人間のような審査員: 練習問題とテスト問題の両方を読み、「はい、これらは偽装された同じ問題だ」と判断する超スマートな AI です。
これを用いることで、分野で見逃されていた数千の「不正」ペアを発見しました。彼らはデータを精製し、AI が単に暗記するのではなく、実際に学習しなければならないクリーンなトレーニングセット(PHYSCORP-A と呼ばれる)を作成しました。
2. 翻訳の罠:言語が重要である
運転免許試験を受けていると想像してください。指示が母国語であれば簡単に合格しますが、同じ試験が外国語に翻訳されると、文法が混乱していたり、道路標識の説明が異なっていたりするため、不合格になります。
著者らは、エストニア語(元の言語)と英語(翻訳版)の物理学問題でこれをテストしました。
- 結果: トップクラスの AI(Sonnet 4.5)は、元のエストニア語の問題で**30.5%正解しましたが、英語の翻訳版では13.6%**しか正解しませんでした。
- 教訓: 複雑な科学問題の翻訳は、微妙な詳細を失うことが多いです。AI を英語だけでテストすると、実際よりも物理学が苦手だと誤解したり、物理学の能力ではなく翻訳能力をテストしていることになったりする可能性があります。
3. 形式の罠:多肢選択式 vs 真の思考
多肢選択式クイズ(A、B、C、D)の推測が得意な学生が、白い紙に解答を書き出すように求められた途端に固まってしまうと想像してください。
この論文は、テストの形式に基づいて AI のパフォーマンスに大きな隔たりがあることを発見しました。
- 多肢選択式(イージーモード): AI は多肢選択式テストで**79.7%**のスコアを記録しました。
- 自由記述式(ハードモード): 同じ AI は、ゼロから解答を書き出す必要があるテストでは、わずか**33.4%**しかスコアを記録しませんでした。
- 隔たり: これは46 ポイントの差です。この論文は、分野が AI の知能を過大評価してきたと主張しています。それは、推測やパターン認識ができる「イージーモード」(多肢選択式)で主にテストされており、「ハードモード」(ゼロからの解決)でテストされていないからです。
4. 解決策:新しいレシピ(Physics-R1)
これらの問題を解決するために、著者らは単に指を差すだけでなく、新しいキッチンを作りました。
- クリーンな材料: 「漏洩」した問題が含まれていないことが保証された、新しい監査済みのデータセット(PHYSCORP-A)を公開しました。
- 新しいテスト: PHYSOLYM-Aと呼ばれる、より困難な新しい試験を作成しました。これは、AI がこれまで見たことのないオリジナルの問題(主にエストニアと国際オリンピックからのもの)を使用しています。
- 調理法(Physics-R1): 彼らは、特定の「レシピ」(GSPO+DAPOと呼ばれる手法)を使用して新しい AI モデルを訓練しました。
- 小さなステップごとに複雑で詳細なスコアを与える代わりに(これにより AI は見栄えは良いが誤った答えを書くよう誘導される可能性があります)、二値報酬を使用しました。
- 比喩: ゲームの審判を想像してください。「良い姿勢」や「綺麗な字」にポイントを与えるのではなく、審判は単にこう言うだけです。「正解は得られましたか?はい=1 ポイント。いいえ=0 ポイント。」
- この単純なルールにより、AI は見栄えの良いフォーマットでシステムを欺こうとするのをやめ、実際に物理学の問題を正しく解くことに集中せざるを得なくなりました。
結果
彼らは、新しい AI(Physics-R1)を、新しいクリーンで困難な試験でテストしました。
- ベースモデルと比較して大幅に改善されました(8% のスコアから 26% のスコアへ)。
- 他のオープンソースモデルを凌駕しました。
- 依然として最高峰のクローズドソース「スーパー AI」(Sonnet 4.5)には及びませんが、クリーンなデータと適切な訓練手法があれば、オープンソースモデルが真の物理学推論を学習できることを証明しました。
まとめ
この論文は、AI コミュニティへの行動喚起です。
- 不正を止める: トレーニングデータを精製し、モデルが単にテストの答えを暗記しないようにする。
- 言語に注意する: 翻訳が完璧であると仮定せず、元の言語でテストする。
- 推測を止める: 多肢選択式だけでなく、自由記述式の問題でモデルをテストする。
- シンプルに保つ: AI に思考を教えるためには、複雑な採点システムよりも単純な「正解/不正解」の報酬の方が良い場合がある。
著者らは、誰でも使用して検証できるように、すべての「材料」(データ)、「レシピ」(コード)、および「試験問題」(ベンチマーク)を公開しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。