← 最新の論文
🤖 machine learning

Multi-Agent Debate and Visual Information Extraction for SeePhys Pro: A 1st-Place Technical Report from ICML 2026 AI4Math Track 3 Challenge

このテクニカルレポートは、モダリティ間のギャップを埋めるための視覚情報の抽出と、信頼性の高い回答選択に焦点を当てたマルチエージェント・ディベート・システムを組み合わせた2段階のフレームワークを採用することで、精度を0.643から0.802へと大幅に向上させた、ICML 2026 AI4Math SeePhys Pro チャレンジにおける第1位のソリューションの詳細を記述するものである。

原著者: Jiseok Kwak, Suhyeon Jo, Taewoo Kim, Yeongmin Kim, Byeonghu Na, Il-chul Moon

公開日 2026-07-27
📖 1 分で読めます☕ さくっと読める

原著者: Jiseok Kwak, Suhyeon Jo, Taewoo Kim, Yeongmin Kim, Byeonghu Na, Il-chul Moon

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

難解な謎解きに挑んでいるところを想像してみてください。ヒントは、書かれたメモと不思議な図画の二つに分かれています。メモがすべてを教えてくれることもあれば、図画に秘密が隠されていて、メモはただの邪魔者であることもあります。これは「マルチモーダル」AI——テキストを読み、かつ画像を見ることができるコンピュータ——の日常です。長い間、これらのコンピュータは文章を読むことは得意でしたが、図の中に隠された数学的な要素を「見る」ことには極めて不得意でした。物理学の問題が複雑なグラフを伴っていたとしても、彼らはそれを見つめたまま混乱し、テキストには書かれていない重要な数値や形状を見落としてしまうことがありました。

これを解決するために、科学者たちは主に2つのテクニックを試してきました。1つ目は「オーケストレーション(編成)」です。これは、一人の専門家を雇うのではなく、専門家チームを雇うようなものです。3つの異なる賢いコンピュータに問題を解かせ、答えについて議論させ、最後に勝者を選びます。2つ目のテクニックは「翻訳」です。コンピュータは画像を見るよりも言葉を読む方が得意な場合が多いため、画像をコンピュータが容易に読めるような、非常に明快な記述へと変換します。この論文は、シンプルな問いを投げかけています。「もし、議論するコンピュータのチームと、超高精度な翻訳機を組み合わせたら、ついに視覚的な物理問題のコードを解読できるのだろうか? そしてもっと重要なのは、チームのどの部分が実際に大きな役割を果たしているのか?」ということです。

二段階の探偵部隊

KAISTとsummary.aiのチームによる著者たちは、「SeePhys Pro」と呼ばれるハイステークスなコンテストに参加しました。目標は、大学レベルの物理学の問題を解くことです。そこでは問題文と図形が、テキストのみであったり、画像のみであったり、あるいは両方が混ざり合った複雑な状態であったりします。勝利するために、彼らは「探偵部隊」と呼べる二段階のパイプラインを構築しました。これには「翻訳者」と「討論クラブ」という2つの明確な役割があります。

第1段階:翻訳者(ギャップを埋める)
最初の仕事は、コンピュータが実際に問題を「見る」ことができるようにすることです。昔は、物理問題が画像だけで構成されている場合、コンピュータはただそれを見つめて推測するだけでした。このチームは、コンピュータには彼らが愛する言語、つまり「テキスト」へと画像を翻訳する必要があることに気づきました。しかし、単なるテキストではありません! 彼らは単に「ここにボールがあります」といった単純な文章を書いたのではありません。それでは曖лоague(曖昧)すぎます。

代わりに、彼らは画像を以下の3つの要素へと変換する高度な翻訳機を構築しました:

  1. クリーンな物語: 何が起きているかを説明する散文的な記述。
  2. 構造化されたマップ (SVG): 正確な幾何学、角度、接続関係を保持するデジタル描画コード。これにより、コンピュータが形を間違えることがなくなります。
  3. シャープナー(研磨器): 最も難しい問題(テキストと画像が1つの画像内に押し込まれている場合)のために、彼らは画像を完璧に切り取る「クロッパー」を使用し、図形を鮮明にし、OCR(光学文字認識)を使用して図の中に書かれた小さな数字を読み取りました。

この段階を、単に言葉を訳すだけでなく、旅行者が迷わないように地図を描き直す人間の翻訳者に例えてみてください。論文によれば、この「翻訳」こそが最も困難な問題に対する魔法の弾丸となりました。問題が完全に画像の中に「閉じ込められて」いた場合(レベル4)、生の画像をそのまま読み取るとコンピュータの正答率はわずか54%でした。しかし、その画像を明確なテキスト記述と構造化されたマップに翻訳した結果、精度は77.5%へと跳ね上がりました。問題が画像の中に「ロック」されていればいるほど、この翻訳の価値は高まりました。

第2段階:討論クラブ(オーケストレーション)
問題が明確なテキストへと翻訳されると、次は「討論クラブ」へと送られます。ここでは、3つの異なる超高性能AIモデル(異なる会社のものであるため、それぞれ異なる種類のミスをします)が、独立して問題を解こうとします。

  • ソルバー1 (GPT-5.5)
  • ソルバー2 (Gemini-3.1-Pro)
  • ソルバー3 (Claude-Opus-4.8)

これまでの多くの試みでは、これらのモデルが互いに議論し合い、真実に到達するまで論理を修正し合うという考えがありました。著者たちはこれをテストしましたが、驚くべき展開が見つかりました。「討論」自体はヒーローではなかったのです。

真の勝利をもたらしたのは、3つの答えを聞き、単なる言葉ではなく「値(バリュー)」に基づいて最善のものを選択するスマートな「レフェリー(正規化器/Canonicalizer)」でした。例えば、2つのモデルが「4メートル」と言い、1つが「4.00m」と言った場合、レフェリーはそれらが同じであることを理解し、多数派を選びました。もし意見が食い違った場合、レフェリーはただ永遠に議論させるのではなく、その推論が信頼できるかどうかをチェックしました。もしモデルが自信満々に間違っていた場合、レフェリーはその誤った推論を「マスク(隠蔽)」し、他のモデルが混乱しないようにしました。

この論文は、決定打として「超高価な」タイブレーカー(同点決勝)が必要であるという考えを明確に否定しています。彼らは、3つのソルバーが意見を分けた際に誰が正しいかを判断するために、巨大でプレミアムなモデルを使用してみましたが、スコアは改善しませんでした。それは単にコストがかさむだけでした。シンプルな、価値を考慮したレフェリーが、同等か、あるいはそれ以上の仕事をこなしたのです。

大きな発見

チームの分析により、彼らのアプローチを変えた2つの主要な教訓が明らかになりました。

  1. 視覚的問題においては「翻訳」が王である: 「翻訳者」ステージの価値は、問題のどれだけの部分が画像の中に隠されているかに完全に依存していました。

    • 問題がテキストのみ(レベル1)であれば、翻訳者は何もしないため、精度はすでに高い状態でした。
    • 問題が混合状態(レベル2-3)であれば、翻訳者は少しの助けとなりました。
    • 問題が画像のみ(レベル4)であれば、翻訳こそが成功か失敗かの分かれ目となりました。論文は、「モダリティ・ギャップ(テキストと画像の差)」が大きくなればなるほど、翻訳の価値が膨大になることを示しました。
  2. 討論よりも「選択」が優れている: 推論の側面において、チームは改善がモデル同士の議論から来るのではないことを発見しました。それは信頼できる選択から来ていました。2つのモデルが一致した場合、彼らが正しい確率は83%でした。システムは、コンセンサス(合意)を信頼し、意見が分かれた少数のケースに対してのみ追加の時間を費やすことで、最も効果的に機能しました。「討論」のラウンドは新しい正解を生み出したのではなく、誤った答えをフィルタリングするのに役立ったのです。

結果:勝利のラップ

超高精度な翻訳機と、価値を考慮したスマートな選択システムを組み合わせることで、チームはコンテストを圧倒しました。

  • 単一のAIモデルを使用したベースラインは0.643(約64%の正解率)でした。
  • 彼らの二段階システムは、パブリック・テストにおいてこれを0.802(約80%の正解率)へと押し上げました。
  • 最終的な秘密の「プライベート」リーダーボードにおいて、彼らは0.743を記録し、1位を獲得しました。

興味深いことに、最も困難なレベル(レベル5:綺麗な図形ではなく、現実世界の物体の写真を含むもの)では、チームはあえて「討論クラブ」を取り除きました。彼らは、3つのモデルのチームが乱雑な写真によって混乱し、間違ったことについて議論してしまうことを発見したのです。再び、一つの集中したソルバーに切り替えることで、その特定のレベルにおけるスコアは0.933へと向上しました。

なぜこれが重要なのか

この論文は、AIの世界において「大きいことは必ずしも良いことではない」ということを教えてくれます。適切なプロセスがあれば、問題を解決するために数十億ドルの「超天才脳」は必要ありません。鍵となったのは、コンピュータが理解できる言語(テキストと構造化されたマップ)に画像を翻訳する必要があること、そして、長いノイズ混じりの議論よりも、最善の答えを選ぶためのスマートなレフェリーの方が重要であると気づいたことでした。

著者たちは、視覚的問題を解決する未来は、単にモデルを賢くすることではなく、世界をAIが実際に推論できる形式へと翻訳する、より優れた「パイプライン」を構築し、そしてシンプルで安価、かつ信頼できる方法を使って正しい答えを選ぶことにあると示唆しています。彼らは単にコンテストに勝ったのではありません。時には、答えを見るための最善の方法は、画像を見続けることではなく、地図を読み始めることなのだということを示したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →