← 最新の論文
🤖 AI

Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA

本論文は、多様なメディアソースにわたって情報を体系的に追跡、検証、および情報の欠落を解消するために、構造化された明示的なエビデンス状態を維持することでオムニモーダルQAの精度を向上させる、トレーニング不要のエージェントシステムであるOmni-Decisionを紹介しており、既存のベースラインに対して大幅な性能向上を実現している。

原著者: Ming Ma, Yi Zhu, Yiran Zhong, Feida Zhu, Weigao Sun, Junhan Shi, Lingrui Mei, Tianming Yang, Steven Hoi

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Ming Ma, Yi Zhu, Yiran Zhong, Feida Zhu, Weigao Sun, Junhan Shi, Lingrui Mei, Tianming Yang, Steven Hoi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、手がかりが至る所に散らばっている謎を解こうとしている探偵だと想像してください。ビデオクリップの中の極めて小さな詳細、オーディオトラックの中のささやき、ウェブサイトに隠された事実、そして電卓で計算しなければならない数字。現在のほとんどのAI探偵は、汚れたナプキンに必死にメモを書き殴っている人のようです。彼らは手がかりを一つ見つけたら書き留め、次を見つけたらまた書き留め、最後まで辿り着いた時にどのメモがどの謎の一部だったのかを覚えていることを祈ります。多くの場合、彼らは自分の書き殴ったメモの中で迷子になったり、すでに何を見つけたかを忘れたり、あるいはパズルのピースがすべて揃う前に解こうとしたりしてしまいます。

この論文は、Omni-Decisionと呼ばれる新しい探偵システムを紹介しています。乱雑なナプキンの代わりに、このシステムは「エビデンス・ステート(証拠状態)」と呼ばれる、構造化された、生きているチェックリストを使用します。これは、探偵が無視できない魔法のホワイトボードのようなものだと考えてください。それは単にメモを保存するだけでなく、何が確認され、何が欠けており、何が矛盾しており、次に何を計算する必要があるのかを能動的に追跡します。

その魔法の仕組みは以下の通りです:

  1. チェックリスト: 質問が投げかけられると、システムは即座にそれを特定の「ニーズ」へとホワイトボード上に分解します。例えば、「ビデオの中で時計のブランドを探す」や「Instagramがローンチされた日付を探す」といった具合です。
  2. ループ: 探偵は、リストの項目を一つ埋めるためにツール(ウェブ検索やビデオスキャナーなど)を選びます。
  3. 審判: 探偵が次に進む前に、厳格な「クリティック(批評家)」が新しい情報をチェックします。それは問題を解決しましたか? それは以前に見つけた情報と矛盾していますか?
  4. 更新: 特別な「リデューサー(還元器)」がホワイトボードを更新します。手がかりが見つかれば、「不足」のボックスは緑色に変わります。もし二つの手がかりが衝突すれば、赤い「コンフリクト(衝突)」フラグが立てられます。ホワイトボードが現在のステップが完了したと示すまで、探偵は決して前に進めません。
  5. 停止: システムは、いつ止まるべきかを正確に理解しています。疲れたからといって答えを推測することはありません。ホワイトボード上で、必要なすべての証拠が確定し、何の矛盾も残っていないことが示された時にのみ、回答します。もしツールを使い果たしてもホワイトボードが未完成のままであれば、偽の答えを捏造するのではなく、敗北を認めます。

この論文が否定していること:
著者たちは、単にAIモデルを大きくしたり、より長い「記憶」(長いナプキンのようなもの)を与えたりすることが解決策ではないと明確に主張しています。彼らは、過去の行動の膨大な履歴を持っていても、何が実際に根拠に基づいているのか、そして何がまだ欠けているのかを追跡できなければ、それは役に立たないことを示しています。また、この方法を実現するためにシステムを新しいデータで「訓練」する必要はないという考えも否定しています。これは既存のツールの使い方を整理することで機能するのであり、新しい技術を学習することによるものではありません。

結果:
このシステムは、二つの困難なテストで測定されました。ビデオ、オーディオ、およびウェブを横断するオープンワールド検索を含むOmniGAIAというテストにおいて、Omni-Decisionは45.6%の精度を記録しました。これは、標準的な「ベース」エージェントがわずか18.33%しか記録できなかったのと比較すると、大幅な飛躍です。これは27.3パーセントポイントの向上です。

外部のウェブ検索を行わずに音声とビデオを統合することに焦点を当てた二つ目のテスト、WorldSenseでは、システムは58.3%を記録し、ベースラインを30.2パーセントポイント上回りました。

著者たちは、このアプローチが探偵が立ち往生していることを察知することに特に優れていると示唆しています。失敗した試みの分析において、彼らは多くの「誤った」回答が、実際には探偵が着実に進展していたものであることを見出しました。ただ、特定の証拠(看板の小さな文字を読むことなど)がツールで見つけるには難しすぎたために、ブロックされてしまったのです。このシステムの強みは、決して失敗しないことではなく、単に盲目的に推測するのではなく、どこで、なぜ失敗したのかを明確に示すことができる点にあります。

要するに、Omni-Decisionは、複雑で多段階の謎に対して、何を知っていて何が欠けているのかという明確に共有された地図を持つことは、より長い記憶やより大きな脳を持つことよりも遥かに強力であることを証明しています。それは、手がかりを探す混沌としたプロセスを、規律あるステップ・バイ・ステップのミッションへと変えるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →