← 最新の論文
💻 computer science

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

本論文は、異種混合かつマルチモーダルなワークスペースから検証可能な表形式の結果を生成するデータエージェントの能力を評価するために設計された、包括的なベンチマークおよびKDD Cup 2026評価フレームワークであるDataSpaceを紹介するものであり、マルチモーダルな証拠統合における顕著な性能差と、エージェントのハーネスの選択が信頼性に与える多大な影響を明らかにしている。

原著者: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

公開日 2026-08-05
📖 1 分で読めます☕ さくっと読める

原著者: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、手がかりが至る所に散らばっている謎を解こうとしている探偵だと想像してください。ある手がかりはコンピュータ上の整然としたスプレッドシートにあり、別のものは50ページのPDFレポートの中に埋もれており、またあるものはデータベースの中に隠されており、そして最も重要な手がかりは、防犯カメラのビデオであるかもしれません。これが「データエージェント」——組織内の乱雑なデジタルファイルの中から答えを探し出すように設計されたスマートなコンピュータプログラム——の日常です。長い間、科学者たちは、電話帳から名前を見つけたり、データベースに単純な質問をしたりといった、クリーンで単一の形式のパズルを用いてこれらのエージェントをテストしてきました。しかし、現実の世界では、データは言語、フォーマット、メディアが混ざり合った混沌としたものです。研究者たちが問いかけている大きな疑問は、「これらのデジタル探偵は、バラバラになった証拠品から完全な物語を組み立てることができるのか、それとも手がかりの見た目が揃っていないと迷子になってしまうのか?」ということです。

この論文は、これらのデータエージェントがどれほど優れた実力を持っているかを正確に測るための、極めて困難な新しいテスト、DataSpaceを紹介しています。研究者たちは、410種類もの異なるタスクと、合計15.01 GBのデータに及ぶ7,439個のデジタルアーティファクト(ファイル)を含む、巨大な遊び場を構築しました。彼らは単にランダムなファイルを投げ込んだわけではありません。一つの質問を解くために、ビデオを視聴し、PDFをスキャンし、データベースにクエリを投げ、さらにJSONファイルを照合しなければならないような「ヘテロジニアス(異種混合型)なワークスペース」を作り上げたのです。しかも、それらの中にある手がかりは英語と中国語の両方で書かれています。目的は、単一の事実を見つけることだけではありません。エージェントは、最終的な成績表のような、完全で検証可能な表を作成しなければなりません。

このテストの結果は、一種の警鐘を鳴らすものです。テストされた中で最も賢く高度なAIモデル(Grok 4.5やGPT-5.6のような巨人を含む)でさえ、タスクの約66.34%しか正しく解くことができませんでした。つまり、彼らは3つのパズルのうちおよそ1つを間違えたことになります。研究者たちは、エージェントが異なる種類のメディア(例えば、ビデオの手がかりとスプレッドシートを結合するなど)から情報を組み合わせる必要がある場合や、複雑な「ジョイン(結合)」(二つの異なるソースからデータを接続すること)を行う必要がある場合に、最も苦戦することを発見しました。興味深いことに、AIにツールの使い方を指示するソフトウェアフレームワークである「ハーネス」の選択は、AIの脳そのものと同じくらい重要であり、スコアに15.36ポイントもの差を生じさせました。

結局のところ、この論文は、データエージェントは向上しているものの、決して完璧ではないことを示しています。彼らは正しい数値を出していても、最終的な表の形式作成に失敗したり、ビデオの中に隠された決定的な手がかりを見逃したりすることがよくあります。著者らは、これらのエージェントが複雑でマルチフォーマットなデータ分析を自律的に扱う上で完全に信頼されるようになるには、まだ長い道のりがあると考えており、将来のエンジニアがこれらの具体的な弱点を修正するための地図として、このベンチマークを提供したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →