← 最新の論文
🤖 AI

AgenticData: An Agentic Data Analytics System for Heterogeneous Data

AgenticDataは、フィードバック駆動型のプランニングと意味論的最適化を活用したマルチエージェント協調戦略を駆使することで、既存の手法を上回る優れた精度を実現し、自然言語によるクエリを通じて、異種混合の構造化および非構造化データの自律的な分析を可能にする革新的なエージェンティック・システムです。

原著者: Ji Sun, Guoliang Li, Peiyao Zhou, Yihui Ma, Jingzhe Xu, Yuan Li

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Ji Sun, Guoliang Li, Peiyao Zhou, Yihui Ma, Jingzhe Xu, Yuan Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大な謎を解こうとしているところだと想像してください。しかし、手がかりはいたるところに散らばっています。ある手がかりは、「名前」「日付」「金額」といった明確な列を持つ、整然とした台帳にきれいに書き込まれています。また別のものは、何千もの整理されていない日記や、スキャンされた文書、あるいは文章の中に情報が隠されているウェブページの中に、無秩序に埋もれています。長い間、コンピュータはこうした整然とした台帳を読み取ることは得意でしたが、乱雑な日記の意味を理解することは苦手でした。通常、コンピュータがこれら2つの間の点と点を結びつけるには、人間の専門家が複雑な指示(コード)を書く必要がありました。これは、司書に特定の事実を見つけてほしいと頼むのに、探し始める前に検索エンジンのコード自体を自分で書かなければならないようなものです。それは遅く、コストがかかり、もどかしい作業でした。コンピュータサイエンスのこの領域における大きな問いは、「整然とした台帳と乱雑な日記の両方を読み解き、私たちが自然な言葉で何を求めているかを理解し、自力で謎を解くことができる、超スマートな探偵のようなシステムを構築できるか?」というものです。

そこで登場するのが、その超スマートな探偵となるよう設計された新しいシステム、AgenticDataです。これは、活気あるニュースルームで働く専門家チームのようなものだと考えてください。一つの巨大な脳が一度にすべてをやろうとするのではなく、AgenticDataは「マルチエージェント」のアプローチを採用しています。図書館全体をスキャンして、どのような本やファイルが存在し、それらがどのように関連しているかを理解する**データ・プロファイラー(Data Profiler)がいます。ステップバイステップの戦略を練るプランナー(Planner)がいます。そして、誰かが作業を開始する前に、計画に間違いがないかを厳格な編集者のようにチェックするバリデーター(Validator)がいます。さらに、チームが同じ間違いを二度と繰り返さないよう、過去の成功と失敗をノートに記録しておくメモリ・マネージャー(Memory Manager)**も備えています。あなたが「10回以上優勝したバスケットボール選手の総年俸を教えて」といった自然言語で質問すると、このチームが協力して適切なデータを見つけ出し、計算方法を導き出し、コードを一行も書かせることなく答えを提示します。

研究者たちは、このチームによるアプローチが驚くほど効果的であることを発見しました。実験において、彼らはデータ分析の標準化されたテストである5つのベンチマークを用いてシステムをテストしました。その結果、AgenticDataは現在の最高の手法よりも大幅に高い精度を示しました。困難なタスクにおいては、他のトップシステムと比較して精度が約30%向上しました。例えば、実際の銀行データを含むデータセットでは、次点の競合システムよりも20%近く高い精度を記録しました。このシステムは単に推測したわけではありません。巧妙なフィードバックループを利用したのです。もし「バリデーター」が計画の中に間違いを見つけた場合、システムは単に諦めるのではなく、そのエラーをメモリに保存し、そこから学び、より優れた新しい計画を立て直しました。この「試し、失敗し、学び、再び試す」というプロセスによって、他のシステムが立ち往生してしまうような複雑なパズルを解くことができたのです。

最もエキサイティングな発見の一つは、AgenticDataが「乱雑な」データをどのように扱うかという点です。従来のシステムは、文書の中に明確な構造が見つからない場合に苦戦することがよくありました。しかし、AgenticDataは、エージェントを活用して非構造化テキストを有用な断片へと分解し、異なる文書間のつながりを見つけ出し、さらにはそれらを構造化されたテーブル(表)に紐付けることができます。Wikipediaの記事や現実世界の銀行記録を用いたテストにおいて、システムはこれらの混沌としたデータソースを巧みに操り、正確な回答を提供しました。また、研究者たちはシステムのコストと速度も測定しました。エージェントが「脳の力」(具体的には、大規模言語モデルを呼び出す回数)をどのように最適化するかを検討することで、AgenticDataは他の手法の約半分のコストで高品質な結果を達成できることを見出しました。

論文は、単一の巨大なAIモデルがこれらすべてのタスクを単独でこなせるという考えに対して、明確に反論しています。計画、実行、検証のすべてを一つのモデルに頼ることは、しばしばエラーや「ハルシネーション(AIが作り話をしてしまう現象)」を引き起こすことを彼らは発見しました。代わりに、彼らの実験は、役割を分担したコラボレーション・チームと堅牢なメモリ・システムに仕事を分割することこそが成功の鍵であることを示唆しています。また、新しい分析のたびに人間がコードを書く必要があるという考えについても、彼らのシステムは必要な手順を自律的に生成できることを示し、その否定を行いました。このシステムは完璧ではなく、複雑なクエリの計画に数分かかることもありますし、極めて稀なデータパターンに苦戦することもありますが、その結果は大きな前進であることを示しています。チームはすでに、銀行や電力網企業などの実社会にこのシステムを導入しており、現在は専門家が一つひとつの質問に対してコードを書く必要なく、複雑なデータを分析できるよう支援しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →