← 最新の論文
💬 NLP

W-RAG: Source-Aware Retrieval for Enterprise Document Generation from Heterogeneous Knowledge Bases

本論文は、オントロジーに基づいた検索とソースレベルの重み付けを採用することで、異種混合なエンタープライズ知識ベースにおけるグローバルランキングの限界に対処し、ドキュメントのカバレッジと生成品質を向上させる、ソース認識型の検索フレームワークであるW-RAGを提案する。

原著者: Hridya Dhulipala, Rajesh Ombase, Michael Wang, Tien N. Nguyen

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Hridya Dhulipala, Rajesh Ombase, Michael Wang, Tien N. Nguyen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の職場において、ポリシーマニュアル、合併報告書、製品発表計画といった複雑な文書を作成するには、多くの異なる場所から情報を集める必要があることがよくあります。チームは、社内の規則、科学研究論文、政府の規制、そして市場ニュースを同時に参照しなければならない場合があります。これを支援するために、コンピュータ科学者は、人工知能が文章を書く前に事実を検索できるようにするシステムを開発してきました。リトリーバル拡張生成(Retrieval-Augmented Generation)として知られるこの手法は、ドキュメントのライブラリを読み、そのメモを使用して回答を起草するデジタルアシスタントのように機能します。その目的は、AIをより正確で現実に即したものにし、事実を捏造することを防ぐことにあります。しかし、これらのシステムが複数の異なる種類のライブラリから同時に情報を収集しようとすると、重大な問題が発生します。

課題は、すべての情報源が平等であるわけではなく、単一の文書においてすべてが同じ役割を果たすわけではないということです。標準的なシステムは、見つかったすべてのテキストを、あたかも一つのレースで競い合っているかのように扱い、ユーザーの質問に言葉がどれほど一致しているかに基づいて純粋にトップの結果を選び出します。企業環境において、この方法はしばしば失敗します。適切なキーワードを含む何百ページもの一般的なニュース記事を読み込む一方で、特定の政府規制や技術的な安全ガイドラインからの、たった一つの極めて重要な段落を完全に無視してしまうことがあります。その結果、流暢には聞こえるものの、文書を法的または技術的に有効にするために不可欠な、専門的な詳細事項を欠いたドラフトが出来上がってしまいます。AIは、一つの種類のソースによってコンテキストウィンドウが占有されてしまい、完全な全体像を構築するために必要な多様な証拠を漏らしてしまうのです。

研究者のHridya Dhulipala、Rajesh Ombase、Michael Wang、そしてTien N. Nguyenは、この特定の問題を解決するために立ち上がりました。彼らは、ソース認識型リトリーバル(source-aware retrieval)を意味するW-RAGという新しいフレームワークを提案しました。すべてのライブラリからのすべてのドキュメントを一つの大きなプールの中で競わせるのではなく、この新しいシステムは検索プロセスを整理します。まず、「データプライバシー」や「財務コンプライアンス」といった、文書に求められる特定のテーマを特定し、概念の構造化されたマップを使用して関連する一節を見つけ出します。次に、すべてを一括でランク付けするのではなく、各特定のライブラリ内において最適なドキュメントを個別にランク付けします。最後に、各ライブラリに対して特定の予算を割り当て、最終的な文書のスペースのうち、どの程度を企業報告書で埋め、どの程度を科学論文で埋め、どの程度を法的テキストで埋めるべきかを正確に決定します。これにより、最終的なドラフトは、利用可能なテキストの量ではなく、タスクの真のニーズを反映した、バランスの取れた証拠の構成物となることが保証されます。

このアプローチが実際に機能するかどうかをテストするために、チームはこのような種類のエンタープライズ・ライティングに特化した新しいデータセットを作成しました。彼らは、ヘルスケア政策の策定から合併・買収報告書の作成に至るまで、100の現実的なシナリオを構築しました。各シナリオに対して、彼らは4つの明確な情報のライブラリを構築しました。一つは企業提出書類や運用ガイドを含むもの、もう一つは科学研究、三つ目は法的および規制に関するテキスト、そして四つ目は市場ニュースと業界レポートを含むものです。そして、それらの混合されたソースに基づいてAIに文書を書かせました。研究者たちは、グローバルなリストからトップの結果を単純に選ぶ標準的なシステムが、著しく苦戦することを発見しました。これらのシステムは、しばブルント(流暢)ではあるものの不完全な文書を生成し、小さな専門的なライブラリを無視していたために、タスクの必須要件を満たせないことが分かりました。

結果は、新しいソース認識型の手法が使用された際に、明確な違いを示しました。各知識ベースの明確な役割をシステムに尊重させることで、生成された文書の品質は劇的に向上しました。この新しいアプローチは、従来の最良の手法と比較して、ドキュメント要件の充足率を50%以上向上させ、標準的なシステムと比較して100%以上向上させました。また、文書を執筆するために使用される情報が、最大または最もテキスト量の多いライブラリに偏ることなく、正しいソースのミックスから来ていることを確実にしました。この研究は、複雑で現実世界のライティングタスクにおいては、情報の選択とバランスの取り方が、情報を発見する能力と同じくらい重要であることを示唆しています。証拠の構成を注意深く管理することで、システムは事実に基づいているだけでなく、構造的にも完全であり、現代のエンタープライズ・ライティングの多様なニーズを満たすドラフトを作成することができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →