← 最新の論文
💻 computer science

Reliability by Design: A Shared Schema-Metadata Grounding and Catalogue-Constrained Extraction Architecture for Safe Natural-Language Access to Legacy Enterprise Systems

本論文は、自由形式のSQL生成をスキーマ・メタデータ・ナビゲーション・グラフとカタログ制約付き抽出に置き換えることで信頼性を確保し、モデルの規模ではなくアーキテクチャ設計を通じてハルシネーションとセキュリティリスクを排除する、レガシーなエンタープライズ・システムへの安全な自然言語アクセスのためのプロダクショングレードのアーキテクチャを提示し、検証するものである。

原著者: Karan Khajuria, R. K. Bathla

公開日 2026-09-03
📖 1 分で読めます☕ さくっと読める

原著者: Karan Khajuria, R. K. Bathla

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大学から病院に至るまで、現代の機関が持つ広大で静かな機械装置の中で、データは巨大なデジタルアーカイブの中に閉じ込められています。エンタープライズ・リソース・プランニング(ERP)プラットフォームとして知られるこれらのシステムには、入学、試験、研究助成、およびガバナンスの記録が保持されています。長年、このデータについて質問する必要がある人々(管理者、品質管理担当者、コーディネーターなど)は、直接質問することができませんでした。彼らはデータベースの言語であるSQLと呼ばれる複雑なコードを解さないため、質問をクエリへと翻訳してくれる少数の技術スペシャリストに頼らざるを得ませんでした。これがボトルネックとなり、意思決定を遅らせ、非技術職のスタッフを仲介者に依存させ続けてきました。最近では、大規模言語モデルと呼ばれる新しいタイプのコンピュータプログラムが、自然な英語で質問して即座に回答を得ることを可能にすることで、この問題を解決すると約束しています。しかし、これらの強力なモデルを、ライブの重要なビジネスシステムに直接接続すると、危険な存在となります。厳格なガードレールがなければ、モデルは存在しないデータテーブル間の接続を捏造したり、コード化された値の意味を推測したり、あるいは誤って機密情報を露出させてしまう可能性があります。その結果、一見すると役に立つように聞こえても、誤った回答を生成したり、さらに悪い場合には安全性やプライバシーの規則を破ったりするシステムになってしまいます。

デシュ・バガット大学の研究チームは、コンピュータモデルの生のパワーよりも安全性を優先する、自然言語をこれらのレガシーシステムに接続する新しい方法を構築しました。彼らは、この環境における信頼性は、人工知能をより賢く、より大きくすることではなく、システムのアーキテクチャ自体を変えることにあると主張しています。言語モデルにデータベースのクエリを直接書かせるのではなく、モデルが事前に承認された選択肢の中から選ぶことだけを許可する構造を彼らは作成しました。研究者たちは、約800のデータテーブルを含む実世界の大学システム(現代的なデータベースに見られる標準的な安全マーカーを欠いているシステム)を用いて、このアプローチをテストしました。彼らの知見は、モデルができることを厳格に制御することで、言語モデルがいかに大きく、あるいは小さくても、最終的なデータベースコマンドにおいてエラーをゼロにできることを示しています。このシステムは、推測によって機能するのではなく、会話が始まる前に存在するデータのキュレーションされたマップに基づいています。

このソリューションの核心は、ソフトウェアの隠れた構造を整理する新しい方法にあります。多くの古いエンタープライズシステムでは、データベースは異なる情報の断片が互いにどのように関連しているかを明示しておらず、これらの接続はアプリケーションコードの中にのみ存在します。これを修正するために、研究者たちは「スキーマ・メタデータ・ナビゲーション・グラフ」を構築しました。これは、ソフトウェアの乱雑で暗黙的な接続を、明確で構造化されたガイドへと翻訳する、詳細で機械読み取り可能な地図であると考えてください。この地図は、「入学」や「研究」といったシステムのハイレベルな機能領域から、特定のページ、カラム、そして実際のデータテーブルへと繋いでいます。決定的なことに、この地図には承認されたレポートテンプレートのリストと、それぞれのデータを取得するために必要な正確な、事前作成済みのコードが含まれています。これは、欠落している安全マーカーの代わりとして機能し、コンピュータが情報を結合する際に推測する必要なく、正確に結合できるように保証します。

ユーザーが質問を投げかけるとき、システムは言語モデルに新しいデータベースコマンドをゼロから書かせません。代わりに、モデルは「セレクター(選択器)」として機能します。モデルはユーザーのリクエストを聞き、ユーザーが現在ソフトウェア内のどこで作業しているかというコンテキストを使用して、最も関連性の高いマップの部分を特定します。その後、モデルは構造化された仕様を抽出し、本質的には、既知の安全なレポートテンプレートのホワイトリストから選択を行います。モデルは実際のデータベースコードを生成することはありません。モデルが選択を行った後、別の信頼できるソフトウェアが引き継ぎます。この決定論的なコードが、マップに保存されている固定され検証済みの断片を使用して、最終的なクエリを組み立てます。コードは生成時にオンザフライで作られるのではなく、既知の安全なパーツから組み立てられるため、悪意のあるコードを注入したり、存在しないカラムを参照したり、あるいは誤ったデータを返すような方法でテーブルを結合したりするコマンドを生成することは不可能です。

研究者たちは、5つの異なる認定枠組みにサービスを提供している高等教育システムにこのアーキテクチャを導入しました。彼らは、モデルにエラーを起こさせようとするベンチマークを含め、厳格にシステムをテストしました。結果は決定的でした。システムは無効なデータベースコマンドをゼロに抑えました。この安全性は、小さなオープンソースの言語モデルを使用した場合でも、はるかに大きなプロプライエタリなモデルを使用した場合でも維持されました。実際、最小のモデルは最大のモデルと同等の性能を発揮し、安全性は背後にある「脳」のサイズではなく、システムの設計に由来することを証明しました。実世界の運用において、ステークホルダーからは、システムが約85パーセントの確率で正しいレポートを返したとの報告がありました。残りのリクエストは、推測されるのではなく安全に拒否されたため、他のシステムを悩ませるようなサイレントエラーを防ぐことができました。

このアプローチは、コストとメンテナンスの問題も解決します。システムは、ユーザーが実際に何を求めているかのキュレーションされたリストに依存しており、データベースの全スキーマを理解しようとするのではないため、維持に必要な労力はずっと少なくなります。研究者たちは、AIを再学習させたり複雑なコードを書き直したりすることなく、マップに単一のエントリを追加するだけで、新しいレポート機能を簡単に追加できることを見出しました。さらに、彼らはシステムを2つのレイヤー、つまりユーザーの質問に答えるリアクティブ層と、コンプライアンス指標を自動的に監視するプロアクティブ層として設計しました。両方のレイヤーは同じ基礎となるマップを共有しているため、組織は対話型のヘルプと自動化された安全チェックの両方を得るために、2つの別々のシステムを構築する必要はありません。

本研究は、重要なエンタープライズシステムにとって、信頼できる自然言語アクセスへの道は、複雑なデータの中を推論して進むようなより大きなモデルを構築することではなく、モデルを安全で検証された経路に制約するアーキテクチャを構築することであると結論付けています。データベースコマンドの生成タスクを言語モデルから切り離し、信頼できる決定論的なプロセスへと移行することで、研究者たちは安全かつ実用的なシステムを作り上げました。この設計は、記録の完全性をリスクにさらすことなく、機関がデータの価値を引き出す方法を提供しており、エンタープライズデータの世界では、安全性が規模ではなく構造の特性であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →