Neural-Symbolic Reasoning over Knowledge Graphs: A Survey from a Query Perspective
本サーベイは、クエリの形式と分類に焦点を当てつつ、ディープラーニングと記号的推論の間の溝を埋めるための大規模言語モデルの革新的な統合を探索することで、知識グラフ上のニューロ・シンボリック推論に関する包括的なレビューを提供するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あらゆる世界の事実が本ではなく、巨大な接続のウェブとして保存されている、広大なデジタル図書館を想像してみてください。この図書館では、ある人物はその職業へと結びつき、ある都市は自国の国家へと結びつき、ある映画は監督へと結びついています。「知識グラフ」として知られるこの構造は、人類の理解の地図として機能し、コンピュータが情報の断片から別の情報へとナビゲートすることを可能にします。何十年もの間、科学者たちは、この地図を通じて推論し、問いを投げかけ、接続の中に隠された新しい真実を見つけ出す方法を機械に教えようとしてきました。しかし、現実の世界は混沌としています。事実はしばしば欠落しており、データはノイズを含んでいたり、矛盾していたりすることがあります。厳格な法律の規範のような、硬直した厳密なルールに依存する従来の手法は、こうした不完全さに直面すると、しばしば破綻してしまいます。それらは現実のグレーゾーンを扱うことができないのです。
これを解決するために、研究者たちは、2つの異なる思考様式を融合させた新しい種類の知性を開発してきました。一方の方法は、正確ですが脆い、厳格なレシピに従うコンピュータプログラムのようなものです。もう一方は、柔軟ですが時に曖昧な、パターンから学習する人間の脳のようなものです。これらのアプローチを融合させることで、科学者たちは、正確さと適応性の両方を備えながら、知識の混沌としたウェブの中を推論できるシステムを作り出しています。ウェインステート大学とイリノイ大学アーバナ・シャンペイン校の研究者による最近の調査は、これがどのように行われているかを深く考察しています。彼らは、単純な一歩の問いから、複雑で多層的なパズルに至るまで、これらのシステムがいかに問いに答えるかを検証しており、さらに、現代のチャットボットを動かしている技術である大規模言語モデルという、強力で新しいツールがいかにこれらに加わっているかについても調べています。
研究者たちは、これらのシステムにどのような種類の問いに答えさせるかという観点から、レビューを整理しました。最も単純な問いは、答えがわずか一歩先にある「シングルホップ(single-hop)」のクエリです。例えば、「会社XのCEOは誰ですか?」と尋ねれば、システムは直接的なリンクを探します。これらのタスクに対して、古い手法は専門家によって書かれた厳格なルールを使用してきましたが、データが不完全な場合には失敗することがよくありました。新しい手法は、例から学習するコンピュータモデルであるニューラルネットワークを使用して、欠落したリンクを推測します。最も有望なアプローチは、両方を組み合わせることです。つまり、不確実性を扱うためにニューラルネットワークの学習能力を利用しながら、答えが理にかなっていることを保証するためにルールの論理的構造を維持するという方法です。このハイブリッド手法により、システムは、もしある人物が特定の都市にある会社で働いているならば、その事実が明示的に書き込まれていなくても、その人物はおそらくその都市に住んでいるであろうと推論することができるのです。
問いがより複雑になり、複数のステップや、「かつ(and)」、「または(or)」、「ではない(not)」といった論理条件を含むようになると、課題は著しく増大します。これらは単に一つのリンクを見つけることではなく、ウェブの中を通り道として進むことが求められます。調査によれば、研究者たちはこれらの問いを、幾何学的な空間を移動することによって解ける数学的な問題として扱う方法を開発してきました。単に事実が真か偽かをチェックするのではなく、システムは異なる可能性に対して「真実の度合い」を割り当てます。一部の手法は、これらの可能性を多次元空間における箱や球体のような形として可視化します。これらの形がどのように重なり合い、あるいは適合するかを見ることで、コンピュータは「フランス出身の監督と仕事をしたことがあるが、オスカーを受賞していない俳優をすべて挙げよ」といった複雑な問いの答えを決定することができます。研究者たちは、これらの手法は強力であるものの、最も複雑な論理構造については依然として苦戦していることを発見しており、この分野がまだ成熟過程にあることを示唆しています。
この調査は、形式的なコードではなく、日常的な言葉で尋ねられる問いに対して、これらのシステムがどのように対処するかについても探っています。人間が「昨年、最も多くの賞を受賞した映画の悪役を務めたのは誰ですか?」と尋ねるとき、システムはまず文章を理解し、分解し、それから知識グラフを検索しなければなりません。初期の試みは、文章を厳格なコマンドに翻訳しようとしましたが、言い回しが珍しい場合には失敗することがよくありました。新しいアプローチでは、システムがグラフ内をナビゲートして答えを見つけ出すための、試行錯誤を通じて学ぶ技術である「強化学習」を使用しています。ユーザーがフォローアップの質問をする会話において、システムは前のターンの文脈を記憶していなければなりません。研究者たちは、進歩は見られるものの、これらのシステムは長い推論の連鎖の中で迷子になったり、データ内の似たような経路を区別できなかったりすることが依然としてあると指摘しています。
この調査で議論されている最もエキサイティングな展開は、大規模言語モデルと知識グラフの統合です。これらのモデルは人間の言語を理解することには非常に長けていますが、検証された事実のデータベースへのアクセスを持たないため、「ハルシネーション(幻覚)」と呼ばれる、作り話をしてしまうという問題を抱えています。逆に、知識グラフは事実には満ちていますが、自然言語を理解することは苦手です。研究者たちは、これらを組み合わせることが強力なパートナーシップを生むことを発見しました。一つのアプローチでは、言語モデルがガイドとして機能し、人間の問いを知識グラフのための検索クエリへと翻訳するのを助けます。別の方法では、知識グラフがファクトチェッカーとして機能し、言語モデルが作り話をするのを防ぐために検証済みの情報を提供します。最も高度な手法では、言語モデルがグラフに関連する情報を見つけるのを助け、グラフが言語モデルの回答を洗練させるのを助けるという、ループの中で両者が協力し合うことが可能です。この相互援助により、流暢な会話能力と、現実に根ざした正確さを兼ね備えたシステムが生まれます。
将来を見据えて、研究者たちは、これらのシステムの領域をテキスト以外へと拡張することが次のフロンティアであると示唆しています。彼らは、コンピュータが画像、ビデオ、音声を含む知識グラフを持つことで、人間の知覚に近い形で世界について推論できる未来を描いています。また、これらのシステムが異なる言語を橋渡しし、人間の翻訳者を介さずに、英語、中国語、あるいはスペイン語で表現された事実間のつながりを見つけ出す未来も見据えています。現在のテクノロジーは、機械をより賢く、より信頼できるものにする上で大きな進歩を遂げましたが、調査は、やるべきことはまだ多く残されていると結論づけています。目標は、単に情報を検索するだけでなく、人間の知識の複雑で相互に関連した性質を真に理解し、現実世界の混沌とした状況を、人間の精神と同じような優雅さで扱うシステムを構築することなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。