← 最新の論文
🤖 AI

Toward Effective and Reliable LLM Agents via Dynamic Ontology

本論文は、知識と関係性を明示的に接地するためにタスク指向のオントロジーを動的に構築および洗練させるフレームワークであるOaKを紹介しており、これにより大規模言語モデルエージェントにおける多段階推論のエビデンス活用能力と信頼性を向上させる。

原著者: Xiaohui Zhang, Zequn Sun, Chengyuan Yang, Yuanning Cui, Lingbing Guo, Wei Hu

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Xiaohui Zhang, Zequn Sun, Chengyuan Yang, Yuanning Cui, Lingbing Guo, Wei Hu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の世界において、「大規模言語モデル」として知られる特定の種類のソフトウェアが、人間の言語を理解し生成するための強力なツールとして登場しました。これらのモデルは、単にチャットをするだけでなく、情報の検索、デジタルツールの使用、見つけた情報に基づく意思決定といった具合に、タスクを小さなステップに分解して複雑な業務を実行するように設計されたプログラムである「エージェント」の構築によく用いられます。しかし、これらのエージェントがより長く複雑な仕事に取り組もうとすると、しばしば困難に直面します。彼らは必要な事実を見失ったり、成立しない論理的な飛躍を行ったり、あるいは自身のメモリ内に格納された膨大で非構造化された知識に頼りすぎるあまり、エラーのループに陥ったりすることがあります。これを解決するために、研究者たちは、エージェントがナビゲートする世界のより明確で整理された地図を与える方法を模索しており、あらゆるステップが推測ではなく信頼できる証拠に基づいていることを確実にしようとしています。

南京大学などの研究チームは、これらの信頼性の問題に対処するために、「OaK」と呼ばれる新しいフレームワークを開発しました。彼らの研究は、「オントロジー」と呼ばれる概念に焦点を当てています。これは本質的に、コンピュータが厳密に解釈できる形で書かれた、概念とその関係性を記した構造化された辞書のようなものです。これらの構造を作成するための従来の手法は、専門家がすべてのルールを手動で定義する必要があり、遅くて困難なプロセスを要しますが、この新しいシステムは、そのタスクに特化した地図の作成を自動化します。研究者たちは、各業務に対してカスタムの動的な構造を構築することで、エージェントが多段階のタスクを計画・実行する能力を大幅に向上させることができ、そのプロセスをより透明にし、失敗を少なくできることを見出しました。

OaKシステムの核心は、エージェントが実際のタスクに取り組む前に発生する、2段階のプロセスです。まず、システムは一連のトレーニング例と、旅行の計画や顧客データの管理といった、特定の業務要件を調べます。次に、システムは「スキーマ」を自動的に作成します。これは、「ホテル」「航空券」「予算」といった、関与する重要な情報の種類とそれらがどのように結びつくかを定義する設計図です。この設計図は単なるリストではなく、矛盾や欠落したルールがないことを確認するために、論理的な推論器(リーゾナー)によって厳格にチェックされます。もし設計図に欠陥があれば、システムは次に進む前にそれを修正します。設計図が確かなものになると、システムはトレーニング資料から抽出された実際のデータポイントを、設計図のルールに従って正確に整理したネットワークである「知識グラフ」を構築します。

この構造化された基礎が整うと、システムはエージェントが使用できる一連の専門的なツール、すなわち「関数」を作成します。エージェント自身に、航空券を検索し、価格でフィルタリングし、空席状況を確認する方法を考えさせるのではなく、システムはこれらの特定のアクションを正しく実行する事前構築済みのツールを提供します。エージェントは、設計図の厳格なルールに従って、これらのツールを使用して問題を解決します。もしエージェントが間違いを犯したりタスクが失敗したりした場合、「判定(ジャッジ)」モデルがプロセス全体をレビューし、設計図やツールがどこで誤ったのかを正確に特定し、改善策を提案します。この「構築、テスト、洗練」のサイクルは、システムが未知の質問に対処できるほど堅牢になるまで、数回繰り返されます。その結果、「カーネル」と呼ばれる、エージェントがデータとやり取りするために使用する、凍結された信頼できるインターフェースが完成します。これにより、エージェンドが証拠に基づいた決定を下すことが保証され、事実を捏造したり制約を無視したりすることができなくなります。

研究者たちは、このアプローチが現実世界で通用するかどうかを確認するために、非常に異なる3つの種類の課題を用いてテストを行いました。第一の課題は、予算やスケジュールの厳しい制約を守りながら、航空券、ホテル、食事、アクティビティを手配しなければならない旅行計画タスクでした。第二は、ビジネス環境における顧客関係の管理であり、複雑な企業ポリシーに従い、特定の記録を呼び出すことが求められました。第三は、詳細な質問に答えるために、航空券データベースやレストランのレビューといった様々な外部ソースからの情報を組み合わせる能力をテストしました。あらゆるケースにおいて、OaKシステムは標準的な手法を上回る性能を示しました。例えば旅行計画のタスクでは、あるベースモデルを使用した場合、完全で有効な旅程を完了する成功率が、約15パーセントから56パーセント近くまで向上し、別のモデルでは約4パーセントから約20パーセントへと向上しました。また、ビジネスやデータに関するタスクにおいても、特にエージェントが厳格なルールに従う必要があるシナリオや、複数のテーブルからデータを組み合わせる必要があるシナリオにおいて、大幅な改善が見られました。

この研究は、なぜこれらの改善が起こったのかについても明らかにしました。カスタム構築されたツールを取り除いたり、複数のラウンドにわたって設計図を洗練させるプロセスを停止させたりすると、パフォーマンスが急激に低下しました。これは、エージェントに単にデータへのアクセス権を与えるだけでは不十分であり、エージェントが効果的に行動を調整するためには、構造化されたルールと事前パッケージ化されたツールが必要であることを示しています。システムは、エージェントの推論プロセスを可視化し、制約を設けることで機能しました。これにより、エージェントが根拠のない仮定へと迷走することを防いでいます。この新しい手法は、より単純なアプローチよりも実行に時間がかかり、より多くの出力テキストを生成しましたが、入力トークンの数は少なくなっており、構造化されたインターフェースによって、エージェントが必要な情報を処理する効率が高まったことが示唆されました。研究者たちは、ドメイン知識を実行可能で自己修正可能なインターフェースへと変えることで、人工知能エージェントをより信頼性が高く、信頼に足るものにし、現実世界のアプリケーションに求められる複雑な多段階の推論を処理できるようにできると結論付けました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →