← 最新の論文
💻 computer science

DKSE: Automated Extraction of Structured Domain Ontologies from Software Requirement Documents via Large Language Models

本論文では、大規模言語モデルを活用して中国の銀行部門における非構造化ソフトウェア要件ドキュメントを、機械判読可能でプロベナンス(由来)が追跡可能なオントロジーへと自動的に変換するRustベースのツールであるDKSEを提示し、テスト生成や知識グラフ構築といったダウンストリームタスクに対する高い精度と実用的な有用性を実証する。

原著者: Yahua Ruan

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Yahua Ruan

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、すべての本が人間にしか理解できない言語で書かれた、巨大で古めかしい図書館に足を踏み入れました。あなたは物語や規則、指示書を読むことができますが、ロボットに特定の事実を見つけさせたり、その指示に基づいて新しい機械を作らせたり、あるいは規則が守られているかを確認させようとしても、ロボットはただ呆然と立ち尽くすだけです。ロボットには、テキストの段落は見えていても、魔法をかけるために必要な「構造化されたデータ」は見えていないのです。これが、ソフトウェアエンジニアリングの世界における日常の現実です。何十年もの間、ビジネスがどのように運営されるかという「ソースコード」――つまり、要件、規則、プロセス――は、WordファイルやPDFのような非構造化ドキュメントの中に閉じ込められてきました。人工知能はコードを読み書きすることには驚異的に習熟してきましたが、「何を構築すべきか」を伝える乱雑な自然言語のドキュメントを理解することには苦戦してきました。大きな問いはこうでした。「いかにして、これらの人間の物語を、機械が思考し、構築し、検証できる形式へと変換するか?」

そこで登場するのが、超強力な翻訳者であり司書でもある、DKSE(Domain Knowledge Structuring Engine)です。これは、単に要件ドキュメントを読むだけでなく、その中にある物語を理解し、即座に完璧に整理されたマシンリーダブルな設計図へと書き換える、魔法のスキャナーのようなものだと考えてください。DKSEは、情報を単なるテキストの壁として残すのではなく、6つの具体的で有用なカテゴリへと分解します。それは、エンティティ(「顧客」や「口座」といった物語の登場人物)、リレーション(「顧客が口座を所有する」といった彼らのつながり)、ルール(「もし残高が低ければ、取引をブロックする」といった宇宙の法則)、プロセス(「ローンの承認方法」といったステップ・バイ・ステップのダンス)、API(データが出入りするためのドアや窓)、そしてディクショナリ(許可された単語やコードの公式リスト)です。

研究者たちは、このツールを膨大な量の実際の銀行関連ドキュメント――約80万文字に及ぶ複雑な金融規則――を用いてテストしました。その結果は目覚ましいものでした。DKSEは、1,200以上のルールや約600のデータインターフェースを含む、3,439個の明確な構造化知識を自動的に抽出したのです。人間の専門家がその成果を検証したところ、精度は96%に達し、「ハルシネーション(AIが作り話をしてしまう現象)」はゼロでした。しかし、本当の魔法は抽出そのものではなく、その次に起こることです。情報が構造化されたことで、チームは他のAIモデルを検証するための1,214個のテスト問題を即座に生成し、新しいAIの脳を教えるための約200万トークンにおよぶ大規模な学習データセットを構築し、さらにはコンピュータが作り話なしに正確な事実を検索できるよう、ナレッジグラフ・システムへと投入することさえできました。この論文は、これを銀行業界に特化した成功した概念実証として提示しており、私たちはついに、あの埃をかぶった要件ドキュメントを、現代のソフトウェア開発を駆動する、生き生きとした呼吸する「脳」へと変えることができるのだと示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →