Retrieval Augmented Generation Framework for the Nepali Legal Domain Question Answering
本研究は、低リソースな法域におけるデータ不足の課題に対処するため、Nepal Kanun Patrikaのアーカイブを活用することで高い適合率と真実性のスコアを実現した、ネパール語の法的質問応答のための初の検索拡張生成フレームワークを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ネパールの法制度を、巨大で古めかしい図書館だと想像してみてください。この図書館には、ネパール語で書かれた何千もの判例(ケースロー)が収められています。しかし、そこには2つの大きな問題があります。
- 本がめちゃくちゃである: 古めかしい言葉で書かれており、あちこちに散らばっており、適切にデジタル化されていないものもあります。
- 司書が新人である: AIモデルは通常、英語の本で学習されます。そのため、ネパール語の法律について尋ねても、AIは十分な量のネパール語の法的テキストを「読んで」学習していないため、混乱したり、デタラメを言ったりすることがよくあります。
この論文は、**RAG(検索拡張生成)と呼ばれるシステムを使用して、これを解決する新しい方法を紹介しています。RAGを、教科書を丸暗記しようとする学生としてではなく、話す前に図書館で答えを探すことを許された「賢いリサーチ・アシスタント」**として考えてみてください。
研究者たちがどのようにこのアシスタントを構築し、テストしたのかを以下に示します。
1. 図書館(データ)
チームは、ネパール最高裁判所の公式デジタルアーカイブ(Nepal Kanun Patrikaと呼ばれます)にアクセスしました。彼らは10,320件の法的文書をスクレイピングし、クリーニングしました。
- 課題: これらの膨大な文書をそのままAIに読み込ませることはできませんでした。それは、500ページの物語の中から特定の文章を見つけるために、本全体を読み直そうとするようなものです。
- 解決策: AIがより扱いやすくするために、彼らは文書を小さな「チャンク(塊)」に切り分けました(長い物語を短い段落に切り分けるようなイメージです)。
2. 検索エンジン(正しいページを見つける)
AIが質問に答える前に、図書館の中から正しいページを見つけ出す必要があります。研究者たちは、2つの異なる検索方法をテストしました。
手法A:「キーワード・ハンター」(BM25)
- 仕組み: これは、正確な言葉を探す伝統的な司書のようなものです。もしあなたが「窃盗の罰則は何ですか?」と尋ねたら、司書は「罰則」「窃盗」「法律」という正確な単語をスキャンします。
- 結果: この方法がチャンピオンとなりました。小さなチャンクに対しては91%、文書全体に対しては88%の確率で正しい文書を見つけ出しました。法的言語は非常に専門的で反復的なため、この方法は非常に精密でした。
手法B:「意味の一致」(高密度検索 / Dense Retrieval)
- 仕組み: これは、たとえ言葉が違っても、質問の「雰囲気」や「意味」を理解する司書のようなものです。高度な数学(エンベディング)を使用して、「盗むこと」と「窃盗」が同じであることを推測します。
- 結果: この方法は悪くはありませんでしたが、この特定の仕事には最適ではありませんでした。正しい文書を見つけられたのはわずか75%でした。研究者たちは、ネパール法の文脈では、意味を推測するよりも正確な単語の一致の方がうまく機能することを発見しました。これは、法的用語が非常に厳格であるためと考えられます。
スピードの罠:
「キーワード・ハンター(BM25)」には一つ落とし穴がありました。精度を高めるために文書を極めて小さなチャンクに分割すると、検索が非常に遅くなりました(10,000冊の本ではなく、110,000枚の小さなインデックスカードの中から探しているような状態です)。システムを実用的な速度に保つために、彼らは「文書全体」バージョンを使用する「キーワード・ハンター」を選択しました。これは精度はわずかに下がりますが、はるかに高速でした。
3. 回答の作成者(レスポンスの生成)
システムが正しい文書を見つけた後、AIは回答を書く必要があります。
- ルール: AIには厳格に指示されました。「作り話をしてはいけない」。
- 戦略: 研究者たちは2段階のプロセスを用いました。まず、AIは回答の証拠となる文書内の正確な一文を指し示さなければなりません。次に、その一文のみに基づいて回答を書きます。もし証拠が見つからない場合は、推測するのではなく「わかりません」と言うように指示されました。
4. 結果(うまくいったのか?)
チームはこのシステムを、法律の専門家によって作成された100の質問でテストしました。最も優れたバージョン(キーワード・ハンター + 文書全体)のパフォーマンスは以下の通りです。
- 成功率: 質問の**92%**に対して、回答の生成に成功しました。
- 真実性: 別のAIおよび人間の弁護士によるチェックの結果、回答の85%が真実でした(つまり、事実を捏造したり、ハルシネーションを起こしたりしていませんでした)。
- 根拠性(グラウンデッドネス): 回答の**74%**が、図書館で見つかったテキストによって直接裏付けられていました。
結論
この論文は、ネパールのような低リソース言語においては、すべてを暗記した超スマートなAIは必要ないということを証明しています。代わりに必要なのは、信頼できる検索ツール(正確な法的テキストを見つけるもの)と、目の前にテキストがない限りは話すことを拒む厳格なAIです。
シンプルな高速検索メソッド(BM25)と慎重な執筆プロセスを組み合わせることで、彼らは、事実を捏造することなくネパール語の法的質問に確実に答えることができる、世界初のシステムを作り上げました。これは、一般の人々が法律の学位を持たずとも、自身の法的権利を理解できるようにするための、将来的な基盤となるものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。