Train, Retrieve, or Both? A Four-Arm Head-to-Head for Correct Statutory Citation on the Ontario Residential Tenancies Act
本論文は、ファインチューニングされたQwen2.5-7Bモデルと検索を組み合わせた手法(SFT+RAG)が、特殊な検索モデルや大規模なデータセットを必要とすることなく、スタンドアロンのファインチューニングや検索のみのアプローチを上回り、オンタリオ州住宅賃貸借法を引用する際の精度において最高値を達成しつつ幻覚を排除することを実証する、4つのアームによる評価を提示する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、膨大な300ページの規則集(オンタリオ州住宅賃貸借法)の中から、「大家が私のアパートに入る前に、どのくらいの通知を行う必要があるか?」といった特定の質問に答える正確なルールを見つけ出そうとしていると想像してください。
目標は、美しいエッセイを書くことではなく、一般の人が自分で調べられるように、**正確なページ数と段落番号(引用)**を指し示すことです。
この論文は、コンピュータにこれをどのように教えるのが最善かを判断するための「味見(テスト)」です。研究者たちは、スマートなAIモデル(デジタル脳)を使用して、4つの異なる戦略を競わせ、どれが嘘をつかずに正しいルールを見つけ出せるかを検証しました。
以下は、4人のランナーの成績です。
4人のランナー
「生の脳」(ベースモデル):
- 比喩: これは、規則書を一通り読んだことはあるものの、暗記はしていない非常に賢い学生のようなものです。彼らは記憶からページ数を推測しようとします。
- 結果: 彼らは完全に失敗しました。正しいページを見つけることができず、81%の確率で存在しない架空のページ番号を作り上げました。彼らはこの仕事にはあまりにも信頼性が低すぎます。
「暗記屋」(ファインチューニングのみ):
- 比喩: これは先ほどと同じ学生ですが、数週間かけて「質問 → ページ番号」というフラッシュカードのドリルに取り組んだ状態です。彼らは形式を理解し、答えを暗記しようとします。
- 結果: 架空のページを作ることはなくなりましたが、具体的な数字は間違ったままでした。彼らはルールの「概念」は覚えていますが、正確なセクション番号を混同してしまいます。例えば、「騒音」に関するルールであることは分かっているのに、ページ番号を52ページではなく50ページだと推測してしまうような状態です。
「司書」(検索のみ):
- 比喩: この学生は何も暗記しようとしません。その代わりに、彼らのために本を検索してくれる超高速の司書がいます。学生は、司書が手渡したページのみを使って回答することが許可されています。
- 結果: これは大幅な改善でした。実際のテキストを見ることが強制されているため、架空のページ番号を作ることはありませんでした(ハルシネーション 0%)。しかし、時として司書が10ページの束を渡してくることがあり、学生はどれが「まさに」正しいものなのかについて混乱してしまうことがありました。
「スーパーチーム」(ハイブリッド:暗記屋 + 司書):
- 比喩: この学生は、フラッシュカードのドリルも行い、かつ司書も持っています。ドリルによって、司書がバラバラなページの束を渡してきたときに、より優れた判断ができるようになりました。
- 結果: このチームがレースに勝ちました。彼らは他の誰よりも頻繁に正確なページ番号を見つけ出しました。「ドリル」のおかげで、司書が渡したページの束が大きくても、正しいページを選び出すことができました。
大きな驚き
- 大きいことが常に良いとは限らない: 研究者たちは、学生を助けるために「スーパー司書」(より複雑で高価な検索ツール)を使うことを試みました。しかし、効果はありませんでした。単純で安価な司書でも、十分に機能しました。これは、この問題を解決するために高価で重厚な機械は必要ないという、素晴らしいニュースです。
- もっと勉強しても効果はなかった: 「暗記屋」にさらに多くのフラッシュカードを学習させましたが、それによって向上することはありませんでした。ボトルネックは学習量ではなく、そもそもテキストを見つけ出すために司書が必要であるという点にありました。
- 「ハルシネーション・ゼロ」のトリック: 「司書」と「スーパーチーム」が架空のルールを作らなかった理由は、設計によるものです。システムには安全ゲートがあります。もしページ番号が司書が持っている本の中に存在しない場合、システムはそれを言うことを拒否します。これは学習されたスキルではなく、厳格なルールです。
最終スコアカード
「スーパーチーム」(ハイブリッド)が最高のスコアを獲得しましたが、まだ金メダルには届いていません。
- 目標: 研究者たちは、スコア 0.70(70%の確率で正解すること)を目指していました。
- 現実: 彼らが獲得したのは 0.48(約半分の確率で正解)でした。
なぜ100%にならなかったのか?
- 司書が本を見落とした: 時として、司書が正しいページを全く見つけられないことがありました(約11%の確率)。正しいページが束の中に含まれていなければ、学生は選ぶことができません。
- 「細かい字」の問題: 学生は正しい「セクション(章)」は見つけることが多いのですが、特定の「サブセクション(段落)」を見逃してしまうことがよくありました。これは、正しい章は見つけたが、間違った段落を見ている状態です。これは「半分正解」としてカウントされます。
- 極めて小さなテストグループ: 最終テストはわずか27の質問しかありませんでした。これは、スポーツチームの全シーズンをたった一度の試合の結果だけで判断するようなものです。結果は有望ですが、サンプルサイズが小さいため、100%確実とは言えません。
結論
コンピュータに法律の場所を指し示させたい場合:
- 単に法律を暗記させるのではなく(間違った推測をします)、
- 単に法律を読ませるのでもなく(大量のテキストに混乱します)、
- 形式を理解するように訓練されたモデルと、法律を検索するためのツールを組み合わせるべきです。
このアプローチが最も正確であり、決して嘘をつかず、高価で重厚なテクノロジーを使わなくても機能します。しかし、「良い(精度48%)」から「素晴らしい(精度70%)」へと到達するためには、まだ改善の余地があります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。