← 最新の論文
💻 computer science

Hyperparameter Analysis in Retrieval-Augmented Generation Systems Applied to the Public Prosecutor’s Office of the State of Espírito Santo Corpus

本研究は、実験計画法を用いて、エスピリトサント州検察庁向けにカスタマイズされた検索拡張生成(RAG)システムにおける重要なハイパーパラメータ、具体的にはチャンク戦略、コンテキスト量、およびLLMの選択を分析・最適化しており、整列ランク変換(ART)を用いた統計解析を通じて、これらの要因が回答の品質に有意な影響を与えることを明らかにしている。

原著者: Heitor Quartezani, Pedro Berger, Alessandro Sarnaglia, Marcelo Guimarães, Giovanni Comarela, Leonardo Rocha, Diego Dias

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Heitor Quartezani, Pedro Berger, Alessandro Sarnaglia, Marcelo Guimarães, Giovanni Comarela, Leonardo Rocha, Diego Dias

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたの周りに、エッセイを書き、ジョークを言い、あらゆる質問に答えることができる、ものすごく賢いロボットの友達がいるとします。このロボットは、インターネット上のすべてを読み込んだ、極めて優秀な学生のような存在です。しかし、ここには一つ落とし穴があります。この学生は、事実に関する記憶力がひどく悪いのです。もしあなたが特定の法律について尋ねたら、完璧に聞こえるけれど完全に架空のルールを自信満々に作り上げてしまうかもしれません。これは「ハルシネーション(幻覚)」と呼ばれ、法廷や病院のように正確な情報が必要な場面では大きな問題となります。

これを解決するために、科学者たちは**RAG(検索拡張生成:Retrieval-Augmented Generation)*という巧妙なトリックを編み出しました。これは、試験の直前にロボットの友人に教科書の束を渡すようなものです。自分の記憶から推測する代わりに、ロボットはまず本の中から答えを探し出し、その見つけた内容だけ*に基づいて回答を作成します。それは、報告書を書く前に証拠ファイルを確認する探偵のようなものです。しかし、ここにはひねりがあります。本の整理の仕方が重要になるのです。ページを小さな切れ端に切り刻むべきでしょうか? それとも章ごとにまとめておくべきでしょうか? そして、ロボットが書き始める前に、何ページ読ませるべきでしょうか? もしこれらの設定を間違えると、ロボットは重要な手がかりを見逃したり、あまりに多くのノイズに混乱したりしてしまうかもしれません。これは、まさにブラジルの研究チームが解決しようとしたパズルです。


探偵のジレンマ:マシンをチューニングする

ブラジルのエスピリトサント州にある検察庁(MPES)には、数千もの法律、規則、条例を含む膨大な法的文書のライブラリがあります。長年、特定の規則を見つけ出すことは悪夢でした。公務員は、どこを探すべきかを正確に知っていなければならず、そうでなければ行き詰まってしまう状況でした。これを助けるために、彼らは**ファビ(Fabi)**という仮想アシスタントを構築しました(名前は、実在する非常に知識豊富な職員にちなんでいます)。ファビはRAGのトリックを使用しています。彼女は法律のライブラリを読み、スタッフの質問に答えます。

しかし、ファビは完璧ではありませんでした。重要な詳細を見逃したり、曖昧な回答をしたりすることがありました。エイトール・クアルテザーニ率いる研究チームは、シンプルな問いを投げかけました。「どのような設定にすれば、ファビを最高の探偵にできるだろうか?」 彼らは単に推測したのではなく、この問題を巨大な科学実験として扱いました。彼らは、システムにある4つの異なる「つまみ」のあらゆる組み合わせをテストし、どの組み合わせが最も正確で、誠実で、役に立つ回答を生み出すのかを検証しました。

彼らが何を調整し、何を見つけたのかを以下に示します。

1. 「切り方」の戦略(チャンキング)

長くて複雑な法律の物語があると想像してください。それをロボットに渡すために、どのように切り分けますか?

  • 従来の方法(再帰的): 物語を、例えば500文字ずつのパンの切れ端のように、固定されたサイズの塊に切り分ける方法です。これは簡単ですが、文章の途中で切れてしまい、意味が失われる可能性があります。
  • スマートな方法(意味的): トピックが変わる時だけ物語を切り分ける方法です。もし法律の内容が「休暇のルール」から「残業代」に切り替わるなら、そこが切りどころです。これにより、アイデアのまとまりを維持できます。

判明したこと: 研究者たちは、「スマートな方法(意味的な切り分け)」が明確な勝者であることを発見しました。具体的には、トピックの変化に基づいて切り分ける(つまり、トピックが大きく変わる時のみ切る)ことで、最も多くの情報を損なわずに保持できました。500文字ずつの小さな破片に切り分ける「従来の方法」は最悪の結果でした。それは法律の論理をバラバラにしてしまい、ロボットが正しい答えを見つけることを不可能にしてしまったのです。法律業務においては、たった一つの詳細を見逃すことが致命的になり得るため、物語のまとまりを維持することが最も重要な要素でした。

2. 検索メソッド(リトリーバル)

ファビはどうやってライブラリの中から正しいページを見つけるのでしょうか?

  • ベクトル検索: これはロボットに「この質問に『感じ』が似ているものを探して」と頼むようなものです。意味を理解することには長けていますが、正確な単語を見逃す可能性があります。
  • レキシカル検索(語彙検索): これは古典的な図書館のカード目録のようなものです。正確な単語の一致を探します。特定の用語には強いですが、文脈を理解するのは苦手です。
  • ハイブリッド検索: これが両方の良いとこ取りをしたものです。特別な数学的トリック(相互ランク融合と呼ばれるもの)を使用して、「感じ」による検索と「正確な単語」による検索を組み合わせます。

判明したこと: ハイブリッド検索がチャンピオンとなりました。両方の手法を組み合わせることで、ユーザーが変な言い回しをしたり、非常に特定の法的用語を使ったりしても、ファビは正しい文書を見つけることができました。「感じ」による検索だけでは不十分であり、「正確な単語」による検索だけでは硬すぎました。これらを合わせることで、システムは格段に信頼性の高いものになりました。

3. どのくらい読むか(Top-K)

ファビが最適な文書を見つけたとき、回答する前に何枚読むべきでしょうか? 5ページでしょうか? 20ページでしょうか?

  • 判明したこと: 読めば読むほど、結果は良くなりました――少なくともある一定の地点までは。20個の文書を読むことが最良の結果をもたらしました。ロボットに、たとえ余分なページに少しノイズが含まれていたとしても、情報を捕まえるためのより大きな「網」を与えることが、正しい手がかりを見つける助けになることが分かりました。しかし、研究者たちは、15個の文書を超えると、最終的な回答の質の向上は統計的に有意ではなくなることに気づきました。したがって、20個読むことはわずかに優れていますが、それには計算資源のコストがかかります。彼らは将来、より少ないページを読みながらも同じ素晴らしい結果を得られるような、よりスマートなフィルターを使用できることを示唆しました。

4. 脳の力(LLMの選択)

最後に、彼らはファビのために2つの異なる「脳」をテストしました。巨大で超スマートな gpt-4o と、より小さく高速な gpt-4o-mini です。

  • 驚きの結果: より大きく、より高価な脳が勝つと思うかもしれません。しかし、より小さな gpt-4o-mini が、実際には同等の性能を発揮し、時にはそれ以上の性能さえ示しました!
  • なぜか? 巨大な脳は非常に賢すぎるため、時に「創造的になりすぎる」傾向がありました。ロボットが20個の文書を読んだとき、大きな脳はアイデアを混ぜ合わせたり、テキストを過剰に解釈したりして、小さなエラーを引き起こすことがありました。しかし、小さな脳はより「従順」でした。提供されたテキストに厳密に従い、独自の「味付け」を加えることなく、事実を抽出したのです。精密さが求められる法的アシスタントにとって、少し文字通りに受け取ることは、実は強力な武器となったのです。

最終結論

研究者たちは単に推測したのではなく、3,840回もの実験(40の異なる質問に対して96通りの設定をテスト)を行い、高度な数学を用いて結果を証明しました。

彼らは、最高の法的アシスタントを構築するための条件を次のように結論づけました:

  1. 文書は固定サイズではなく、トピックに基づいて切り分けること。
  2. 意味と正確な単語の両方を組み合わせたハイブリッド検索を使用すること。
  3. 見落としがないように、約20個の文書を読むこと。
  4. 指示に厳密に従い、間違いが少ないより小さく安価なAIモデル(gpt-4o-mini)を使用すること。

この研究は、「とりあえずやってみて様子を見る」という段階を超えた、非常に重要なものです。強力なツールを、単に賢そうに見せるだけでなく、実際に賢く、信頼できるものにするために、どのようにチューニングすべきかを厳密な科学を用いて示しています。検察庁にとって、これはファビがより速く、より少ないミスで正しい法律を見つけられるようになり、法制度全体がより円滑に機能することを意味しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →