← 最新の論文
💻 computer science

Evaluating and Mitigating Hallucinations in Retrieval-Augmented Question Answering over Uzbek School Textbooks

本研究はUzHistQAデータセットを導入し、検索拡張生成がウズベキスタン史の質問回答におけるハルシネーションを大幅に減少させる一方で、捏造された回答を完全に排除するためには引用と棄却のメカニズムを強制することが必要であることを示しており、リソースの乏しい言語において検索品質と生成の忠実性を個別に評価する必要性を強調している。

原著者: Ruzimboy Azimjonovich Kholmurotov

公開日 2026-09-23
📖 1 分で読めます☕ さくっと読める

原著者: Ruzimboy Azimjonovich Kholmurotov

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の教室では、難しい概念を説明させたり、章を要約させたり、テスト対策をさせたりするために、人工知能を利用する学生が増えています。これらのデジタルアシスタントは、膨大な量のテキストで学習し、流暢で自信に満ちた、しばしば説得力のある回答を生成できる大規模言語モデルに基づいています。しかし、学生がまだ答えを知らない問いを投げかけたとき、明確なリスクが生じます。それは、彼らにはその回答を検証するための知識が欠けているということです。もしシステムが事実を捏造した場合、その誤りは見過ごされ、学生は誤ったことを学んでしまいます。これを解決するために、研究者たちは「検索拡張生成(RAG)」と呼ばれる手法を開発しました。モデルの内部メモリだけに頼るのではなく、システムは回答する前に、まず学校の教科書のような信頼できる特定の文書を検索して、関連する一節を見つけ出します。これにより、回答が現実に基づいたものになりますが、完璧が保証されるわけではありません。システムは依然として正しい一節を見つけることに失敗したり、正しい一節を見つけたにもかかわらずそれを無視したり、あるいは見つけた内容を誤解したりすることがあります。

この不確実性は、数百万人によって話されているものの、人工知能の世界では「低リソース」と見なされている言語であるウズベク語において、特に深刻です。英語とは異なり、これらのモデルの学習に使用されるデータは、英語が支配的である一方で、ウズベク語で利用可能なデジタルテキストは少なくなっています。さらに、ウズベク語は膠着語であり、一つの語根に多くの異なる接尾辞を付けることで、膨大な数の表面形態を作り出すことができます。例えば、「独立」について尋ねる学生が、教科書で使われているものとは全く異なる形態の単語を使った場合、検索システムはその答えを見落としてしまう可能性があります。これまで、これらのシステムがウズベクの歴史に対してどの程度うまく機能するかをテストしたり、どの程度の頻度で作り話をするかを測定したりするための標準的な方法はありませんでした。

独立系研究者であるルズィンボイ・ホルムロトフによる最近の研究は、1917年から1991年までを扱う公式の第10学年歴史教科書に基づいた「UzHistQA」という特定のテストセットを構築することで、この空白を埋めました。研究者は教科書を分析し、重大な言語的障壁を発見しました。書物内の約31,000語のうち、半数以上の固有の単語形態が一度しか登場しなかったのです。この極端な多様性は、単純な単語の完全一致による検索が失敗する可能性が高いことを意味しています。これを克服する方法をテストするため、研究は56の質問を作成しました。これには、教科書ではどうしても答えられない質問も含まれており、システムが自らの無知を認めるのか、それとも回答を捏造するのかを確認することを目的としています。その後、研究者は4つの異なるシステムの実行方法を比較しました。一つは内部メモリのみに依存するもの、一つは標準的なセマンティック検索を用いて教科書を検索するもの、一つはそれをキーワード検索と組み合わせたもの、そして最後は、出典を明記し、証拠が見当たらない場合は回答を拒否するように厳格に指示されたバージョンです。

結果は衝撃的なものでした。システムが教科書を見ることなく内部メモリのみに頼った場合、回答の91パーセントにおいて、根拠のない主張や捏造された主張が行われました。教科書がカバーしていない質問に対して、日付、名前、リストなどを自信満々に捏造したのです。システムがまず教科書を見るように強制された場合、これらの根拠のない主張の割合は9パーセントへと劇的に減少しました。これは、回答を実際のテキストに基づかせることが信頼性に不可欠であることを裏付けました。しかし、研究はまた、驚くべき複雑な事実も明らかにしました。最も洗練された検索方法(セマンティックな理解とキーワードのマッチングを組み合わせたもの)を使用したバージョンは、単純な検索よりも正しい一節をより多く見つけ出しました。それにもかかわらず、この高度なシステムは、単純なシステムよりも多くの根拠のない主張を生み出したのです。システムがより広範で多様な一節を検索した結果、追加の情報がモデルを混乱させ、たとえ事実がそこに存在していたとしても、誤った推論や計算を行わせてしまったようです。

安全性にとって最も効果的な構成は、厳格なルールを課したもの、すなわち、すべての主張に対して特定の見出し(ページ)を引用しなければならず、教科書に答えが含まれていない場合は「分かりません」と言うように指示されたものでした。このアプローチにより、教科書が答えられない質問に対する捏造された回答はすべて排除されました。代償として、システムは回答できるはずの質問の14パーセントを拒否しました。時には、検索されたテキストの中に答えが存在する場合でさえもです。研究者は、教育現場においては、この拒否こそが必要な機能であると結論付けています。学生は「分かりません」という回答を受け取れば教師に助けを求めることができますが、自信に満ちた捏造された回答を受け取った場合、それが間違いであると知る術はなく、誤ったことを学んでしまうからです。この研究は、検索拡張生成がウズベクの教育においてこれらのシステムを実用的なものにする一方で、システムが幻覚(ハルシネーション)を起こすのを防ぐための慎重な設計が必要であることを確立しており、また、適切な情報を見つけることと正しい回答を書くことは、それぞれ独立して測定されるべき二つの異なる課題であることを浮き彫りにしています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →