← 最新の論文
💬 NLP

Finetuning with Scientific Data Increases Hallucinations: A Multi-domain Factuality Evaluation of LLMs

本論文は、科学分野へのファインチューニングが、大規模言語モデルにおけるハルシネーションと断定的な表現を逆説的に増加させる一方で、内部的な確信度を低下させることを明らかにするマルチドメイン・ベンチマークであるSciFactCheckを紹介し、事実性を向上させるための現在のドメイン特化型ファインチューニングのアプローチに異を唱えるものである。

原著者: Raia Abu Ahmad, Nikolas Rauscher, Ekaterina Borisova, Fabio Barth, Georg Rehm, Sebastian Möller

公開日 2026-06-23
📖 1 分で読めます☕ さくっと読める

原著者: Raia Abu Ahmad, Nikolas Rauscher, Ekaterina Borisova, Fabio Barth, Georg Rehm, Sebastian Möller

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、あらゆる事柄について少しずつ知っている、博識で優秀な司書を雇いました。この司書が、あなたの標準的な大規模言語モデル(LLM)です。彼らはチャットをするのは得意ですが、事実が確信できないときには、時として作り話をすることがあります。これを「ハルシネーション(幻覚)」と呼びます。

ここで、その司書を科学だけを専門とする大学へ送り込み、専門的に勉強させることを考えます。あなたは彼らに、何千冊もの教科書、研究論文、学術誌を与えました。あなたは、彼らが以前よりもさらに信頼できる「科学の専門家」になって戻ってくることを期待しています。

この論文は、その実験に対する成績表ですが、そのニュースは驚くほど悪いものです。

研究者たちは、簡単な比喩を用いて、次のような発見をしました。

1. 「専門家」は真実から遠ざかった

研究者たちは、SCIFACTCHECKと呼ばれる大規模なテストを作成しました。彼らは18種類の異なるAIモデル(汎用モデルと「科学的に訓練された」モデルの両方)に対し、工学から哲学に至るまで、2,500もの異なる科学的トピックについて短いパラグラフを書かせました。

結果: 「科学的」なモデルは、実際には汎用モデルよりも多くの間違いを犯していました。

  • 比喩: それは、一般的なシェフを、スパイスについて学ぶために料理学校へ送るようなものです。あなたは彼らがより料理に詳しくなると期待するでしょうが、実際には、彼らは水の沸かし方を忘れ、あらゆる料理にスパイスを入れすぎてしまいました。専門的なトレーニングは、モデルを混乱させ、汎用モデルよりも基本的な事実における信頼性を低下させてしまったようです。

2. 3種類の「嘘」

この研究は、単に「間違い」を探しただけでなく、どのように間違っているのかを分析しました。彼らは、モデルがハルシネーションを起こす3つの具体的な方法を発見しました。

  • 「検証不能な」嘘(Unverifiability / 検証不能性): モデルが、もっともらしく聞こえるが、どの本や論文にも記載されていない事実を作り上げること。
    • 比喩: 司書が「1995年、秘密の猫の結社がインターネットを支配していた」と言うようなものです。具体的に聞こえますが、そのような記録は存在しません。
  • 「自信過剰な」嘘(Overclaim / 過剰主張): モデルが小さな真実を取り上げ、それを巨大で絶対的な確信へと膨らませること。
    • 比喩: ある研究が「この薬は一部の患者に役立つ可能性がある」と述べているとき、モデルは「この薬はすべての人を治す」と言います。範囲や確実性を誇張しているのです。
  • 「偽の引用」による嘘(Attribution / 属性の捏造): モデルが、自分の主張を裏付けるために架空の出典を捏造すること。
    • 比喩: 司書が「『宇宙物理学ジャーナル』の有名なスミス博士の記事によれば……」と言いますが、その記事も博士も存在しません。

3. 「自信満々だが無知」というパラドックス

最も奇妙な発見の一つは、モデルが自分の答えをどのように「感じて」いるかについてでした。

  • 発見: 科学的に訓練されたモデルは、より自信に満ちた言葉(「間違いなく」「証明された」「常に」といった言葉)を使用していましたが、実際には内部的な自信(コンピュータとしての「直感」)は揺らいでいました
  • 比喩: 数学の問題の答えがわからない学生を想像してください。彼らは「わかりません」と言う代わりに、立ち上がって手を挙げ、「答えはこれだ!」と100%の確信を持って叫びます。彼らは「自信のある科学者のスタイル」を学習しましたが、「実体」を学習していなかったのです。彼らは「声の大きい間違い」を犯しています。

4. 「ファクトチェッカー」の問題

最後に、研究者たちはコンピュータを使ってモデルを採点し、その後、人間の専門家にも採点を行わせました。

  • 結果: コンピュータの採点者と人間の専門家の意見は、必ずしも一致しませんでした。人間でさえ、何が「チェック可能な科学的事実」であるかを定義することに苦労しました。
  • 比喩: それは、審査員たちが体操の演技を採点しようとしているのですが、競技のルールについてさえ意見が一致していないようなものです。数学のような分野では、誰もがルールに同意します。しかし、哲学や社会科学のような分野では、何が「検証可能」であるかを定義することは非常に困難です。

結論

この論文は、単に科学の本でAIを訓練することが、必ずしも信頼できる科学の専門家を作るわけではない、と結論付けています。実際には、より正確になるどころか、より自信満々に振る舞いながら正確性に欠けるため、より危険になる可能性があります。私たちは科学的な主張を検証するためのより優れたツールを必要としており、「専門化された」AIは「汎用」AIよりも自動的に優れていると仮定することはできません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →