Does Less Hallucination Mean Less Creativity? An Empirical Investigation in LLMs
この実証的研究は、3つのハルシネーション抑制技術(Chain of Verification、Decoding by Contrasting Layers、およびRetrieval-Augmented Generation)がLLMの創造性に与える影響を調査しており、Chain of Verificationが拡散的思考を強化する一方で、Decoding by Contrasting Layersはそれを抑制し、Retrieval-Augmented Generationは最小限の影響しか与えないことを明らかにしており、それによって科学的応用における事実の正確性と創造的な探索のバランスを取るための極めて重要な指針を提示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたのチームには、物語を書いたりパズルを解いたりするのが得意な、非常に賢くてクリエイティブなロボット(大規模言語モデル、LLM)の集団がいます。しかし、時々、これらのロボットは少し想像力が豊かになりすぎて、事実ではないことを作り出してしまうことがあります。テックの世界では、これを「ハルシネーション(幻覚)」と呼びます。
科学者たちは、このロボットたちが嘘をつくのを防ぐために「ファクトチェッカー(事実確認ツール)」を作ろうとしてきました。しかし、この論文は次のような大きな、そして興味深い問いを投げかけています。もし、私たちがロボットに対して「100%事実に基づいたもの」であることを強制したら、私たちは図らずも彼らの創造性を殺してしまうのではないか?
ジャズミュージシャンを例に考えてみましょう。もしあなたが彼らに、「楽譜に書かれた音符だけを演奏しなさい」と言ったら、彼らは決して間違いを犯さないかもしれませんが、同時に、美しく新しいメロディを生み出すことも二度とできなくなるかもしれません。
研究者たちは、3つの異なる「ファクトチェック」ツールを用いて、以下のような結果を見出しました。
1. 「問いかけ」ツール(Chain of Verification / CoVe)
比喩: ある作家が物語を書き終えた後、立ち止まって自分自身にこう問いかける場面を想像してください。「待てよ、これは本当に筋が通っているだろうか? もし別の結末にしてみたらどうなるだろうか?」 彼らは質問を書き出し、それに答え、そして物語を書き直します。
結果: このツールは、ロボットをよりクリエイティブにする助けとなりました。
ロボットに自らのアイデアを疑わせるプロセスを強制することで、ロボットは単に安全で退屈な回答に固執するのではなく、より多くの経路を探索し、よりユニークで多様なアイデアを生み出すことができました。これは、問いかけのプロセスがロボットの「視野狭窄(トンネルビジョン)」を打破し、新しい可能性を見せるきっかけとなったのです。
2. 「レイヤー対比」ツール(Decoding by Contrasting Layers / DoLa)
比喩: ロボットの脳には、多層階のビルディングのように多くのレイヤー(層)があると考えてください。下の階では、ロボットは基本的なパターン(例:「猫には毛が生えている」)を学習します。そして上の階では、それらをすべて統合して最終的な決定を下します。
このツールは、「初期の思考(下の階)」と「最終的な思考(上の階)」を比較することで機能します。もし初期の思考があまりにも突飛であったり、最終的な決定と大きく異なっていたりする場合、このツールはその差分を差し引くことで、最終的な回答をより事実に基づいたものにします。
結果: このツールは、創造性を抑え込んでしまいました。
研究者たちは、「突飛でクリエイティブな」アイデアの多くが、これら下の階に存在していることを発見しました。事実に基づいた回答にするために下の階の要素を差し引くと、創造性に必要な材料そのものを誤って取り除いてしまうのです。これは、スープを美味しくしようとしてスパイスを取り除くようなものです。より安全で味気ないスープは手に入りますが、風味(味わい)は失われてしまいます。
3. 「図書館」ツール(Retrieval-Augmented Generation / RAG)
比喩: ロボットがテストを受けている場面を想像してください。ただし、記憶に頼るのではなく、回答を書く前に図書館にある本で調べ学習をすることが許可されています。
結果: このツールは、創造性にほとんど影響を与えませんでした(良くも悪くも)。
ロボットはよりクリエイティブになったわけでも、逆に創造性が低くなったわけでもありません。研究者たちは、使用された「図書館」が技術マニュアルやコードのチュートリアルで満たされていたため、ロボットが解こうとしていたクリエイティブな物語やパズルとは一致しなかったのだと考えています。それは、自動車部品の辞書を使って詩を書こうとしているようなものです。情報はそこにありますが、新しいアイデアを刺激する助けにはなりません。
大きな教訓
この研究の最も驚くべき部分は、「事実であること」と「クリエイティブであること」は同じではないということです。
- 収束的思考(正しい答えに辿り着くこと): 3つのツールすべてが、ロボットが正しく問題を解く能力を維持していることを示しました。ルールに従う能力を壊すことはありませんでした。
- 拡散的思考(新しいアイデアを生み出すこと): ここで、ツールによって反応が分かれました。
- CoVe(問いかけ)は、ロボットをよりクリエイティブにしました。
- DoLa(レイヤー対比)は、ロボットをより少なくクリエイティブにしました。
- RAG(図書館)は、ほとんど変化を与えませんでした。
な なぜこれが重要なのか?
研究者たちは、さまざまなサイズのロボット(小型から巨大まで)や、異なる種類のロボット(LLaMA, Qwen, Mistral)でテストを行いました。結果はすべてにおいて同様でした。
これは、科学的発見(正確さと同時に、突飛で新しいアイデアの両方が必要とされる分野)にAIを利用したい場合、どのファクトチェッカーを選ぶかに細心の注意を払わなければならないことを教えてくれます。もし間違ったもの(DoLaのようなもの)を選べば、完璧に正確だが完全に退屈なロボットを手に入れることになるでしょう。もし正しいもの(CoVeのようなもの)を選べば、正確でありながら、驚くほど独創的なロボットを手に入れることができるかもしれません。
要するに、「賢さ」と「創造性」のどちらかを選ぶ必要はありませんが、両方を生き残らせるためには、正しいツールを選ぶ必要があるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。