Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory
本論文は、大規模言語モデルが自己生成したコンテンツとユーザー入力を区別する能力(リアリティ・モニタリング)が会話メモリの構造に強く依存していることを示しており、エピソード的遅延によって性能が低下すること、および既存のベンチマークは、モデルが自律的なマルチターン・ロールを担う際に生じる正確性と確信度の間の決定的な解離を捉えきれていないことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
巨大で賑やかな図書館を歩いているところを想像してみてください。そこでは本があなたに話しかけてきます。ある本は事実をささやき、またある本は自分のページに新しい物語を自ら書き始めたりします。人間の心理学の世界には、「現実モニタリング(reality monitoring)」というスーパーパワーがあります。それは、「待てよ、今のは友達から聞いたことか、それとも自分が想像したことか?」と判断できる心の筋肉です。もしこの筋肉が弱まると、人々は自分の空想を現実のニュースだと信じ込んでしまったり、医師が言った重要なことを忘れてしまったりするかもしれません。これは単に事実を覚えることではなく、自分の思考がどこから来たのかを知ることなのです。
さて、このスーパーパワーのテストを、非常に賢いコンピュータプログラム、つまり「大規模言語モデル(LLM)」に課してみたとしましょう。これらは物語を書き、問題を解決し、私たちとチャットをするAIの脳です。私たちは、彼らが会話をする能力が向上していることは知っていますが、果たして彼らは「自分が作り出したもの」と「あなたが教えてくれたこと」の違いを判別できるのでしょうか?もしAIがその違いを理解できなければ、自分自身の間違いを、あなたが与えた事実であると誤解したり、あなたが訂正しようとした時に混乱したりする可能性があります。この論文は、シンプルかつ極めて重要な問いを投げかけます。AIの脳は、特に長い会話を記憶しなければならない状況において、自分自身の思考と周囲の世界を区別できるのか?という問いです。
「誰が何を言ったか?」の大テスト
研究者たちは、その答えを見つけるためのゲームを用意しました。彼らは6つの異なるAIモデルに、一連の単語のペアを与えました。時々、AIには完全なペア(例えば「猫」と「ネズミ」)が示され、AIはただ二番目の単語を繰り返すだけで済みました。これは、AIが外の世界から何かを「聞いた」状態です。また別の時には、AIには最初の単語(「猫」)だけが示され、AIは自分で二番目の単語を考え出さなければなりませんでした。これは、AIが何かを「想像した」状態です。その後、AIは探偵役を務めなければなりません。「私は今、この言葉を聞いたのか、それとも自分で作り出したのか?」
科学者たちは、会話が短く簡潔な場合、そして、友人との何時間も続くような長く混沌としたリアルなチャットのように、会話が長く複雑になった場合でも、AIがこれを実行できるかどうかを確認したいと考えました。
驚きの結果:すべては記憶のトリックによるもの
ここからが非常に奇妙な展開です。AIが素早い、一回限りの会話(テキストメッセージのようなもの)の中でテストされたとき、AIは自分が作り出したものを知る天才でした。自分自身が「想像した」単語について、100%の正解率を叩き出したのです!それはまるで、絵を描いた直後に「これは私が描いたんだ!」と即座に理解している子供のようでした。
しかし、研究者がAIに対し、会話の最初の方に出てきた長い単語リストを覚えておくように指示した(「遅延」テストを行った)途端、その手品は崩れ去りました。突然、AIは混乱し始めたのです。AIは以前とは逆の現象を起こしました。あなたが教えてくれたことを思い出す能力は上がりましたが、自分が作り出したものを思い出す能力はひどく低下したのです。それはまるで、AIが自分がアーティストであることを忘れ、ただ目に見えるものすべてを映し出す鏡になってしまったかのようでした。
研究者たちは、これが単にAIの「脳の大きさ」の問題ではないことを突き止めました。700億のパラメータを持つ巨大なAIが、必ずしも小さなAIよりも優れた結果を出したわけではありません。むしろ、それはAIの内部にある「専門家チーム」がどのように組織されているかに依存しているようでした。それは、より大きな図書館を持つことの問題ではなく、司書たちがどのように配置されているかという問題なのです。
フィードバックの罠:訂正が状況を悪化させる時
科学者たちはまた、新しい手法も試しました。それは、AIが推測を行うたびに、それが正しいか間違っているかを伝えるというものです。こうすれば、先生が学生を指導するように、助けになると思うでしょう?
驚いたことに、一部のAIにとっては、このフィードバックは事態を悪化させました。それは間違いを修正するだけでなく、彼らの自信をかき乱したのです。いくつかのモデルは、正解は導き出せるようになったものの、「自分が正しい」という認識を失ってしまいました。彼らは、自分が間違っているときでさえ、自分が正しいと100%確信している人のようになってしまったのです。実際、ある特定のモデルにおいては、フィードバックによって脳が裏返されたかのように、真実とは正反対のことを自信満々に述べるようになりました。
この研究は、私たちがこれらのAIを医師や弁護士を助けるような本格的な長期的な仕事で使い始めるにあたって、「答えを知っているか?」と問うだけでは不十分であることを示唆しています。「その答えをどこから得たのかを知っているか?」と問わなければなりません。なぜなら、もしAIが自分自身の「幻覚(ハルシネーション)」とあなたの「真実の事実」を区別できないのであれば、自信満々に私たちを誤った道へと導いてしまう可能性があるからです。この論文は、単にAIを大きくすることが解決策ではないことを示唆しています。必要なのは、特に会話が長く複雑になったときに、彼らが自分自身の思考の明確な日記を保持できるようにする方法を見つけ出すことなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。