Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models
本論文は、アテンションマップ、トークン確率、および再帰的に計算された不確実性スコアを用いて回帰モデルを学習させることで大規模言語モデルの不確実性を定量化する新規手法を提案し、これにより複数のデータセットおよびモデルにわたって幻覚を効果的に検出し、選択的生成を改善することを目的としている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢く、早口で話すロボットがあなたに物語を語る場面を想像してください。このロボットは文を作るのが得意ですが、実際には間違っていることについても自信を持って話してしまうことがあります(これらは「ハルシネーション」と呼ばれます)。
問題は、ロボット自身が嘘をついていることに気づいていないことです。ただ話し続け、もし物語の序盤で間違いを犯せば、その間違いの上に物語を積み重ねるにつれて、さらに自信を深めてしまいます。これは「伝言ゲーム」のようであり、最初の人が間違った事実をささやき、他の人々がそれを次第に自信を深めながら繰り返していく様子に似ています。
問題:ロボットの盲点
ロボットが嘘をついているかどうかをチェックする現在の手法は、通常、ロボットが言う各単語に対する「信頼度スコア」を調べます。しかし、これは厄介です。ロボットが「空は緑である」と言っても、次の単語「草」に対しては、自分の論理に従っているだけなので、非常に自信を持っているかもしれません。ロボットは、その文全体が嘘の上に成り立っていることに気づいていません。
この論文の著者たちは、これを「条件依存性」の問題と呼んでいます。ロボットの次の単語に対する信頼度は、たとえその前の単語が間違いだったとしても、完全に前の単語に依存しています。
解決策:TAD(学習可能なアテンションベースの依存関係)
研究者たちは、新しいツール「TAD」を開発しました。TAD は、ロボットが単語を一つずつ書くのを隣で監視する「超知能の編集者」と考えてください。
以下は、いくつかの簡単な比喩を用いた編集者の仕組みです。
- 「視線」(アテンション): ロボットが話すとき、次の言葉を決めるために過去の単語を「見つめています」。研究者たちは、ロボットが真実を語っているときはその「視線」(アテンション)が安定して焦点を合わせているのに対し、ハルシネーションを始めると視線が揺れたり混乱したりすることに気づきました。TAD はこの視線を注意深く監視します。
- 「連鎖反応」(再帰性): 編集者は現在の単語だけを見るのではなく、過去の単語の「不確実性」を記憶しています。もしロボットが 1 番目の単語でつまずいたなら、編集者はロボットがそれらに対して自信を持っていても、2 番目、3 番目、4 番目の単語を疑わしいものとしてマークします。これは、生徒が数学の問題の最初のステップを間違えたなら、解答がどれだけ綺麗に書かれていようとも、最終的な答えも間違いである可能性が高いと知っている教師のようです。
- 「二段階トレーニング」: この編集者を教えるために、研究者たちは二段階のプロセスを用いました。
- ステップ 1: 編集者に、ロボットの生身の信頼度だけを使って間違いを見つけることを教えました。
- ステップ 2: 編集者に、ステップ 1 で得た自らの「勘」を使って、さらに良く学習させるようにしました。これはスポーツの練習に似ています。まず基本の動きを学び、次に自分の前の動きに反応しながら試合全体をプレイして練習するのです。
テスト方法
彼らは、ニュース記事の要約から難しい雑学クイズへの回答まで、10 種類の異なるタスクでこの編集者をテストしました。使用されたロボット(LLaMA、Gemma、Qwen)は 3 つの異なるバージョンです。
- 結果: TAD は、彼らが試した他のどの手法よりも、ロボットの嘘を見抜くのに優れていました。特に、長い物語が軌道から外れた瞬間を特定するのが得意でした。
- 効率性: 答えを 5 回も「考えさせる」他の手法(これは遅く、高コストです)とは異なり、TAD は非常に高速です。ロボットの思考プロセスに追加されるのはわずか5% の時間です。物語全体を書き直すようロボットに頼む代わりに、素早く二度見をするようなものです。
結論
この論文は、コンピュータモデルに、ロボットが自身の過去の単語を「どのように」見つめているかに注意を向けさせ、文の序盤で犯された間違いを記憶させることで、AI 用のはるかに優れた「嘘発見器」を構築できると主張しています。これにより、速度を大幅に落とすことなく、特に長い回答において AI をより安全で信頼性の高いものにするのです。
この論文が主張していないこと
- これはあらゆる状況におけるあらゆる種類の AI に機能すると主張しているわけではありません(特定のモデルとタスクでテストされました)。
- これは医療ツールや法廷の裁判官であると主張しているわけではありません。
- AI が二度と間違いを犯さなくなると主張しているわけではありません。このツールは間違いをよりよく「発見」し、それらをフィルタリングできるようにするだけであると主張しているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。