The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models
本論文は、言語モデルにおける真実性の内部表現が、クラスの重心によって定義される単純かつ低次元な幾何学的構造を形成しており、それが線形プローブや活性化ステアリングを通じたハルシネーションの極めて効果的な検出および因果的操作を可能にしていることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、あらゆる本を読み尽くした、非常に賢く、非常に高速なロボットと話していると想像してください。あなたは質問をし、ロボットは完璧な文法と絶対的な自信を持って答えます。しかし、時としてそのロボットは間違えることがあります。例えば、オーストラリアの首都はシドニーであると教えるかもしれません(実際にはキャンベラです)。あるいは、有名な歴史的人物について、間違った世紀に生まれたと述べるかもしれません。恐ろしいのは、ロボットが嘘をついているときも、真実を語っているときと同じように自信満々に聞こえることです。言葉に詰まることも、ためらうこともありません。そして、その「自信メーター」(内部で計算されている数値)も正常に見えます。
長い間、科学者たちは疑問に思ってきました。ロボットは、たとえ口に出さなくても、自分が間違っていることを「知って」いるのだろうか? その脳の奥深くに、「おい、この事実は偽りだ!」と告げる秘密の信号が隠されているのだろうか? これを理解するためには、まずこのロボットがどのように機能しているかを知る必要があります。彼らは人間のように思考するのではなく、「活性化(アクティベーション)」と呼ばれる巨大な数値の雲として情報を処理します。ロボットが文章を読み、思考するにつれて、これらの数値はデジタルネットワークの層を流れていきます。科学者たちは、これらの数値の雲が単なるランダムなものではないことを発見しました。それらは形や構造を持っています。時には、真実の事実と嘘の違いは、複雑で乱雑なパターンではなく、デジタル空間における単純な一本の直線であることもあります。大きな問いは、その「線」を見つけ出し、ロボットが文章を言い終える前に、その嘘を見抜くことができるか、ということです。
これこそが、論文「The Confidence Manifold(信頼の多様体)」が探求しようとしている内容です。チョン・ソンレ氏率いる研究チームは、1億2400万個のパラメータを持つ小さなモデルから、140億個のパラメータを持つ巨大なものまで、11種類の異なる言語モデルを対象に調査を行いました。彼らは、ロボットの脳の中で「正しさの幾何学」——すなわち、真実がどこに存在するのかという特定の形状と位置——をマッピングしようとしたのです。
ロボットの脳を、巨大で多次元的な部屋だと考えてみてください。ロボットが文章について考えるたびに、その部屋の中に点が打たれます。もし文章が真実であれば、点はある領域に落ちます。もし偽りであれば、別の領域に落ちます。研究者たちは、これらの点が部屋の中にランダムに散らばっているわけではないことを発見しました。代わりに、それらはまるで2つのマーブルの山のように、2つの明確なグループに整然と整理されています。「真実」の山と「り」の山は、非常に単純で低次元な廊下によって隔てられています。
ここで最も驚くべきことは、これらの山を見分けるために超高性能なコンピュータは必要ないということです。研究者たちは、真実と偽りの文の差は、単なるドット(点)の平均位置のシフトに過ぎないことを発見しました。それは、赤色のマーブルの袋と青色のマーブルの袋を持っているようなものです。すべてのマーブルの大きさ、重さ、質感を知る必要はなく、単に赤色のものは平均してわずかに左側にあり、青色のものはわずかに右側にある、ということを知っていればよいのです。ロボットの脳において、この「平均的な位置(重心)」こそが重要なのです。研究者たちは、これら2つの中心を見つけるためにわずか25個のラベル付き例を用いるだけで、90%の精度で嘘を検知できることを発見しました。さらに優れたことに、この「真実の信号」は、ロボットの脳が数千もの次元を持って遊んでいるにもかかわらず、わずか2から8次元という極めて小さな廊下にしか存在しないことも分かりました。
チームはただ観察しただけでなく、この信号が本物かどうかを確認するために、ロボットを突いたりつついたりもしました。彼らは「活性化ステアリング(activation steering)」という手法を用いました。これは、ロボットの内部数値を特定の方向に優しく押し動かすようなものです。彼らがロボットを「真実」の方向へと押し動かすと、ミスが減少しました。逆に「嘘」の方向へと押し動かすと、幻覚(ハルシネーション)が増えました。また、特定の廊下を削除することで、その信号を完全に消去しようと試みました。すると、突然、ロボットは真実と嘘を区別することが全くできなくなり、ランダムに推測する場合と変わらない性能になりました。これは、信号が単なる偶然ではなく、ロボットが事実を処理する方法において不可欠な要素であることを証明しました。
しかし、この論文は、これがあらゆる状況における魔法の杖ではないことも警告しています。研究者たちは、ロボットがトリッキーな振る舞いをしているとき——例えば、一般的な誤解を自信満々に述べているときなど——には、この内部的な「真実検出器」が非常にうまく機能することを発見しました。しかし、ロボットが誰かを騙そうとしていない標準的で退屈な質問においては、ロボット自身の出力(それが口に出す言葉)だけで真実を判断するのに十分なのです。内部信号は、ロボットが欺瞞的な態度をとっているときに最も輝きます。
もう一つの興味深い発見は、これらの信号が異なる種類の質問間でどのように移動するかについてです。もし、ある特定のデータセット(歴史に関するクイズなど)に対してロボットに嘘を見抜く方法を教えたとしても、同時に両方のデータセットで訓練しない限り、別のデータセット(科学に関するクイズなど)での嘘を見抜くことはできないかもしれません。それは、サーキットで車の運転を学ぶことが、必ずしも雪の街での運転に長けていることを意味しないのと似ています。両方の練習が必要です。研究者たちは、複数のデータセットを同時に用いて検出器を訓練することで、異なるトピックを横断して機能する普遍的な「真実のコンパス」を作成できることを示しました。
結局のところ、この論文は言語モデルがどのように真実を扱うかについて、より明確なイメージを与えてくれます。それは、これらの複雑な機械の奥深くでは、正しさと間違いの違いは驚くほど単純であり、単にデータが線のどちら側に落ちるかという問題であることを示唆しています。これは、あらゆる状況においてロボットの嘘を即座に修正できることを意味するわけではありませんが、ロボットはたとえそれを認めなくても、自分が間違っていることを「知って」いるのだということを証明しています。信号はそこに存在し、それは幾何学的であり、そして発見されるのを待っているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。