Diagnosing Correctness Probes under Self-Judgement Confounding
本論文は、言語モデルの隠れ状態の読み出しが、客観的な正しさに関連する方向よりも自己判断に関連する方向の方がドメインを越えた転移性に優れているという事実によって裏付けられるように、客観的な正しさではなくモデル自身の自己判断を捉えていることが多いことを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットが真実を語っているのかどうかを見極めようとしている場面を想像してみてください。あなたはロボットに質問をし、ロボットは答えを返します。そして、あなたは判断しなければなりません。その答えは実際に正しいのか、それともロボットが単に「自分は正しい」と自信を持っているだけなのか? これこそが、「メカニスティック・インタープリタビリティ(機械論的解釈可能性)」と呼ばれる新しい科学分野の核心です。研究者たちは、大規模言語モデル(LLM)の「脳」の内部を覗き込み、モデルが本当は何を考えているのかを知ろうとしています。これらのモデルは、詩を書いたり、数学の問題を解いたり、歴史についてチャットしたりできる巨大なデジタルの神託のような存在ですが、時として事実を捏造してしまうことがあります(これは「ハルシネーション(幻覚)」として知られる問題です)。科学者たちは、モデルが回答を終えたまさにその瞬間の内部的な電気信号(「隠れ状態」と呼ばれます)を見ることで、その回答が正しいか間違っているかを予測できることが多いことを発見しました。それは、ロボットの精神の中に組み込まれた嘘発見器を持っているようなものです。しかし、ここが厄意な点です。通常、ロボットが間違った答えを出すとき、ロボット自身も「自分は間違っている」と思っています。そして、正しい答えを出すとき、ロボットは通常「自分は正しい」と思っています。ロボットの内部にある「真実信号」と「自己確信信号」は通常一致しているため、ロボットが実際に真実を検知しているのか、それとも単に自分の意見を検知しているだけなのかを見分けるのが困難でした。
「自己判断の混同下における正誤プローブの診断(Diagnosing Correctness Probes under Self-Judgement Confounding)」と題されたこの論文は、まさにその混乱に対処するものです。Yi-Long Lu氏率いる研究チームは、ロボットの「真実」と「自己確信」が食い違うような特別なテストを構築することに決めました。彼らは、数学的に正しい答えを出した後に「いや、それは間違いだ」と言うシナリオや、間違った答えを出した後に「はい、これは正しいです」と言うシナリオを作成しました。これら2つの信号を強制的に戦わせることで、彼らはついに、内部の「嘘発見器」が実際にどちらの信号を拾い上げているのかを見極めることができたのです。
チームは、70億から140億のパラメータ(これはロボットの脳内の接続数のようなものです)を持つ4つの異なる大規模言語モデルに対してこのテストを行いました。彼らは「要因対比(factorial contrasts)」と呼ばれる巧妙な手法を用いました。これは、混ぜ合わさったスムージーを元のフルーツとミルクに分離して、どちらの味かを特定するようなものです。彼らは、内部信号には真実と確信の両方の情報が含まれているものの、最も信頼性高く転移可能なコンポーネントは、客観的な正しさではなく、ロボットの自己判断の極性を保持しているものであったことを発見しました。
ここで驚くべき展開があります。研究者が、間違った答えを出したが「自分は正しい」と思っているロボットの内部信号を見たところ、その「嘘発見器」は、正しい答えに対するものと同様に、高いスコアを与えたのです。逆に、正しい答えを出したが「自分は間違っている」と思っているロボットに対しては、検出器は低いスコアを与えました。実際、数学の問題、映画のトリビア、一般的な知識クイズを含む、彼らが実施したすべてのモデルとテストにおいて、あるタスクから別のタスクへと最もよく伝達された内部信号は、真実ではなく、ロボットの確信度を追跡するものでした。
この論文は、モデルに見られる「真実」の信号は純粋な客観的事実の尺度である可能性はあるものの、証拠によれば、「転移可能性(transferability)だけでは、客観的な正しさのセマンティクス(意味論)を確立するものではない」と明記しています。たとえ研究者が「正解/不正解」のラベルのみを使用し、ロボットの自己判断を完全に無視して検出器を構築しようとしても、その検出器は依然としてロボットの確信度に従う結果となりました。このことは、モデルに見られる「真実」とは、実際の事実に関するものではなく、モデルが自身の出力に対してどのように感じているかに関するものである可能性を示唆しています。著者らは、ある信号がタスク間で転移可能であるからといって、それが真実を表しているとは限らないと結論付けています。それは単にモデル自身の意見を表しているだけかもしれません。したがって、私たちはロボットの脳を覗き見て、それが自信を持っているかどうかを知ることはできますが、その自信が真実を語っているかどうかについては、まだ確信を持つことはできません。この研究は、これらのモデルから読み取れる最も信頼できるものは、客観的な現実チェックではなく、彼ら自身の自己評価であるということを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。