Readable, Faithful, Used: Three Dissociable Properties of Demographic Identity in a Language Model
本論文は、大規模言語モデルにおいて、人口統計学的アイデンティティの特性である「読み取り可能性」、「忠実な構造化」、および「因果的な使用」が、これら三つが解離した現象であることを示しており、特定のアテンションヘッドが調査結果のような集団間の差異を高精度にエンコードできる一方で、このエンコーディングが必ずしもモデルの応答生成における実際の因果的な使用へと翻訳されるわけではないことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデルは、社会科学研究において人間の代役を務めるよう、ますます多く求められるようになっている。政治、宗教、あるいは経済について異なるグループがどのように感じているかを理解するために、何千人もの実在の人物にインタビューを行うために数ヶ月と数百万ドルを費やす代わりに、研究者はコンピュータプログラムにそれらの回答をシミュレートさせるだけで済む。その期待は、これらのデジタル・サロゲート(代理人)が、現実の調査と同じように、若い民主党員と年配の共和党員の間、あるいはヒンドゥー教徒とキリスト教徒の間の微妙な違いを捉えられるというものである。しかし、こうしたシミュレーションが失敗していることを示唆する証拠が増えつつある。コンピュータの回答は、プロンプトに付与されたデモグラフィック(人口統計学的)なラベルに関わらず、あまりにも一様で、同意しやすく、互いに似通ってしまう傾向があるのだ。中心的な謎は、この失敗が、モデルが単にグループ間の違いを知らないために起こるのか、それとも違いを知っているものの、話す際にそれを使用しないことを選択しているために起こるのか、という点にある。
これを解決するために、ある研究者が、大規模言語モデルの「脳」の内部を調べ、デモグラフィックな情報が実際にどこに存在しているのかを探ることにした。この調査では、特定のモデルであるMistal-7Bに焦点を当て、3つの明確な問いを投げかけた。第一に、回答者が誰であるかに関する情報は、モデルの内部信号から読み取れるのか? 第二に、その情報は、コンピュータの思考における2つのグループ間の距離が現実の世界における距離と一致するように、現実の世界を反映した形で配置されているのか? そして第三に、モデルは回答を生成する際に、実際にこの内部マップを使用しているのか? 研究者たちは、モデルが意見を形成するために内部マップを一度も参照することなく、忠実な内部マップを保持している可能性があることを認識し、これら3つの問いを別々の特性として扱った。
研究者たちはまず、モデルの内部景観のマッピングを開始した。彼らは「若いアジア系民主党員」や「中年層のヒンドゥー教徒の共和党員」といった169の異なるインターセクショナル(交差的)なグループのプロンプトを作成し、処理の最後におけるモデルの内部状態を検証した。彼らは、モデルの内部的な配置を、現実のグループが実際にどのように意見を変えるかという「真実」を提供するピュー・リサーチ・センターの実際の調査データと比較した。結果として、モデルの心を読み取る標準的な方法、すなわち最終出力層を見ることは、誤解を招くほど弱いことが明らかになった。それは、モデルがデモグラフィックな違いに対して、ぼやけた不明瞭な見方をしていることを示唆していた。しかし、研究者がより深く、モデルの処理を構成する特定のコンポーネントへと目を向けると、より鮮明な姿が見えてきた。
情報は失われていたのではなく、単に特定の狭いチャネルの中に隠されていたのだ。研究によれば、モデルの内部幾何学は、モデル内の特殊なサブプロセッサである個別の「アテンション・ヘッド(注意機構の頭部)」によって支配されている。テストされた6種類のデモグラフィック属性のうち5種類において、単一の最適なアテンション・ヘッドは、モデルの最終出力層全体よりも、グループ間の違いをはるかに正確に描き出していた。モデルの第11層に位置する特定のアテンション・ヘッドは、驚くほど忠実であるとして際立っていた。それは、年齢、教育、所得、宗教、政党、政治的思想という6つのデモグラフィック属性すべてに関する表現を保持しており、それらのグループがどのように異なるかという現実世界の構造と密接に一致していた。この単一のコンポーネントは、調査データ自体に含まれるノイズを考慮した後でも、測定可能な理論的限界の約70%に達する忠実度で、グループ間の関係を配置したマップを保持していたのである。
しかし、モデルの内部に忠実なマップを見つけたことは、モデルがそれを使用していることを意味しなかった。研究者たちは次に、この正確な内部配置が実際にモデルの回答に影響を与えているかどうかをテストした。彼らは、プロンプト内のデモグラフィックなアイデンティティを入れ替え、モデルの予測される意見がどのように変化するかを観察するという因果関係実験を行った。結果は明白であった。プロンプト内の人物のアイデンティティ全体を変更しても、モデルの予測される回答は全誤差の2%未満しか動かなかった。モデルは、異なるグループに対しても、わずかに異なるものの、同様に間違った回答を生成していたのである。さらに驚くべきことに、研究者たちは、最も忠実なマップを持つ場所が、回答を駆動する場所ではないことを見出した。内部状態を実際に変化させることでモデルの予測を真実に近づけることができる最も明確な因果経路は、最も弱い内部マップを持つデモグラフィック属性において発見された。逆に、最も忠実な配置を示した型は、研究者が介入を試みても、検出可能な因果効果を示さなかった。
この乖離は、これらのモデルが人口をシミュレートすることに失敗している理由は、単なる知識の欠如ではないことを示唆している。モデルは、特に政治的および経済的な要因に関して、異なるグループがどのように異なるかについての詳細で正確なマップを保持しているが、人種や宗教に関する理解は弱く不安定である。しかし、モデルは話す際にこのマップを照会していない。内部の幾何学は忠実に配置されているが、出力からは因果的に切り離されているのだ。研究ではまた、その単一の忠実なアテンション・ヘッドに対して数学的なプローブ(探針)を用いて内部マップを直接読み取ると、モデル自身の生成した回答よりも、現実の調査の真実に21%から31%近い結果が得られることも分かった。しかし、この優れた読み出しであっても、個別の質問に対する意見の具体的な順序を、モデル自身の欠陥のある回答よりも良く予測することはできなかった。
これらの知見が持つ意味は、人工知能を用いて人間社会を理解しようとするすべての人にとって重大である。本研究は、モデルに特定の人物のように振る舞うようプロンプトで指示できるからといって、人口をシミュレートできると仮定することはできないことを実証している。モデルはその知識を保持しているが、研究者が期待するような方法ではそれを使用していない。さらに、本研究は、デモグラフィックな属性は互換性のあるものではないと警告している。モデルは政治的および経済的なアイデンティティについては強い把握力を持っているが、人種や宗教のアイデンティティに関する理解は脆弱であり、質問のされ方のわずかな変化によって崩れやすい。結論として、モデルの内部知識と外部の振る舞いを同一視することが、これらのモデルが人口をシミュレートできるかどうかの議論を未解決のままにさせている原因である。モデルはマップを持っているが、そのルートに従ってはいないのである。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。