Emulate or Estimate? The Divergent Strengths of Base and Post-Trained Language Models for Opinion Simulation
本論文は、意見シミュレーションにおける大規模言語モデルの使用に関する相反する知見を、「エミュレーション」(個別の応答の生成)と「エスティメーション」(分布の予測)を区別することによって解決し、ベースモデルは前者において優れ、事後学習済みモデルは後者において優れていることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
群衆の全員に個別に尋ねることなく、その場の雰囲気を理解しようとしている場面を想像してみてください。あなたは数人にどう感じているかを聞くかもしれませんし、あるいは専門家に全体の雰囲気をご教示いただくかもしれません。これは、科学者が人工知能(AI)を使って人間の意見をシミュレートしようとする際に直面する、まさにそのようなパズルのような問題です。コンピュータサイエンスの世界、特に「自然言語処理」と呼ばれる分野において、研究者たちはインターネット上のほぼすべての文章を読み込ませた巨大なAIモデルを構築しています。これらのモデルは次に続く言葉を予測することに非常に長けており、それゆえに、まるで本物の人間であるかのように振る舞えるように見えます。しかし、ここが厄介な点です。AIが説得力のある物語を書けるからといって、それが必ずしも集団がどのように投票するか、経済についてどう感じるか、あるいは調査にどう回答するかを正確に予測できるとは限らないのです。現在、科学者たちの間では、これらのAIによる「擬似的な人間」が、実際に人間の多様性を模倣できているのか、それとも単に何かのふりをしているだけなのかという議論が巻き起こっています。
この論文は、この議論に踏み込み、ある謎を解明しようとしています。なぜ、AIが人間の意見をシミュレートすることに優れていると言う研究もあれば、惨めに失敗していると言う研究もあるのでしょうか?クイーンズ大学とトロント大学の研究者である著者らは、その混乱の原因は、二つの非常によく異なる役割を混同していることにあると示唆しています。彼らは最初の役割を**エミュレーション(模倣)と呼びました。これは、特定のキャラクターを演じるために俳優を雇うようなものです。AIは実在の人物であるかのように単一の回答を生成し、十分な数の「俳優」に問いかければ、彼らの回答を積み上げることで、自然と群衆の意見の形が見えてきます。二つ目の役割はエスティメーション(推定)**です。これは、統計学者が群衆を見て、単に「おそらく60%の人が選択肢Aを選ぶだろう」と言うようなものです。研究者たちは、このアイデアを検証するために、「ベース・モデル」(未加工で洗練されていないバージョン)と「ポスト・トレーニング済みモデル」(役に立つアシスタントとして微調整されたバージョン)という二種類のAIを戦わせることでテストを行いました。
ピュー・リサーチ・センターの実在の調査データを用いて行われた実験の結果、才能の明確な分かれ目が明らかになりました。タスクがエミュレーション(個々のテキスト回答を生成して、それらを積み上げて群衆がどのような姿になるかを見る)であった場合、ベース・モデルが勝者となりました。ベース・モデルは、より実在の人間のデータに近い回答を生成し、グループ間の違い(民主党支持者対共和党支持者、あるいは富裕層対貧困層など)をより明確に維持することに成功しました。実際、「ポスト・トレーニング済み」のモデルは、著者らが「ペルソナ崩壊」と呼ぶ現象に陥ることがよくありました。これは、彼らが皆同じように聞こえ始め、まるでクローンたちの合唱のように、現実の人々が持つ多様な個性を失ってしまう現象です。
しかし、タスクがエスティメーションになると、物語は一変します。単にAIに対して「この回答を選択する人の割合を予測してください」と求めた場合、ポスト・トレーニング済みモデルが輝きを放ちました。彼らは直接、正しい数値を提示することにおいて非常に優れていました。生のベース・モデルもこれを行うことはできましたが、洗練された「役に立つアシスタント」の方が、一つの文章を生成することなく、分布を推測する上で大幅に正確でした。
著者らは、これが起こる理由として、「ポスト・トレーニング」のプロセスがAIに「役に立つアシスタント」であることを教えているからだと示唆しています。アシスタントに群衆の意見を推測させる際、AIは自身の知識を用いて、スマートで直接的な答えを出します。しかし、その同じアシスタントに「特定の人物のように振る舞って」と頼むと、AIは「役に立つアシスタント」という役割に囚われてしまい、その結果、あまりにも均質になり、異なる属性による独特の癖を失ってしまうのです。一方で、生のベース・モデルは、単一の「アシスタント」という箱の中に押し込められていないため、テキストを生成するように求められた際、より広範で混沌とした人間の声の中から引き出すことができるのです。
したがって、この論文は、人間のシミュレーションにおいて唯一絶対の「最高のAI」というものは存在しないと結論づけています。もし、多様な人々のテキストを生成する必要がある場合(ビデオゲームや社会科学のシミュレーションなどの場合)、生のベース・モデルを使用すべきです。しかし、もし単にグループがどのように考えるかの迅速かつ正確な予測が必要なのであれば、洗練されたポスト・トレーニング済みモデルに推定させるべきです。この分野の混乱は、ある種のAIが壊れていたからではなく、研究者たちがそれぞれの特定の仕事に対して、間違った道具を使っていたために起こったのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。