Instruction-Tuned Language Models Cannot Sample from Distributions They Can Describe
この論文は、指示チューニングされた言語モデルが、アライメント学習によって決定論的な出力へと崩壊しており、応答分布から真にサンプリングすることに失敗している一方で、単一の呼び出しにおいてこれらの分布を正確に記述することはできるという、「KNOWS/DOES(知っている/できる)」のギャップを明らかにしており、これが分布の記述やプロンプトの摂動を通じた、より正確な人間による調査データのシミュレーションを可能にしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、水晶玉に100万個の質問を投げかけることで未来を予測しようとしているところだと想像してみてください。人工知能の世界では、科学者たちは「大規模言語モデル(LLM)」をその水晶玉として使い始めています。政治や映画、経済について人々がどう考えているかを実在の人間に聞く代わりに、研究者たちはAIに「オハイオ州のティーンエイジャー」や「フロリダ州の退職した教師」といった異なるタイプの人間のふりをするよう求めます。これは「シリコン・サンプリング」と呼ばれます。その考え方は単純です。もしAIに千種類の異なる人物を演じさせることができれば、現実の群衆と同じように、千種類の異なる答えが得られるはずだというものです。それらすべての答えを集計することで、人口全体の考えを推測できるのです。それは、あらゆる顧客から一つずつアイスクリームを試食することで、巨大なアイスクリームショップ全体の味を当てようとするようなものです。
しかし、ここには落とし穴があります。これが機能するためには、AIが質問をするたびに「サイコロを振る」ことができる必要があります。もし本物のティーンエイジャーに「ピザは好き?」と聞けば、彼らは今日「はい」と言い、明日には「いいえ」と言うかもしれませんし、あるいは頭の中でコイン投げをしているかもしれません。AIも同じように振る舞うべきなのです。つまり、「送信」をクリックするたびに、新鮮でランダムな答えを生成しなければなりません。もしAIが実際にサイコロを振ることができず、何度聞いても一つの答えに固執してしまうとしたら、実験全体が台無しになります。最初の顧客に「チョコレート」と言わせ、AIが次の999人の顧客全員に強制的に「チョコレート」と言わせるような状況では、アイスクリームショップの味を当てることはできません。
これこそが、KAISTの研究チームが発見したことです。彼らは、私たちが今日使用しているAIモデルには奇妙な欠陥があることを発見しました。それは、AIはランダムな分布がどのようなものかを説明することには非常に長けているにもかかわらず、実際に「ランダム・サンプリング」を行うことに関しては極めて下手であるということです。それは、トランプのシャッフル方法を完璧に説明できるのに、いざランダムにカードを引くよう頼まれると、いつもスペードのエースを引いてしまう手品師のようなものです。
研究者たちはこれを「KNOWS/DOES(知っている/できる)の乖離」と呼びました。モデルは答えを**知って(KNOWS)います。もし「選択肢Aと選択肢Bのどちらを好む人の割合はどのくらいですか?」と尋ねれば、モデルは完璧で正確な数学的回答を出すことができます。しかし、モデルはその通りに実行(DOES)**することができません。もしAIに一人の人間になりきって一つの答えを出させるよう頼むと、モデルは崩壊します。多様な反応を示す代わりに、単一の反復的な答えに固執してしまうのです。
これを証明するために、科学者たちは一連のテストを行いました。彼らはAIに1から100までのランダムな数字を選ぶよう指示しました。期待されるのは、答えがバラバラになることです。ところが、AIは78%の試行において「42」という数字を選んだのです!また、70対30の割合で二つの選択肢を選ばせたとき、AIは混ざり合った結果を出すのではなく、毎回70%の方の選択肢を選びました。まるで、AIの壊れた内部ダイスローラーが、片側に接着剤で固定されているかのようでした。
チームは、なぜこのようなことが起こるのかも突き止めました。彼らは「スマート」なバージョンのAIモデル(指示に従い、役に立つように訓練されたもの)と、「生の(raw)」バージョンのモデル(まだチャット用に学習されていないもの)を比較しました。生のモデルの方が、はるかに上手くサイコロを振ることができました。しかし、「スマート」なモデルは、一貫性があり、かつ役に立つように訓練されすぎた結果、ランダムである能力を失ってしまったのです。これは、AIを「優秀な生徒」にしようとした副作用です。AIは、たとえタスクがランダムであることを求めている場合であっても、常に「正しい」答えを出そうすることを学んでしまったのです。
では、AIモデルを使って調査を行う必要がある場合、どうすればよいのでしょうか?研究者は二つの巧妙なトリックを見つけ出しました。
第一に、もし群衆の一般的な意見(人口推定値)を知りたいだけであれば、AIに100人の異なる人物を演じさせるのではなく、ただ一つの質問を投げかけてください。「もし100人にこの質問をしたら、結果はどうなるでしょうか?」と。AIは分布を記述することには長けています。この「記述経路(Describe Pathway)」を試したところ、多くの人を演じさせるという従来の方法と比較して、予測の誤差は半分以下に減少しました。
第二に、もしどうしても100個の異なる個別の回答が必要な場合(例えば、すべてのキャラクターがユニークな個性を持つ必要があるビデオゲームの場合など)、同じ質問を100回繰り返すことはできません。AIはただ同じことを繰り返すだけだからです。代わりに、研究者たちは「プロンプト摂動型アーガイル(Prompt-Perturbed Argyle / PPA)」という手法を考案しました。これは、質問の仕方をごくわずかに変えるというものです。例えば、回答の選択肢の順番を入れ替えたり、質問の言い回しを変えたり、「キャラクター」の説明を置く場所を移動させたりします。これらの微細な変化が、AIの壊れたダイスローラーを「揺さぶり」、毎回異なる答えを出させるための「揺さぶり」となります。このシンプルなトリックにより、追加の費用や時間をかけることなく、エラーを21%削減することができました。
要約すると、この論文は、AIは世界の仕組みを説明することには驚異的ですが、世界に存在するランダムな一人の人間を演じることについては、現時点では非常に苦手としていることを伝えています。しかし、この特性を理解していれば、私たちは依然としてこれらの強力なツールを使って良い答えを得ることができます。ただ、問いかけ方を正しくする必要があるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。