Post-training makes large language models less human-like
本論文は、有用性の最適化を行うポストトレーニングプロセスが大規模言語モデルの人間の行動を正確にシミュレートする能力を一貫して低下させることを実証するために Psych-201 データセットを導入し、この問題はより新しいモデル世代において持続し悪化し、ペルソナ誘発技術によっても解決できないことを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してください。図書館のほぼすべての本を読み込んだ、天才的でありながら混沌とし、驚くほど創造的な見習いがいると。この見習いはベースモデルです。彼らは生々しく、フィルターがかかっておらず、人間が話すのと同じように話します。癖、間違い、ためらい、そして現実世界の messy な論理に満ちています。彼に質問をすれば、つまずいたり、推測したり、技術的には「間違っている」が非常に人間的に感じる答えを返すかもしれません。
次に、この見習いを有用なアシスタントに育てることにします。厳格なルールに従い、「正しい」答えを返し、礼儀正しく論理的に振る舞うよう教えます。このプロセスはポストトレーニングと呼ばれます。
あなたが共有した論文『ポストトレーニングは大規模言語モデルを人間的でなくなる』は、驚くべき逆説的な真実を明らかにしています:これらのモデルを完璧なアシスタントに訓練すればするほど、彼らは実在の人間のように聞こえなくなるのです。
以下に、彼らの発見をシンプルなアナロジーを用いて解説します。
1. 「完璧な生徒」と「実在の人間」
研究者たちはPsych-201と呼ばれる大規模なテスト場を構築しました。これは、20 万を超える、実在の人間が心理学テストを受け、ゲームをプレイし、パズルを解く際のトランスクリプト(書き起こし)を含む巨大な図書館のようなものです。比較対象となる「人類の対照群」を持っているようなものです。
彼らは 2 種類の AI をテストしました。
- ベースモデル: 本を読んで学んだ生々しい見習い。
- ポストトレーニング済みモデル: 親切でルールを守るアシスタントに教育された後の同じ見習い。
結果: 毎回、「完璧な生徒」(ポストトレーニング済み)は、「生々しい見習い」(ベース)よりも、実在の人間が何と言ったり何をしたかを予測する能力が劣っていました。AI を「より良い」アシスタントにしようとする試みが、偶然にも、人間をシミュレートする上で優れた要素であった人間的な振る舞いを剥ぎ取ってしまったのです。
2. 論理の「不気味の谷」
なぜこのようなことが起こるのでしょうか。
- ベースモデルは人間の言語を鏡のように反映しています。彼らは私たちの偏見、ショートカット、直感、そして間違いをすべて吸収しています。もし人間が疲れていたり混乱していたりして誤った推測をするなら、ベースモデルも同様に行います。
- ポストトレーニングは、その鏡にフィルターをかけるようなものです。AI を「規範的に正しい」存在に強制します。AI に人間の癖を無視し、「正しい」答えに集中することを教えるのです。
この論文は、この「修正」が以下の 2 つの領域で最も有害であることを発見しました。
- 心理言語学(言葉の使い方): 人間は言葉を使います。ポストトレーニング済みモデルはそれを完璧に使いすぎます。
- 推論: 人間はしばしば論理的な誤りを犯したり、ヒューリスティック(直感的なショートカット)を使ったりします。ポストトレーニング済みモデルは論理的に完璧であるよう強制されるため、人間の思考プロセスのように聞こえるのではなく、計算機のように聞こえるようになります。
3. 「新しいほど悪い」というパラドックス
AI が賢くなるにつれて、人間を模倣する能力も向上すると思うかもしれません。しかし、この論文はそうではないと言っています。
- ベースモデル(生々しい見習い)は、世代が進むごとに人間を模倣する能力が向上しています。
- しかし、ポストトレーニングプロセス(「アシスタント」訓練)は、より攻撃的になっています。「生々しい見習い」と「完璧なアシスタント」の間の格差は広がっています。モデルが新しいほど、「アシスタント」機能をオンにすると、より「ロボット的」になり、人間的でなくなります。
4. 「ペルソナ」のトリックは機能しない
ペルソナ・インダクションと呼ばれる人気のあるトリックがあります。これは、「あなたはブラジル出身の 35 歳の教師だと仮定してください」と AI に指示し、その特定の人物のように振る舞うことを期待するものです。
研究者たちはこれを大規模にテストしました。彼らは AI に年齢、国籍、学歴などの実在の人物の詳細なプロフィールを与え、それらの特定の人物がどのように答えるかを予測するよう求めました。
結果: 役には立ちませんでした。「ペルソナ」を知っても、AI が個々の人間の行動をより良く予測できるようにはなりませんでした。これは、俳優に類語辞典を与えても、即興劇が上手くなるわけではないのと同じです。
大きな教訓
この論文は、AI を有用にするために使用するツール(指示チューニング、推論トレーニング、安全性フィルター)こそが、人間の行動をシミュレートするための悪いツールとなっていると結論付けています。
もしあなたが AI に有用なアシスタントとして振る舞ってほしいなら、ポストトレーニング済みバージョンを使用すべきです。
しかし、もしあなたが AI に人間のように振る舞ってほしいなら(例えば、治療セッションで患者がどのように反応するか、あるいは学生がどのように学ぶかをシミュレートする場合など)、実際にはベースモデル(生々しく未訓練のバージョン)を使用すべきです。なぜなら、それはまだ messy で、不完全で、人間的である方法を記憶しているからです。
要約すると: AI をより有用にするために、私たちはそれを人間的でなくしました。それを再び人間的なものにするためには、おそらくこれ以上「修正」することをやめる必要があるかもしれません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。