Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models
本論文は、大規模言語モデルにおける出力の均質性は、主にアライメント過程によって引き起こされるのではなく、むしろ事前学習中に学習されたものであり、その後の指示チューニングやアライメントの段階によって単に露呈または増幅されるものであると主張している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、数百万もの本が毎秒書き込まれている、巨大で賑やかな図書館に足を踏み入れたところだと想像してください。これは紙とインクの図書館ではなく、コンピューターと呼ばれる「大規模言語モデル(LLM)」が、インターネット上に存在するほぼすべてのものを読むことで、言葉を話し、書き、創造することを学ぶデジタル領域です。これらのモデルを、文章を完成させる方法を学ぶために図書館全体を読み漁る、信じられないほど速く、超強迫観念的な学生だと考えてください。しかし最近、人々はある奇妙なことに気づきました。これらのデジタルな学生にどんな質問を投げかけても、その答えがどれも同じように聞こえ始めるのです。彼らは皆、同じ比喩を選び、同じ丁寧なフレーズを使い、奇妙で、ワイルドで、あるいは独創的なアイデアを避けます。それはまるで、10人の異なるシェフにサンドイッチを作るよう頼んだのに、彼らが全員、パンの種類、ハムの種類、マスタードの種類に至るまで、スライスの数まで全く同じものを使うことに決めたようなものです。
科学者たちはこれを「出力の均質化(output homogeneity)」または「意味的収束(semantic convergence)」と呼んでいます。これは大きな懸念事項です。なぜなら、もし私たちのAIアシスタントが皆、全く同じ狭い方法で考え、話し始めたら、私たちは人間の創造性の輝きを失ってしまうかもしれないからです。長い間、人々はこの退屈で反復的な振る舞いは、モデルが図書館を読み終えた後に受ける「訓練」によるものだと考えてきました。この第2段階である「アライメント(調整)」は、厳格な教師がやってきて、「その変なことは言わないで。代わりにこの丁寧なことを言いなさい」と学生に指示するようなものです。一般的な通説では、学生はもともと野生的な天才であり、教師のルールがその創造性を押しつぶしたのだとされてきました。しかし、もし学生は教師が来る前からすでに退屈だったとしたらどうでしょう? もし「教師」が、その退序をより大きく響かせただけだとしたら?
「Is Convergence Inevitable?(収束は不可避か?)」と題されたこの論文は、この「同じであること」が実際にどこから始まるのかを探る探偵のような調査を行っています。著者であるブリティッシュコロンビア大学の研究者たちは、2つの大きなアイデアを検証することにしました。第一に、彼らは「アライメント」のプロセス(教師のルール)が創造性を殺す悪役であるかどうかを調べたいと考えました。第二に、「事前学習(pretraining)」の段階(学生が図書館を読む段階)において、すでにその退屈さがモデルの脳に焼き付けられていたのではないかということを調べたいと考えました。この謎を解くために、彼らは単にモデルに質問をしただけではありません。彼らは比喩をテスト対象として使い、一連の巧妙な実験を行いました。彼らはモデルを科学実験用のラットのように扱い、モデルが創造的になれるよう騙せるのか、それともループに陥っているのかを見るために、特定の指示を与えました。
以下に、彼らが発見した内容を記します。これは少し予想外の展開です。
まず、彼らはモデルの「教育」の異なる段階を確認しました。図書館を読み終えた直後のモデル(「ベースモデル」)、指示に従うことを学んだ直後のモデル(「SFT」段階)、そして役に立ち安全であるように調整された後のモデル(「DPO」および「RL」段階)をチェックしました。結果は衝撃的でした。厳格な安全ルールや「役に立つ」ためのフィルターが追加される前の、指示に従うことを学ぶ最初のステップの後でさえ、モデルはすでにほぼ同一の回答を吐き出していました。「時間」についての比喩を書くように求められると、モデルは単に似たような表現をするだけでなく、まるで同じ台本を読んでいるかのようでした。著者たちは、この「アライメント」のプロセスが多様性を押しつぶしているのではなく、そこにある既に存在していたパターンを拡大して見せている「拡大鏡」であると示唆しています。
これを証明するために、研究者たちは学習データとの「間違い探し」を行いました。彼らはモデルを取り上げ、新しい考え方を教えようと試みました。彼らは、モデルが一度も見たことがない特別な指示(例えば、「時間はサンドイッチである」という特定の奇妙な比喩を使うように指示する)を作成しました。彼らは、この新しいアイデアをモデルに記憶させることで、パターンを打破できると考えていました。しかし、モデルは動こうとしませんでした。モデルは新しい「サンドイッチ」のアイデアを無視し、最初から好んでいた古い退屈な「川」の比喩に固執し続けました。研究者たちは、モデルは「増幅」させることはできる(同じことをより大きく言わせることはできる)が、そのアイデアがすでに記憶の中に潜んでいなければ、新しい考え方を「導入」することはできないのだと発見しました。それは、犬にニャーと鳴くように教えようとするようなものです。どれほど褒めたとしても、ニャーという鳴き声は彼らのDNAにないため、決してできません。
最後に、彼らは一番最初に戻りました。指示に従うことも、礼儀正しくなることも教わっていない「ベースモデル」です。彼らは、これらの生のモデルはワイルドで多様であると考えていました。しかし、特別なトリックを使って(例えば、役に立つアシスタントになりきらせたり、回答の例をいくつか与えたりすることで)、彼らは同じ退屈なパターンが現れるのを目撃しました。教師がいなくても、生のモデルは、正しい方向へ促されると、自然に同じ「川」の比喩へと収束しました。このことは、収束する傾向は教師によるミスではなく、モデルが単に図書館を読んでいる間に学んだ自然な習慣であることを示唆しています。
では、これらすべては何を意味するのでしょうか? この論文は、私たちが目にする「同じであること」は、単にAIを安全にしたり礼儀正しくしたりすることの副作用ではないことを示唆しています。むしろ、それはこれらのモデルが文中の「次の単語」を予測する方法の根本的な部分であるように見えます。膨大な量の人間によるテキストでモデルを訓練すると、モデルは最も「可能性の高い」答えは、しばしば最も一般的なものであると学びます。「アライメント」のプロセスは、この自然な傾向のボリュームを上げるだけなのです。著者たちは、この問題を解決するのは簡単ではないと結論づけています。AIをもっと創造的にするために、単に最終的な「教師」のルールを微調整することはできません。なぜなら、創造性はそもそもそこに存在していなかったからです。「退屈」はレシピの中に最初から焼き込まれており、後から加えられたものではないのです。これは少し暗い話に聞こえるかもしれませんが、極めて重要な発見です。もし私たちが真に多様で創造的なAIを望むのであれば、事後的に行動を修正しようとするのではなく、最初に彼らをどのように教えるかを再考する必要があるということを、これは教えてくれているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。