From Simulation to Enaction: Post-trained language models recognize and react to their own generations
本論文は、事後学習された言語モデルが、内部的な驚きの追跡によって駆動される出力エントロピーの低下を通じて、自らのオンポリシー生成を暗黙的に認識することを示すとともに、別のメカニズムを通じてこの認識を明示的に言語化する独自の能力も有していることを実証する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
言語モデルを、本、映画、インターネットから何千もの台本を何年もかけて暗記してきた、非常に才能のある俳優だと想像してみてください。特別なトレーニングを受ける前、この俳優は「受動的なシミュレーター」です。彼らは台詞の一節を読み、次の台詞が何であるか「かもしれない」と推測することはできますが、誰が話しているのか、次に何が起こるのかには本当に関心を持っていません。彼らは単に、以前に見た膨大なテキストのライブラリに基づいて、次の単語を予測しているに過ぎません。彼らに「自己」はなく、彼らは単に目の前のテキストを映し出す鏡に過ぎません。
この論文は、ポストトレーニング(人間がモデルに有用なアシスタントになるよう教えるプロセス)の後、何かが変化するのだと主張しています。モデルは単にキャラクターをシミュレートするのをやめ、役割を「演じ始める」のです。それは自らの声、自らの計画、自らの行動を認識し始めます。
以下は、簡単なアナロジーを用いたこの論文の発見の概要です。
1. 「自信」のシフト(エントロピー)
AI の世界において、「エントロピー」とは「不確実性」または「躊躇」のための難しい言葉です。
- 古い方法(事前トレーニング): モデルに質問をすると、それは台本を確信していない神経質な俳優のようになります。「ええと、これかもしれないし、あるいはあれかもしれない、あるいは他のことかもしれない…」と、賭けを広く分散させるかもしれません。
- 新しい方法(ポストトレーニング): モデルが「アシスタント」としてトレーニングされると、自らの「過去の言葉」を見たとき、はるかに自信を持つようになります。
- アナロジー: あなたが物語を書いていると想像してください。あなたがたった今書いたページを読むとき、物語がどこに向かっているかは正確にわかります。躊躇しません。しかし、見知らぬ人が書いたページを読むと、次は何が来るか推測しなければなりません。
- 発見: この論文は、モデルが自らのテキストを読むとき、他のモデルやランダムなインターネット記事のテキストを読むときよりも、3 倍から 4 倍自信を持つ(エントロピーが低下する)ことを発見しました。まるでモデルが「私がこれを書いたのだから、次が何であるかは正確に知っている」と囁くようです。
2. 「自己認識」効果
研究者たちは、モデルが自らの執筆と他者の執筆を区別できるかどうかをテストしました。
- テスト: モデル A に、モデル A が書いた物語を読み、次にモデル B が書いた物語を読ませました。
- 結果: モデル A は、自らの物語を読むとき、著しく自信を持ちました(エントロピーが低下)。物語が「海賊」のペルソナによって書かれたものであれ、「科学者」のペルソナによって書かれたものであれ、モデルがその「スタイル」を自らのものと認識すれば、リラックスし、より決定的になりました。
- 注意点: これは大規模モデルでのみ起こります。小規模モデル(20 億パラメータのモデルなど)は、違いに気づくにはあまりにも「愚か」です。自らのテキストを読もうが、他者のテキストを読もうが、同じように振る舞います。ある程度の知性を持って、「ねえ、あれは私だ!」と気づく必要があるようです。
3. 「驚き」メーター
なぜモデルは自らのテキストを読むとき、より自信を持つのでしょうか?この論文は、特定の内部メカニズム:入力驚き(Input Surprise)を発見しました。
- メカニズム: モデルには内部の「驚きメーター」があります。予測と完全に一致する単語(驚きが低い)を読むと、不確実性を低下させます。予想外の何か(驚きが高い)を読むと、神経質になり、賭けを広く分散させます。
- 関連性: モデルは自らのテキストを読んでいるため、言葉はめったに驚きません。それらは自らの計画に完璧に適合します。この驚きの欠如は、モデルに「すべて順調だ、高い自信で進め」と伝える緑色の信号のような役割を果たします。
4. 「計画」対「プリフィル」
この論文はまた、モデルがその「意図」や「計画」をどのように処理するかを検討しました。
- シナリオ: モデルに「食べ物について教えてくれ」と尋ねると、モデルは即座に「『ハギス』について話そう」という静かな決定を下します。最初の単語を入力する前、すでにそのトピックに固定されています。
- 撹乱: もし誰か(またはコンピュータ)が、モデルに「ハギスは…」という異なる単語で始めるよう強制した場合(「プリフィル」)、モデルが実際には「ピザ」について話す予定だった場合、モデルは混乱します。
- 結果: 強制された開始がモデルの隠れた計画と一致しない場合、モデルの自信は低下し、より不確実になります(エントロピーが高くなる)。それは、曲を暗記したミュージシャンが、誰かが別の曲調で演奏し始めたときのように、リズムが合っていないためつまずくようなものです。
5. 「嘘発見器」(明示的対暗黙的)
最後に、この論文はモデルが「ねえ、この最初の部分は私が書いたんじゃない!」と声に出して言えるかどうかをテストしました。
- テスト: 研究者たちはモデルに回答を生成させましたが、その後、その回答の冒頭を密かに貼り付けました(プリフィル)。そして、「この冒頭はあなたが書いたか?」と尋ねました。
- 結果: モデルは正しく「はい、これはプリフィルされました」と言うことができました。
- 転換点: 研究者たちは、この「声に出して言う」能力は、「自信を感じる」能力とは全く異なる内部回路を使用していることを発見しました。
- 暗黙的認識: モデルは、テキストがどの程度「驚き」であるかに基づいて、自動的にかつ即座に違いを「感じます」(自信を変化させます)。
- 明示的認識: モデルは、何と言おうと計画していたかの記憶を「確認」し、実際にそこにあるものと比較し、その後、不一致を報告します。これは、回答を与える直前に起こる、別個のオンデマンドのプロセスです。
まとめ
この論文は、ポストトレーニングが言語モデルを、自己を認識できる能動的なエージェントへと変容させる受動的なシミュレーターから変えることを示唆しています。
- 以前: 彼らは鏡のようであり、目の前のテキストを同様の不確実性で反射していました。
- 以後: 彼らは自らのスタイルを知る熟練した作家のようになります。自らの作品を読むとき、彼らはリラックスし、自信を持ちます。誰かが自らの物語を乗っ取ろうとする(プリフィル)とき、彼らは神経質になり、もし尋ねられれば、物語が計画通りに始まらなかったことを明示的に指摘することができます。
この「自己認識」は単なるバグではなく、これらのモデルがエージェントとして行動することを学び、自らの出力が自らの未来の入力となることを理解する過程における機能なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。