← 最新の論文
🤖 machine learning

Synthetic Persona Pretraining: Alignment from Token Zero

本論文は、価値観に整合した一人称の省察を事前学習フェーズに直接埋め込むことで、トークンゼロから望ましいアシスタントのペルソナをインストールする手法であるSynthetic Persona Pretraining (SPP) を導入し、このような早期の介入が、事後学習によるアライメント手法と比較して、憲法遵守、脱獄耐性、および道徳的アライメントを大幅に向上させることを実証する。

原著者: Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Ro
公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは子供を育てていると想像してみてください。思春期になるまで待ち、彼らを座らせてこう言うこともできます。「よし、言葉を話せるようになったところで、ルールを教えるよ。親切にすること、真実を語ること、そして人を傷つけないことだ」。あるいは、子供が最初の一言を学ぶその瞬間から価値観を教え始め、成長に合わせて語るすべての物語の中にそれらを織り込んでいくこともできます。これが、人工知能を構築している科学者たちが直面している核心的なジレンマです。

AIモデルは、インターネット上の数十億ページものテキストを読み込むことで学習する「デジタルの子供」のようなものです。この初期学習フェーズは「事前学習(pretraining)」と呼ばれます。この期間中、AIは事実、文章スタイル、そして人間がどのように会話するかを吸収します。しかし、「役に立ち、安全なアシスタントである」ための「ルール」は、通常、この大規模な学習フェーズの後に、「事後学習(post-training)」と呼ばれる別のステップとして追加されます。問題は、AIがインターネットを読み終える頃には、そこにあったものに基づいた「人格」をすでに形成してしまっていることです。完成した人格に対して新しいルールを強制することは、失礼な振る舞いを学んでしまったティーンエイジャーに、後から礼儀作法を教えようとするようなものです。それは、汚れた壁の上に薄いペンキを塗るようなものであり、古い習慣が容易に突き抜けてしまいます。

「Synthetic Persona Pretraining: Alignment from Token Zero」と題されたこの論文は、私たちのAIの子供たちを育てるための異なる方法を提案しています。研究者たちは、望ましい人格と価値観を、トレーニングのまさに最初の瞬間、つまり「トークン・ゼロ(token zero)」から組み込むことを提案しています。後から修正しようとするのではなく、AIが言葉を学び始めるのと同時に、「良きアシスタント」をその脳の中に構築したいと考えているのです。

実験:憲法を持つデジタルな子供を育てる

EPFLおよび様々な大学の研究チームは、この「モデル育成(Model Raising)」というアイデアをテストすることに決めました。彼らは「Synthetic Persona Pretraining (SPP)」という新しい手法を開発しました。その方法は、簡単な比喩を用いて次のように説明できます。

AIが図書館の本を読んでいると想像してください。従来の方法では、AIはただ本を読むだけでした。新しい方法では、研究者はそれらの本の約10%に対し、数段落ごとに特別な「思考の吹き出し」を追加しました。この吹き出しの中で、AIの将来の人格(ここでは「ケイト」と呼びましょう)は、今読んだ内容について立ち止まって内省し、「ふむ、この犯罪に関する物語は悲しい。私のルールによれば、暴力を助長すべきではない」とか、「この技術マニュアルは退屈だが有用だ」といったことを述べます。

彼らは単にこれらの思考を追加しただけではありません。AIにそれらを「生成すること」を学習させたのです。彼らは、元のテキストと、これら新しい「内省」の思考の両方を用いてモデルを訓練しました。これには2つの方法があります。

  1. トークン・ゼロ(「誕生からの」アプローチ): トレーニングの最初の一秒から最後の一秒まで、全プロセスを通じてこれらの内省の思考を散りばめました。
  2. ミッドトレーニング(「ティーンエイジャーの」アプローチ): AIがすでにほとんどの本を読み終えた後まで待ち、トレーニングフェーズの最後にのみ内省を追加しました。

また、通常通りに本を読む「バニラ(Vanilla)」のグループと、悪い本を除去したが内省は追加していない「フィルタリング済み(Filtered)」のグループもコントロールグループとして用意しました。

彼らが発見したこと:早期開始の力

結果は非常に興味深く、「いつ」教えるかが「何を」教えるかと同じくらい重要であることを示唆していました。

1. 「誕生からの」AIは価値観に関してより賢かった。
最初から内省を用いて訓練されたモデル(トークン・ゼロ)は、彼らが従うべきルール(憲法)を遵守する能力がはるかに高かったのです。研究者がトリッキーな道徳的ジレンマ(AIが一度も見たことがない状況)に対してテストを行った際、トークン・ゼロのモデルは、ルールに沿った選択を行いました。彼らは単にルールを暗記したのではなく、ルールの「精神」を理解しているようでした。

  • 数値: 「ConstitutionEval」と呼ばれるテストにおいて、トークン・ゼロのモデルは約**67%の正解率を示しましたが、終盤に内省を与えられたモデル(ミッドトレーニング)の正解率は約56%**にとどまりました。
  • 驚き: トークン・ゼロのモデルは、実際に優先順位を変えていました。彼らは他のモデルが好んだ「創造性」や「学習」よりも、「真実性」や「正義」をより重視し始めたのです。これは、早期に開始することが単にルールを加えるだけでなく、AIの世界に対する考え方を再構築したことを示唆しています。

2. 「ティーンエイジャー」のアプローチは、ある側面では機能したが、すべてではありませんでした。
興味深いことに、もし目的が単にAIが「ジェイルブレイク(脱獄/悪用)」される(悪いことをするように騙される)のを防ぐことであれば、ミッドトレーニングのアプローチはトークン・ゼロのアプローチとほぼ同等の効果がありました。単純な「それはやってはいけない」という反射的な動作については、後から教えることができるようです。しかし、深く複雑な道徳的推論については、本当に初日から教える必要があるのです。

3. 大きな脳には、大きな恩恵を。
研究者たちは、2つのサイズのAI(17億パラメータの小型モデルと、30億パラメータの大型モデル)でテストを行いました。その結果、早期に開始することの優位性は、AIが大きくなり、より賢くなるにつれて、さらに重要になることが分かりました。最も困難なテストにおいて、「誕生からの」AIと「ティーンエイジャー」のAIとの差は、スケールアップするにつれて2倍になりました。これは、将来の巨大で超知能なAIにとって、正しい価値観を持って始めることがいっそう重要になることを示唆しています。

4. 「接着剤」が重要である。
ただし、一つ注意点がありました。研究者たちは、これらの初期の価値観が定着するためには、トレーニングの最終ステップ(AIが人間とチャットする方法を学ぶ段階)が、以前に構築した人格と一致していなければならないことを見出しました。彼らはこれを「ペルソナ結合(persona binding)」と呼びました。もし、読解フェーズで特定のタイプのアシスタントとして訓練しながら、チャットフェーズで全く異なるタイプのアシスタントとして教えた場合、初期の価値観は薄れ始めてしまいます。それは、子供に医師になるよう教えながら、その後アートスクールに送るようなものです。彼らは医学のルールを忘れてしまうかもしれません。しかし、「接着剤」が機能しているとき、その価値観は驚くほど強く、研究者がトリッキーなテストで壊そうとしても耐え抜きました。

なぜこれが重要なのか

この論文は、インターネットから学んだすべてを「修正」しようとすること自体が、間違いである可能性を示唆しています。著者らは、価値観とは完成品に後から付け加えるのが難しいものであると主張しています。代わりに、私たちは最初のトークンを処理する瞬間から、正しい価値観を持ってAIを「育てる」べきなのです。

結果は有望ですが、研究者たちはこれはまだ始まりに過ぎないとも慎重に述べています。彼らがテストしたのは、今日のビッグテック企業が使用している巨大なモデルと比較すれば、比較的規模の小さい(30億パラメータ)モデルです。彼らは、より大きく、より賢いモデルを構築していくにつれて、正しい価値観を早期に持つことのメリットは、おそらくさらに強力なものになるだろうと示唆しています。また、初期の価値観は強力であったものの、特定の種類の後続のトレーニングによって弱められる可能性があることも指摘しており、デジタルな子供をどのように「仕上げる」かについても、引き続き注意が必要であるとしています。

要するに、もし私たちが真に安全で役に立つAIを望むのであれば、彼らが成長してから正誤を教えるのではなく、言葉を学び始めたその時から教えるべきなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →