Compute Aligned Training: Optimizing for Test Time Inference
本論文は、新しい損失関数を導出することで大規模言語モデルの学習目的とテスト時の推論戦略を整合させる「計算整合学習」という新規フレームワークを導入し、標準的なSFTおよびRLアプローチと比較して性能のスケーラビリティを大幅に向上させるものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが非常に特定の種類の最終試験に向けて生徒を訓練している状況を想像してください。
従来の方法(標準的な訓練):
伝統的に、エッセイを書いたり数学の問題を解いたりする AI モデルを教える際、私たちは宿題のそれぞれを個別に採点する厳格な教師のように振る舞います。生徒が問題を正解すれば「よくやった!」と言い、間違えれば「もう一度試して」と言います。私たちは生徒が、毎回最初の回答を完璧に正解することを望みます。
問題は、これでは本番の試験への準備ができていないことです。現実世界では、私たちはモデルに一つの回答だけを求めるわけではありません。私たちはモデルに多数の異なる回答を生成させ(例えば、生徒にエッセイの10 種類のドラフトを書かせるように)、その後、最も良いものを選び、または最も一般的なものに投票します。
もし生徒が最初のドラフトを完璧にこなすように訓練されれば、彼らは自信過剰になり、新しいアイデアを探求することをやめてしまうかもしれません。彼らは「安全」な思考パターンに陥るでしょう。後に 10 種類のドラフトを生成するように求められたとき、彼らは同じ「安全」な回答のわずかに異なるバリエーションを 10 回書くだけで、あなたが求めていたような輝く創造的な解決策は一つも出てこないかもしれません。
新しい方法(計算整合型訓練:CAT):
この論文の著者たちは、計算整合型訓練(Compute Aligned Training: CAT) という新しい訓練方法を提案しています。これは、単一の宿題に対して採点するのではなく、実際の試験形式で生徒がどの程度うまくやれるかに基づいて採点するというものです。
いくつかの比喩を用いて、その仕組みを説明します。
1. 「Pass@N」の比喩(宝くじ)
試験で、1 つの問題に対してN 枚の宝くじ(例えば 64 枚)を購入できると想像してください。64 枚のくじのいずれかが当選番号であれば、あなたは勝ちです。
- 標準的な訓練: 生徒がすでに 1 枚のくじで 50% の勝率を持っている場合、教師は彼らを 90% や 99% まで引き上げようと押し続けます。しかし、64 枚の宝くじの場合、50% の勝率があれば、さらにくじを買うだけで勝ちが保証されます。教師は、簡単な問題で「良い」生徒を「完璧」にするためにエネルギーを浪費し、生徒が 1% の勝率しかない難しい問題を無視していることになります。
- CAT 訓練: 教師は、「この生徒は 64 枚のくじならすでに勝つ可能性が高い。この簡単な問題への採点を厳しくするのはやめよう」と気づきます。代わりに、彼らは生徒が現在失敗している難しい問題にすべてのエネルギーを集中させます。彼らは生徒に、64 枚のくじの少なくとも 1 枚が当選するように、勝率を分散させることを教えます。特定の 1 枚のくじを完璧にするのではなく、です。
2. 「多数決」の比喩(選挙)
試験でモデルに 10 個の回答を生成させ、クラスで最も人気のあるものに投票すると想像してください。
- 標準的な訓練: 教師は、すでに圧勝している場合でも、生徒の最初の回答を絶対的に最も人気のあるものにするように努めます。これは、すでに 90% の票を獲得している候補者が、さらに激しく選挙運動をするよう教師に言われるようなもので、時間の無駄です。
- CAT 訓練: 教師は「転換点」を見ます。生徒の回答がわずかな差で負けている場合、教師は彼らをゴールラインを越えるために大きく後押しします。生徒がすでに余裕を持って勝っている場合、教師は追加のポイントを与えるのをやめます。これにより、モデルは、わずかな追加の努力で投票をひっくり返せる「接戦」の問題に集中せざるを得なくなります。
3. 「ベスト・オブ・N」の比喩(タレントショー)
モデルが 10 曲の楽曲を生成し、その中から最高の 1 曲だけを残すと想像してください。
- 標準的な訓練: 教師は、平均的な楽曲が良く聞こえるようにしようとします。これにより、決して悪くはないが、決して驚異的でもない、安全で退屈な「平均的」な音楽が生まれます。
- CAT 訓練: 教師はモデルに、「9 曲がひどくても、10 曲目が傑作であれば問題ない」と伝えます。これにより、モデルはリスクを取り、奇妙で分散の大きいアイデアを試すようになります。失敗をフィルタリングして勝者を選び出す「探索」プロセスがあることを理解し、多様な出力を生み出すことを学びます。
彼らは実際に何をしたのか?
研究者たちは、このアイデアを 3 つの具体的な方法でテストしました。
- 数学の問題: 彼らは AI モデルを数学の問題を解くように訓練しました。「Pass@N(多数の回答を生成し、正しいものを選ぶ)」のために CAT を用いてモデルを準備したところ、標準的な方法と比較して、モデルは難しい問題を解く能力が大幅に向上しました。
- 投票: 彼らはモデルを「多数決」のための回答を生成するように訓練しました。これもまた、投票戦略が適用された場合、CAT モデルの方が優れたパフォーマンスを発揮しました。
- タンパク質設計: さらに、彼らは生命の構成要素であるタンパク質を設計する全く異なるタイプの AI においてもこれをテストしました。AI が多数の悪い構造の中から希少で高品質なタンパク質構造を見つける必要があるシナリオにおいて、CAT で訓練されたモデルは、標準的なモデルよりもはるかに「当たり」のタンパク質を見つけることができました。
結論
この論文は、モデルをどのように訓練するかは、それをどのように使用するかに対応すべきであると主張しています。
もしモデルを多数のオプションを生成し、その中から最良のものを選ぶために使用する場合、最初の試みを完璧にするように訓練すべきではありません。最良のものが見つかる可能性が高い「オプションのプール」を作成することに優れているように訓練すべきです。
彼らはこれを「計算整合型訓練(Compute Aligned Training)」と呼んでいます。これは、訓練プロセスをテスト時に使用される「計算(追加の思考力)」と整合させるものです。より強力なコンピュータやより長い訓練時間を必要とせずに、より良い結果を得るための方法であり、モデルが実際にどのように使用されるかという現実に合わせてゲームのルールを変更するだけです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。