← 最新の論文
🤖 AI

Scaling Domain Data Repetition in LLM Pretraining

本論文は、大規模言語モデルの事前学習におけるデータの反復と過学習の間のトレードオフを調査し、固定されたパラメータあたりのトークン数において、高品質なドメインデータの最適な反復回数はモデルサイズとともに緩やかに増加すること、および、その回数がドメインの検証損失と強い負の相関関係にあることを明らかにしており、これは、より小さなプロキシモデルでのチューニングが、より大きなモデルへのスケーリング戦略を効果的に導くことができることを示唆している。

原著者: Jingwei Li, Xinran Gu, Rui Dai, Xintong Hao, Chengyin Xu, Yan Wu, Shuran Zheng, Jingzhao Zhang

公開日 2026-08-17
📖 1 分で読めます☕ さくっと読める

原著者: Jingwei Li, Xinran Gu, Rui Dai, Xintong Hao, Chengyin Xu, Yan Wu, Shuran Zheng, Jingzhao Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超スマートなロボットに話し方、書き方、そして考え方を教えようとしていると想像してみてください。そのために、膨大な量のテキストのライブラリをロボットに読み込ませます。これは「事前学習(pretraining)」と呼ばれるプロセスです。しかし、ここには落とし穴があります。ロボットは「脳細胞(パラメータ)」が増えるにつれてより大きく、より賢くなりますが、混乱したり性能が低下したりするのを防ぐために、さらに多くの言葉を読み込ませなければなりません。これが大規模言語モデル(LLM)の世界です。問題は、インターネット上のありふれたテキスト(ランダムなフォーラムの投稿やニュース記事など)はいくらでも簡単に見つかる一方で、真に高品質で専門的な知識(高度な数学、コーディング、あるいは医学的事実など)を見つけることは、干し草の山の中から針を探すようなものだということです。巨大なロボットに食べさせるための「良いもの」は、それほど多く存在しません。

では、良いデータが尽きたとき、あなたはどうすればよいのでしょうか? あなたはそれを繰り返すことから始めます。その貴重な数学の教科書を取り上げ、何度も何度もロボットに読み込ませるのです。しかし、これは非常に繊細なバランスの上に成り立っています。もし「良いもの」を繰り返しすぎると、ロボットは単に本の内容を丸暗記してしまい、実際の概念を理解できなくなる可能性があります。これは「過学習(overfitting)」と呼ばれる問題です。逆に、繰り返す回数が少なすぎると、ロボットは一般的なインターネット上のノイズの海に飲み込まれ、難しいことを決して学習できなくなってしまいます。大きな疑問はこうです。「ロボットが混乱し始める前に、良質なデータを何回繰り返すべきか?」

「Scaling Domain Data Repetition in LLM Pretraining(LLM事前学習におけるドメインデータの反復スケーリング)」と題されたこの論文は、まさにその問いを深く掘り下げています。清華大学とByteDance Seedの研究者たちは、ロボットが大きくなるにつれて、高品質なデータと一般的なデータをどのように混ぜ合わせるのが完璧なレシピなのかを知ろうとしました。彼らはこれを、コード、数学、Wikipedia、および医療記録という4つの特別な「味付け(データ種別)」でテストしました。

ここで彼らが発見したことは、少し意外な展開を見せます。長い間、人々はロボットが大きくなるにつれて、より脆弱になり、データをより早く過学習(暗記)してしまうと考えてきました。かつての助言は、「良いものを増やしすぎてはいけない。さもないと、大きなロボットは壊れてしまう」というものでした。しかし、著者たちが訓練予算をロボットのサイズに比例させた場合(「パラメータあたりのトークン数」の比率を固定するというルール)、驚くべき事実を発見しました。大きなロボットは、実は小さなロボットよりも多くの反復に耐えられるのです。これは、たとえ両者が同じ強度でトレーニングを行っていたとしても、巨大なアスリートの方が、小さなアスリートよりも多くのラップを走れるようなものです。

しかし、彼らが見出した最も重要なルールは、ロボットのサイズについてではなく、データ自体の質についてでした。彼らは、ロボットが特定のトピックをどれほど上手く学習できるかと、そのトピックを何度繰り返せるかの間に強い関連性があることを発見しました。もしロボットが特定のドメイン(例えば数学)を非常にうまく学習し、「エラースコア(検証損失)」が低い場合、そのデータを何度も繰り返しても壊れることはありません。しかし、もしロボットがそのトピックに苦戦しており、エラースコアが高い場合は、非常に早く過学習してしまうため、そのデータを繰り返す回数は極めて少なくすべきです。

興味深いことに、最初に持っているユニークなデータの量は、繰り返す回数を決定する上ではあまり重要ではないようです。小さな数学の問題の集まりから始めても、巨大な集まりから始めても、反復の「スイートスポット(最適値)」はおよそ変わりません。研究者たちは、もし巨大なロボットを訓練したいのであれば、推測する必要はないと示唆しています。まず小さな「プロキシ(代理)」ロボットを訓練し、そのロボットが数学やコードをどれほど上手く学習するかを確認します。そして、その結果を用いて、巨大なロボットに対してデータを何回繰り返すべきかを安全に予測できるのです。

彼らはまた、総量としての「良いもの」の量を一定に保ったまま、ユニークなデータを繰り返されるデータと入れ替えた場合に何が起こるかもテストしました。その結果、数学のようなトピックでは、データを繰り返すことは、より多くのユニークなデータを持つこととほぼ同等の効果があることがわかりました。しかし、Wikipediaのような他のトピックでは、繰り返すことは悪いアイデアです。新しい文章を読む代わりに、同じWikipediaの文章を何度も聞かされると、ロボットの学習効率は著しく低下します。

最後に、彼らは訓練中のロボットの「学習速度(学習率)」の変化についても調査しました。もし訓練の早い段階でロボットの速度を落としてしまうと、反復に対して敏感になり、より早く過学習してしまいます。しかし、学習速度を長く高い状態に保っておけば、ロボットは暗記してしまう前に、より多くの反復に耐えることができます。

要約すると、この論文は、データを繰り返すための「たった一つの魔法の数字」は存在しないことを示唆しています。代わりに、最善の戦略は、ロボットがすでにその特定の主題をどれほど上手く学習しているかに依存します。もしそれが「速い学習者」であれば、データをより多く繰り返してください。もし「遅い学習者」であれば、繰り返すのを早めに止めてください。そして驚くべきことに、大きなロボットは、適切な量のデータをそのサイズに合わせて与えさえすれば、私たちが考えていたよりも反復に対して頑健(ロバスト)なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →