Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning
この論文は、標準的な直感に反して、思考の連鎖(chain-of-thought)データを用いた教師あり微調整は、単一のエポックのためにデータセットの規模を拡大するのではなく、完全な記憶に達するまで小規模なデータセットで繰り返し学習を行うことによって、より優れた推論性能を達成できることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、非常に難しいパズル(複雑な数学の問題や深い科学の問いなど)を解く方法を、天才的だが注意散漫な生徒に教えようとしているところだと想像してください。人工知能の世界において、この生徒は「言語モデル」であり、テキストを読み取ることで学習するコンピュータプログラムです。これらのモデルに推論能力を身につけさせるために、科学者たちは「教師あり微調整(Supervised Fine-Tuning: SFT)」というプロセスを用います。これは、熟練した教師によって書かれた解答例の束を生徒に与えるようなものだと考えてください。生徒はその例題を読み、思考プロセスをステップ・バイ・ステップで模倣しようと試みます。そうすることで、自分自身で同様の問題を解けるようになるのです。
長い間、機械学習における黄金律は「多ければ多いほど良い(more is better)」というものでした。その直感は単純です。もし生徒にうまく学習してほしいなら、膨大な数の「ユニークな」本を与えればよい、というものです。より多くの異なる例を見れば見るほど、新しい状況にも対応できる汎用性が高まるはずだという考えです。それは、10,000冊の異なる物語を読むことは、同じ100冊の物語を何度も繰り返し読むよりも常に優れていると信じるようなものです。しかし、もしそのルールが間違っているとしたらどうでしょう? もし、この特定の種類の「推論」のトレーニングにおいては、秘密はより大きな図書室にあるのではなく、より小さな図書室に対するより深い理解にあるとしたら? COLM 2026の新しい論文は、AIがいかにして思考するかという私たちの基本的な仮定に挑戦し、この問いに取り組んでいます。
この研究の背後にいる研究者たちは、「多ければ多いほど良い」というルールを検証するために、一連の制御された実験を行うことにしました。彼らは標準的なAIモデルを取り上げ、「思考の連鎖(Chain-of-Thought)」データ、つまりモデルが回答する前に問題を順を追って考えることを学ぶ、詳細で長い推論の痕跡を用いてトレーニングを行いました。彼らは厳格な予算を設定しました。それは、固定された「計算量(コンピューティング・エフォート)」(例えば、生徒が勉強することを許された固定の学習時間のようなもの)です。そして、2つの戦略を比較しました。戦略Aは、膨大な数のユニークな例(51,200サンプル)を生徒に与える代わりに、その山全体を一度だけ読ませるというものです。戦略Bは、ごくわずかな例(わずか200または400サンプル)を生徒に与える代わりに、その同じ小さな例の山を何度も、何度も——最大128回まで——読ませるというものです。
結果は驚くべきものであり、直感に反するものでした。論文によると、小さな例を何度も繰り返し読んだ生徒(戦略B)は、膨大なライブラリを一度だけ駆け足で読み終えた生徒よりも、新しい困難な問題を解く能力が著しく高くなったことが分かりました。AIME(アメリカ数学競技会)のような数学のベンチマークやGPQA(科学クイズ)といった難度の高いテストにおいて、400サンプルを128エポック(反復)で学習したモデルは、51,200サンプルをわずか1エポックで学習したモデルを大幅に上回り、精度を12〜26パーセントポイントも向上させたのです。それはまるで、いくつかの重要な物語を完璧に暗記した生徒が、千冊の本を拾い読みした生徒よりも、新しい謎を解くのが上手かったというかのようです。
この論文はまた、「なぜ」これが起こるのか、そしてその限界はどこにあるのかについても探求しました。彼らは、この改善が新しい事実を学習したことによるものではなく、推論の「構造」をモデルが記憶したことによるものであることを発見しました。モデルが小さなデータセットを繰り返すにつれ、最終的に訓練データの次の単語をほぼ完璧な精度(100%)で予測できるようになりました。モデルがこの訓練データの「完全な記憶」に達したとき、新しいテストに対するパフォーマンスの向上は止まり、横ばいとなりました。これは、この種のトレーニングにおいては、目標はできるだけ多くの異なる例を見ることではなく、推論のパターンが自然に身につくまで、そのパターンを内面化することにあることを示唆しています。
興味深いことに、研究者たちはこの「反復」が、モデルがそれまでに知っていた他の知識をすべて忘れてしまうこと(「破滅的忘却」と呼ばれる問題)を引き起こさないかどうかを検証しました。彼らは、小さなデータセットを繰り返すことが、巨大なデータセットを一度読むことよりも、むしろ忘却を少なくさせることを発見しました。推論の構造を深く練習することで、モデルは自身のロジックに対してより自信を持つようになり、それが一般的な知識を失うことなく、タスクに固執する助けとなったようです。
しかし、著者たちはこれがすべてを解決する魔法の杖であると呼ぶことには慎重です。彼らは、この手法が「あらゆる」データに対して有効であるという考えを明確に否定しています。例えば、例を提供している教師が未熟であったり、例が間違っていたりする場合、その恩恵は変わってしまいます。また、彼らは「反復の優位性」は堅牢であるものの、訓練データを記憶することがなぜ汎化に役立つのかという正確な理由は依然として謎であるとも述べています。彼らは、モデルが全く新しい何かを学んでいるのではなく、すでに持っていた隠れた能力を解き放っている可能性があると示唆しています。
要約すると、この論文は、AIに推論を教えるためには、より大きなデータセットを探し求めることに時間を浪費している可能性があることを示唆しています。代わりに、高品質で小さな推論例のセットを取り、モデルがそれを隅々まで知り尽くすまで学習させる方が、より良い結果が得られるかもしれません。著者たちは、新しい実用的なルールを提案しています。それは、モデルが訓練テキストを完璧に予測できるようになるまで小さなデータセットでのトレーニングを続け、その時に停止するというものです。彼らは、この現象の「なぜ」を完全には説明できていませんが、時には、AIの世界において、同じページを100回読むことは、100の異なるページを拾い読みすることよりもはるかに強力であるということを証明したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。