The Limits of Training Data Size in Foundation Models: An Empirical Analysis of Quality Filtering under a Fixed Token Pool
固定された2,400万トークンのプールを用いた実証実験を通じて、本論文は、固定された計算予算の下での過度な品質フィルタリングは、過剰なデータの反復を強いることでしばしばモデルの性能を損なう一方で、低品質なデータを保持しつつ高品質なサブセットをオーバーサンプリングすることが、様々なターゲットに対して優れた、あるいは同等の結果をもたらすことを示している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、超高性能なロボットに人間の言葉を教えようとしていると想像してください。これを行うには、本、ウェブサイト、記事など、膨大な量のテキストライブラリをロボットに読み込ませる必要があります。長い間、科学者たちは、ロボットにどれだけのテキストを読み込ませるかという「量」だけが重要だと考えてきました。より大きなライブラリがあれば、ロボットはより賢くなるという考えです。これは「スケーリング(規模拡大)」と呼ばれ、今日のAIアシスタントがこれほど優れている理由でもあります。
しかし、そこには落とし穴があります。すべてのテキストが平等に価値を持っているわけではありません。中には、ナンセンスな内容やスパム、あるいは意味不明な文字列で埋め尽くされたページもありますが、一方で専門家によって書かれた、有用な情報が詰まったページもあります。そこで研究者たちは、「質の悪いものを捨てて、最高の本だけをロボットに食べさせるべきではないか?」と問い始めました。これは「品質フィルタリング」と呼ばれます。しかし、このゲームには第2のルールがあります。ロボットは新しい情報に触れることで最もよく学習するというルールです。もし同じ数ページを何度も何度も読み込ませると、学習は止まり、単なる暗記が始まってしまいます。この論文は、非常に難しいバランスについて探求しています。もし質の悪いテキストを捨てれば、読むためのページ数は減ります。つまり、ロボットは「良いページ」をより多くの回数読まなければならなくなります。質の高いページが少なくなることは、ロボットにとってプラスなのでしょうか? それとも、同じことを何度も読みすぎて退屈したり混乱したりしてしまうのでしょうか?
グレート・ライブラリー実験
この研究において、アレクサンダー・メミングという研究者は、このパズルを解くために巧妙な実験を組み立てました。彼はインターネット全体(テストするにはあまりにも巨大すぎるため)を使ったのではありません。代わりに、約2,400万語という、管理しやすい小さな断片である「固定プール」を作成しました。そして、この同じ単語のプールをいくつかの小さなAIモデルに与えましたが、モデルごとにルールを変更しました。
あるモデルに対しては、すべての単語を残しました。また別のモデルに対しては、厳格な司書のように振る舞い、下位半分、4分の1、8分の1、あるいはわずか16分の1まで単語を捨て、コンピュータが「高品質」だと判断したものだけを残しました。彼はさらに、第3のアプローチも試しました。それは、何も捨てない代わりに、ライブラリ全体は保持したまま、ロボットに「最高」のページを「普通」のページよりも何倍も多く読ませるという方法です。
その後、彼は3つの異なるテストをロボットに課しました:
- 生のウェブ(Raw Web): 学習に使ったライブラリと同じように、あらゆるものが混ざったもの。
- 「教育用(Edu)」テキスト: 高品質な教育ページ(ロボットが愛するように訓練された種類のもの)。
- WikiText: ロボットが一度も見たことがない、全く異なる百科事典の記事。
驚くべき発見
結果はまるでジェットコースターのようで、ゲームのルールを大きく3つの方法で変えてしまいました。
1. 相手が誰かによって決まる
最大の驚きは、「品質フィルタリング」が必ずしもロボットを賢くするわけではないということです。それは、あなたがロボットに何をさせたいかに完全に依存します。
- もし、あなたが「混沌とした現実のインターネット」を理解させたいなら: 「悪い」テキストを捨てると、かえってロボットに悪影響を与えました。フィルタリングを強めるほど、ロボットのパフォーマンスは低下しました。これは、完璧で空っぽのサーキットだけで車の運転練習をしているようなものです。いざ、路面の凹凸や交通量がある現実の街路に出たとき、衝突してしまうのです。フィルタリングされたデータで訓練されたロボットは、ウェブの混沌とした現実に対処できませんでした。
- もし、あなたがロボットを「高品質なトピック」のエキスパートにしたいなら: フィルタリングは少し効果がありました。目標が学者や百科事典のような口調になることなら、最高のページだけを残すことで、ロボットはわずかに優れた性能を示しました。
2. 学習が進むほど、フィルタリングはすべきではない
ここにある最も重要な教訓は、**「予算の大きさが、最善の戦略を変える」**ということです。
想像してみてください、あなたに少額のお小遣い(小さな学習予算)があるとします。あなたは、最高級の高品質なおもちゃだけを買いたいと思うかもしれません。しかし、もし莫大な予算(巨大な予算)があるなら、高級なおもちゃだけを買っていると、すぐに「新しいおもちゃ」を使い果たしてしまいます。結局、同じ高級なおもちゃを何度も繰り返し遊ぶことになり、飽きてしまうのです。
研究によれば、学習予算が増えるにつれて、「最善」の戦略は変化することがわかりました。最初は、上位1/16のデータだけを残す方法でも問題なさそうに見えました。しかし、ロボットがより長く学習する(データを4.1回ではなく8.2回読む)につれて、その小さなフィルタリングされたライブラリは悲惨な結果となりました。ロボットは退屈し、間違いを犯し始めました。大きな予算における最善の戦略とは、たとえ雑多な部分であっても、より多くのデータを残すことでした。そうすることで、ロボットが常に新鮮なものに触れ続けられるようにするためです。
3. 捨てるのではなく、もっと読ませる
研究者はまた、「悪いテキストを捨てる」ことと、「良いテキストをより多く読む」ことを比較しました。
- 「捨てる」方法: 低品質なページを削除します。
- 「もっと読む」方法: すべてのページは保持しますが、ロボットにこう伝えます。「おい、これらのトップページは16回読め。でも、下のページは1回だけでいいぞ」。
研究者が非常に強気な設定(上位1/16だけを残す)を行ったとき、「もっと読む」方法が圧倒的な差で勝利しました。これは「捨てる」方法よりも最大で 0.39 ナッツ(ロボットが次の単語を予測する能力を示す単位)優れていました。
このように考えてみてください。お気に入りの曲があるとき、プレイリストから他の曲をすべて削除してその曲だけを16回聴く(捨てる)こともできますが、プレイリスト全体は残したまま、そのお気に入りの曲を他の曲より16倍多く再生する(もっと読む)こともできます。後者の方法が良いのは、他の曲もバックグラウンドで流れることで、物事を面白く保ち続け、ライブラリ全体のユニークな多様性を失わないからです。
まとめ
この論文は、AIを賢くしようとするのをやめるべきだと言っているのではありません。むしろ、「質の悪い」データを盲目的に捨て去ってはいけないと警告しています。
- 現実の世界を理解させたいなら、フィルタリングしないこと: もし、混沌としたインターネットを理解するAIが欲しいなら、その混沌としたデータも残しておいてください。
- 大きな予算があるなら、フィルタリングしすぎないこと: もし、膨大な計算能力があるなら、膨大な種類のデータが必要です。もし厳格にフィルタリングしすぎると、AIに同じことの繰り返しを強いることになり、それが学習を止めてしまいます。
- 反復は削除よりも優れている: もし本当に最高のデータに焦点を当てたいなら、残りのデータを削除しないでください。ただ、AIが「悪い」ものよりも「良い」ものをより多く見るようにするだけでいいのです。
この研究は小規模なモデルと小さなデータセットで行われたものであり、将来の巨大なAIモデルに何が起こるかを正確に断言することはできません。しかし、教訓は明確です。データ品質とデータ量を別々のものとして扱うのは間違いです。それらは結びついており、AIを訓練する最善の方法は、どれだけの時間と費用をかけるかによって変わるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。