← 最新の論文
🤖 machine learning

A Bitter Lesson for Data Filtering

本論文は、大規模モデルの前学習においてデータフィルタリングが不可欠であるという通説に挑戦し、高計算リソースかつデータが不足する環境におけるスケーリング研究を通じて、十分に学習された大規模モデルは、低品質データやノイズデータを除外するのではなく、むしろそれらを含めることで恩恵を受けることを実証する。

原著者: Christopher Mohri, John Duchi, Tatsunori Hashimoto

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Christopher Mohri, John Duchi, Tatsunori Hashimoto

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

「データフィルタリングの苦い教訓」という論文を、平易な言葉と創造的な比喩を用いて解説します。

大きなアイデア:「フィルタなし」のルール

あなたが世界についてすべてを教えるために、超賢い学生(大規模言語モデル)を育てようとしていると想像してください。従来の方法は、厳格な司書のように振る舞うことです。あなたは巨大な図書館(インターネット/Common Crawl)を巡り、散らかっているもの、拙く書かれたもの、あるいは繰り返しの多い本を捨て去り、コレクションの「最高」の 1% だけを学生に与えます。

この論文は、学生を非常に長い間教えるのに十分な時間とエネルギー(計算資源)があるならば、司書のような役割を止めるべきだと主張しています。

著者たちは、学生にすべて——良い本も悪い本も、繰り返しのリストも、無作為なノイズも——を読ませることで、本をフィルタリングして与えた場合よりも最終的により良く学習するようになることを発見しました。実際、その「ジャンク」データは、十分に大きく適切に訓練されたモデルにとっては有害ではなく、むしろ有益であることがわかりました。

実験:「ジム」の比喩

これを検証するために、研究者たちは AI モデルのためのジムのような一連の実験を設けました。

1. 「清潔 vs 散らかった」食事
彼らはインターネットのテキストの巨大な山(「プール」)を取り、それの異なるバージョンを作成しました。

  • プール: 生の、フィルタリングされていないインターネットテキスト。
  • フィルタ: 英語以外のテキスト、繰り返しの段落、あるいは一般的な英語の単語ではない語句などを削除したバージョン。一部のフィルタは非常に厳格(テキストの 2% しか残さない)であり、他のものは緩やかでした。

彼らは、これらの異なる食事(データセット)を用いて、サイズが異なる(小さなものから巨大なものまで)モデルを訓練しました。

  • 結果: 小さなモデルや短い訓練セッションの場合、「清潔な食事」(フィルタリングされたデータ)の方がうまく機能しました。これは、辞書よりも絵本から学ぶ小さな子供のようなものです。
  • 転換点: モデルを大きくし、より長く(より多くの「計算」を投入して)訓練するにつれて、「散らかった食事」(完全な、フィルタリングされていないプール)が勝ち始めました。フィルタリングされたデータの方が「質が高い」にもかかわらず、完全なプールで訓練されたモデルは最終的に、フィルタリングされたデータで訓練されたモデルを凌駕しました。

2. 「ジャンクフード」の注入
これらのモデルがどれほど頑健かを確認するために、研究者たちは意図的に食事の中に「ジャンク」を加えました。

  • ランダムな文字列: 「htb hqovl bwdws」のような作り物の単語。
  • シャッフルされた文: 実際の文を取り出し、単語の順序を混乱させたもの(例:「Paris France of capital is The」)。

驚き: このゴミが混ざっていても、大規模モデルは崩壊しませんでした。彼らはノイズを無視することを学びました。奇妙な転換点として、いくつかの場合、モデルは実際には清潔なデータよりもシャッフルされた文からより良く学習しました。なぜでしょうか?単語がシャッフルされていても、モデルは依然として「Paris」と「France」が頻繁に一緒に出現することを見ることができるため、それらの間のつながりを学習するのを助けるからです。「ジャンク」は、モデルを強くする過酷なトレーニングのような役割を果たしました。

「苦い教訓」

この論文は、リチャード・サットンによる有名な概念「苦い教訓(The Bitter Lesson)」に言及しています。その教訓とはこうです:スケールを拡大する際、人間の直感はしばしば失敗します。

私たちは人間として、「データがあまりにも散らかっているから、キュレーション(選別)しなければならない」と考えます。しかし、この論文は、私たちがより強力なコンピュータを手に入れるにつれて、データを掃除するための私たちの複雑で人間が設計したルールよりも、「すべてを与えろ」という単純なアプローチが勝ることを示唆しています。モデルは、十分な学習時間さえあれば、何が有用で何がノイズかを自分で見極めるのに十分なほど賢明なのです。

注意点:それは多くのエネルギーを消費します

これが機能するための主要な条件があります:計算資源(Compute)です。

この論文は、「すべてを読む」アプローチが「すべてをフィルタリングする」アプローチに勝るためには、膨大な量の計算資源が必要であると計算しています。彼らは、完全な Common Crawl データセット(240 兆語)の場合、フィルタリングされていないデータを明確な勝者にするために、約1e+30 FLOPs(計算の単位)が必要と推定しています。

  • 次のように考えてみてください: 予算が少なければ、データを掃除するためにプロの編集者を雇うのが賢明な動きです。しかし、もし数十億ドルの予算があれば、インターネットのすべてのページを読み取るために百万人のインターンを雇う余裕があります。そして、その膨大な量の読書こそが、編集者ができることよりも AI に多くを教えることになるでしょう。

結論

この論文は、巨大な AI モデルの未来については、完璧なキュレーターになろうとするのをやめる必要があると結論づけています。「悪い」データをフィルタリングするために莫大なリソースを費やす代わりに、より大きなモデルを構築し、生の、散らかった、フィルタリングされていないインターネットでより長く訓練することに焦点を当てるべきです。モデルは驚くほど回復力があります。彼らはノイズを処理でき、さらにそれを活用してより良く学習することさえできます。

要約すれば: 十分な力があるならば、最良のフィルタはフィルタを全く使わないことです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →