Scaling Laws for Classical Machine Learning on Tabular Data: A Benchmark Study
本研究は、18のデータセットと6つのモデルファミリーにわたる11,536回の学習実行からなる大規模な教室配布型ベンチマークを提示しており、ほとんどの表形式モデルにおいてべき乗則が近似的な共通指数を持つ学習曲線を効果的に記述する一方で、有意な分散はランダムシードではなく実装の詳細に起因して存続することを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに、顧客が製品を購入するかどうか、あるいはローンが返済されるかどうかを予測させるような「意思決定」の方法を教えようとしていると想像してみてください。長い間、科学者たちは巨大なニューラルネットワーク——チャットボットや画像生成を動かしている、脳のような巨大なコンピュータ——に関する「スケーリング則」に夢中になってきました。彼らはある魔法のようなルールを発見しました。それは、もしこれらの巨人に、より多くのデータ、より多くの脳細胞(ニューロン)、そしてより多くの計算能力を与えれば、間違いの数は、丘を滑り降りるように完璧に予測可能な形で減少していくというものです。このルールがあまりに重要になったため、企業はどれだけのデータを購入すべきかを計算するためだけに、何百万ドルもの資金を投じるようになっています。
しかし、ここにひねりがあります。現実世界のほとんどは、巨大なニューラルネットワークで動いているわけではありません。それは「表形式データ(タブラーデータ)」で動いています。スプレッドシートを想像してください。顧客の行があり、年齢、所得、購入履歴といった列があります。これは、保険の価格設定から売上予測に至るまで、あらゆることに使われるビジネスの基本中の基本です。こうしたタスクには、派手な巨人よりも、決定木や線形モデルのような、よりシンプルで古いツールの方がうまく機能することがよくあります。ここで大きな疑問が生じます。これらのシンプルなツールも、同じ「データが増えれば間違いが減る」という魔法のルールに従うのでしょうか? そして、もし従うとしても、そのルールは全員に共通したものなのでしょうか、それとも使用する特定の表によって変わるのでしょうか? これまで、これほど大規模に、異なる人々が同じ実験を実行した際にそのルールが維持されるかどうかをテストした人は誰もいませんでした。
この論文は、まさにその答えを出すために設計された、教室規模の巨大な実験です。単一の研究チームが少数のテストを行う代わりに、著者は大学院の機械学習コースの学生127人を、独立した科学者として組織しました。各学生には特定のルールが与えられ、3つの異なる実世界のデータセット(クレジットカードの債務不履行や住宅価格など)が割り当てられました。彼らは、データの量が増えるにつれてエラー率がどのように変化するかを見るために、非常に少ないデータ量から始めて、徐々にデータを増やしながら、6種類の異なる「古典的」な機械学習モデルを訓練しなければなりませんでした。合計で11,000回以上のトレーニングセッションが実行され、単純な数学的公式がモデルの学習能力をどの程度予測できるかを確認するための、膨大な結果のライブラリが作成されました。
結果は驚くほど明確でしたが、いくつかの重要な注意点もありました。第一に、「魔法の公式」(べき乗則)は、ほとんどのモデルに対して非常によく機能しました。著者らは、約78%の実験において、データが増えるにつれてエラーがどの程度減少するかを正確に予測できるほど、この公式がデータに適合することを発見しました。しかし、すべてのモデルが平等というわけではありません。「ツリーベース」のモデル(ブースティングやランダムフォレストなど)はチャンピオンであり、一貫して他のモデルを圧倒し、最も低いエラー率に到達しました。一方で、一部のモデル、特にLasso回帰は、このルールに全く従わず、単に平均値を推測しているだけで、データ量に関係なく振る舞いました。
この研究は、また、非常に興味深い問いにも取り組みました。「モデルのファミリー全体に対して、単一の『学習速度』は存在するのか、それはデータセットに関わらず成立するのか?」という問いです。答えは「ある程度はイエス」です。6つのモデルファミリーのうち5つにおいて、学生たちは、個別のデータセットごとに固有の速度を算出するのとほぼ同等の精度で、単一の平均的な「学習速度」(指数)を用いることで、モデルの挙動を予測できることを見出しました。これは、特定のブランドの車は、走行条件が異なっていても、おおよそ同じ加速率を持つと言えるようなものです。しかし、これは完璧な普遍的法則ではありません。適合は完全ではなく、Ridge回帰のような一部のモデルでは、「速度」があまりに不安定であったため、信頼することができませんでした。
おそらく最も驚くべき発見は、データについてではなく、作業を行っている人間についてでした。すべての学生に全く同じ指示と、同一の結果を得るための同じランダムシード(デジタルの出発点)が与えられていたにもかかわらず、彼らの最終的な回答には依然としてわずかな差異がありました。著者らは、欠損値の処理方法やテキストのエンコード方法における、避けられない微細な違いによって生じる「人間による実装ノイズ」が、結果に約14%の変動をもたらしたと算出しました。これは、単一の研究チームが特定のスケーリング則を発見したと主張する場合、その背後には、データそのものからではなく、実験の設定方法から生じる約14%の「曖昧さ」が組み込まれていることを示唆しています。
結局のところ、この論文は表形式データの世界における実用的な地図を提供してくれます。それは、ほとんどのビジネス問題において、スーパーコンピュータは必要なく、適切に調整されたツリーモデルが勝利する可能性が高いことを裏付けています。また、いくつかの一般的な問題においては、高い精度に達するために数百行のデータがあれば十分である一方、他の問題では数万行が必要になることもあるという「買い物リスト」を提供しています。しかし、同時に私たちは謙虚であるようにと警告しています。ルールは近似的なものであり、絶対的なものではないこと、そしてデータの準備方法が、データそのものと同じくらい不確実性を導入し得るということです。これは、機械学習の世界において、最もシンプルなスプレッドシートであっても、独自の複雑で、少し乱雑ながらも、最終的には予測可能なリズムを持っていることを思い出させてくれます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。