Optimal or Greedy Decision Trees? Revisiting their Objectives, Tuning, and Performance
この大規模な実験的研究は、決定木がターゲットとなる目的関数を直接最適化し、より小さく精度の高いモデルを生成するという優位性を実証することで、決定木の最適性に関する相反する証拠を解決し、データ量が増えるにつれてその利点が減少するという仮説や、決定木が過学習を起こしやすいという仮説を論破するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピューターに、医師が患者を診断したり、銀行がローンの審査を行ったりするように、意思決定を教えようとしている場面を想像してみてください。あなたが選ぶツールは、多くの場合「決定木(ディシジョン・ツリー)」と呼ばれるものです。これは巨大なフローチャートのようなものだと考えてください。「もし患者に熱があれば左へ、なければ右へ」といった具合です。最終的に、一番下の「葉」に到達し、そこが答えを与えてくれます。これらの木が有名な理由は、人間にとって読みやすく理解しやすいためです。これは、機械がなぜその選択をしたのかという「理由」を知る必要がある場合に極めて重要です。
何十年もの間、これらの木を構築する標準的な方法は「強欲(グリーディ)」なものでした。霧の深い山を登っているところを想像してみてください。強欲な登山家は、目の前の一歩だけを見つめ、最も急な上り坂へと進みます。その道が後に行き止まりにつながっているかもしれないとしても、先を見通すことはしません。これは素早く、通常はかなりの高みまで到達できます。しかし、より野心的なアプローチである「最適(オプティマル)」な決定木と呼ばれる手法が存在します。この手法は、単に一歩先を見るのではなく、頂上への絶対的な最善のルートを見つけ出すために、山全体を一度にマッピングしようとします。それは、他の人々が霧の中でよろめいている間に、衛星地図を持っているようなものです。大きな疑問は、「この遅くて地図を作るようなアプローチは、本当に速い霧の中の登山よりも優れているのか、それとも単なる時間の無駄なのか?」ということでした。
デルフト工科大学の研究者たちによって書かれたこの論文は、この論争を深く掘り下げています。彼らは、109の現実世界のデータセットと数千の合成データセットを用いて、これら2つの手法をテストするという、この種のものとしては最大規模の実験を行いました。彼らの発見は、機械学習の世界における一種のプロット・ツイスト(どんでん返し)でした。彼らは、「最適」な手法が確かに優れていることを見出しましたが、それは「正しいルールに従った場合のみ」であるということも突き止めました。
第一に、彼らは「最適」な木が非常に柔軟であることを発見しました。強欲な手法は、どのステップに進むかを決めるために特定の硬直したルール(例えば、「ジニ不純度」という、乱雑さを表す専門的な数学用語のようなもの)を使うことに縛られています。一方、最適な手法は、目標である「純粋な精度」を直接狙うことができます。これは、強欲な登山家が最も急な岩を探すことしか強制されていない一方で、最適な登山家は、地形がどのようなものであれ、単に最も高い地点を探すことができるようなものです。論文は、最適な手法が精度を直接目標とするように設定すると、強欲な手法よりも小さく、かつ正確な木を構築することを示しています。
しかし、研究者たちは2つの一般的な迷信を論破しました。一つの迷信は、コンピューターに与えるデータが増えるにつれて、強欲な手法が追いつき、その差が消えてしまうというものでした。論文は、その逆を示しています。データが増えると、強欲な手法は実際により後退し、読み取りにくく巨大で乱雑な木を構築してしまう一方で、最適な手法はコンパクトで鋭いままです。第二の迷信は、最適な木は「過学習(オーバーフィッティング)」、つまり訓練データを完璧に暗記しすぎてしまい、新しいデータに対して失敗してしまうというものでした。研究によれば、適切にチューニングすれば、最適な木は強欲な木よりも実際には過学習しにくいことが分かりました。
ただし、注意点があります。最適手法は計算負荷が高いことです。これは、あらゆるピースの組み合わせをチェックしようとする、巨大なパズルを解くようなものであり、多くの時間とパワーを要します。論文は、これらの木が巨大なデータセット(最大10万インスタンス)を扱うことはできるものの、特徴量(パズルのピース)の数があまりに多くなると苦戦することを認めています。したがって、研究者たちは、データがノイズを含んでいたり複雑であったりする場合、特に小さく、極めて正確で、理解しやすいモデルが必要なときは、最適な決定木が最良の選択であると結論付けています。しかし、もしあなたが単に素早い答えを必要としており、木のサイズを気にしないのであれば、古風な強欲な手法は依然として信頼できる、素早い友人であり続けます。重要な教訓は、両方の良いとこ取りをするためには、最適な木を注意深くチューニングしなければならず、さもなくばその名に恥じる結果になる、ということです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。