Challenges in the calibration of tree-based models for imbalanced classification
本論文は、アンダーサンプリングされた不均衡データで学習された決定木モデルを解析的に較正すると、信頼性の低い有病率推定や予期せぬバイアスが生じることを示し、代わりにベータ較正のような学習ベースの較正手法を用いるべきであると論じている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
全体像:「レシピ」の問題
あなたが完璧なスープの作り方を学ぼうとしているシェフだと想像してください。しかし、あなたのキッチンは極端にアンバランスです。ジャガイモは10,000個ありますが、ニンジンはたった10本しかありません。もし、10,000個のジャガイモと10本のニンジンが入ったボウルを味わってレシピを学ぼうとしたら、あなたはニンニンの味を一生学ぶことはできません。あなたは、このスープは99.9%がジャガイモだと思い込んでしまうでしょう。
これを解決するために、あなたは**アンダーサンプリング(抽出)**することに決めました。ジャガイモのほとんどを捨てて、50個のジャガイモと10本のニンジンが入ったボウルを用意します。これで、トレーニングデータはバランスが取れ、レシピをより良く学べるようになります。
落とし穴: しかし、いざ現実の世界(実際に10,000個のジャガイモがある世界)でスープを作る時、あなたの味覚は「バランスの取れたボウル」に慣れすぎています。あなたはスープが50%ニンジンであると考えますが、実際にはまだ99.9%がジャガイモなのです。あなたの予測は「バイアス(偏り)」がかかっています。
旧来の解決策:「数式」
長い間、データサイエンティストたちは、この問題を解決するために特定の数式(論文内の式1)を使用してきました。その考え方はシンプルです。「ジャガイモを90%捨てたことは分かっている。だから、予測値に数字を掛けて、数学的にそれらを『足し戻す』だけでいい」というものです。
この論文の著者たちはこう言っています。「そんなことはもうやめなさい」。
彼らは、この数式が決定木ベースのモデル(ランダムフォレストなど)にはうまく機能しないことを発見しました。この数式はスープを修正するどころか、味をめちゃくちゃに予測不能にしてしまうのです。
発見された2つの主な問題
1. 「つまみ」の問題(予測因子の数)
あなたのランダムフォレストが、ミステリーを解決しようとしている500人の探偵チームだと想像してください。
- ルール: 探偵たちは、進むべき方向を決めるために、あらゆるステップにおいて一定数の「手がかり(予測因子)」しか見ることができません。
- 実験: 著者たちは「手がかりのつまみ」を回してみました。ある時は、探偵たちがたった2つの手がかりだけを見られるようにしました。またある時は、15個の手がかりを見られるようにしました。
何が起きたのか?
バイアスを修正するために旧来の数式を使ったところ、最終的な答えは、探偵たちがどれだけ多くの手がかりを見ることができたかに応じて劇的に変化してしまいました。
- 2つの手がかりを見た場合、モデルは100件の火災を予測しました。
- 15個の手がかりを見た場合、モデルは140件の火災を予測しました。
例え話: これは、人々にスイカの重さを当てさせるようなものです。もし「色だけを見て」と言えば、彼らは10ポンドと予想します。もし「色、茎、叩いた時の音、そして質感を見て」と言えば、彼らは15ポンドと予想します。
理想的な世界では、数式がこれらの予想を修正し、すべてが同じ真の重さに着地させるはずです。しかし実際には、数式は予想をさらにバラバラにしてしまいました。探偵たちがより多くの手がかりを使うほど、最終的な推定値は跳ね上がっていったのです。
2. 「意外なバイアス」(サンプリング率)
通常、私たちは「マイノリティ(少数派)のアイテム(例:10本のニンジン)が少なすぎる場合、モデルはそれを無視して低めに予測するだろう」と考えます。
- 旧来の信念: 「決定木はマイノリティのクラスを無視する」
- 論文による発見: 彼らの実験では、決定木はむしろ逆のことをしていました!彼らはマイノリティのクラスを過大評価していたのです。
例え話: 1,000個のビー玉(青が990個、赤が10個)が入った瓶の中に、赤いビー玉がいくつあるかを当てようとしていると想像してください。あなたは小さなサンプルを取ります。
- 予想される結果: 「たぶん1個か2個だろう」(過小評価)。
- 決定木がしたこと: 木(決定木)はサンプルを見て、「わあ、赤いビー玉があちこちにいるぞ!きっと50個はあるに違いない!」と言ったのです。
著者たちは、サンプリング率(どれだけのジャガイモを捨てたか)を変更するにつれて、モデルの過大評価が悪化することを発見しました。数式はこれを修正しようとしましたが、決定木がすでに高く見積もりすぎていたため、数式は最終的な結果をさらに混沌としたものにしてしまったのです。
実世界の例:山火事
著者たちは、これをカナダのアルバータ州における山火事に関する実際のデータでテストしました。
- 山火事は稀な現象です(ニンジンのようなもの)。
- 彼らはモデルを修正するために「数式」を使用しました。
- 結果: 「手がかりのつまみ(予測因子の数)」の設定や、どのようにデータをサンプリングしたかに応じて、将来の火災件数の予測が**40%**も変動してしまいました。
- なぜこれが重要なのか: もし政府機関が、コンピューターのコード内の設定を少し調整しただけで、どこに消防車を送るかを決めるためにこれらのモデルを使用しているとしたら、ある地域には消防車を送りすぎ、別の地域には全く送らないという事態を招く可能性があります。
結論
この論文は、「数式(解析的なキャリブレーション)」はこの特定の作業においては壊れた道具であると結論付けています。それは以下のような状況を作り出します:
- 設定(手がかりの数など)を変えると、本来変わるはずのない答えが変わってしまう。
- モデルは時として、マイノリティのクラスが実際よりも一般的であると予測してしまい、数式はそれを修正できない。
解決策: 厳格な数式を使う代わりに、著者たちは「学習」手法(ベータ・キャリブレーションなど)を使用することを提案しています。これは、計算機を使って調整量を計算しようとするのではなく、実際に完成したスープを味わい、どのように味付けを調整すべきかを学ぶ**「味見役」**を雇うようなものです。
一文での要約
決定木ベースのモデルにおいて「不均衡な」データを修正するために単純な数式を使用することは機能しません。それは予測を極めて不安定にし、時には稀なイベントを過大評価させる原因となるため、バイアスを修正するには数式ではなく、よりスマートな学習ベースの方法を用いる必要があります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。