Evaluating Epistemic Uncertainty: Beyond OOD Detection and Active Learning
本論文は、従来のプロキシ・タスクではなく後悔最小化に基づいた認識論的不確実性を評価するための決定論的枠組みを提案しており、標準的な相関指標が運用の有用性を予測できないことを実証し、不確実性手法の決定論的ランキングとプロキシ・タスクによるランキングとの間の重大な相違を明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
宇宙船の船長であるあなたを想像してください。あなたは混沌とした星雲の中を航行しています。あなたの宇宙船のコンピュータは非常に賢いのですが、報告すべき2つの異なる種類の「不確実性」を持っています。一つ目はアレオトリック(偶然的)不確実性です。これは「戦場の霧」のようなものです。センサーのノイズ、ラジオの静電気、そして星雲自体がただ無秩序で予測不能であるという事実です。どれほど優れたコンピュータであっても、このノイズは常にそこに存在します。それは宇宙の不可避な混沌なのです。二つ目はエピステミック(認識的)不確実性です。これはコンピュータの「無知」です。コンピュータが未経験の領域を見たときに、「この領域については勉強していないので、何があるのか全く分かりません」と感じる感覚のことです。この種の不確実性は軽減可能です。コンピュータがより多くのことを学べば、この恐怖は消え去ります。
長い間、より優れたAIを構築しようとする科学者たちは、コンピュータに「霧」と自身の「無知」の違いを教えることに執着してきました。なぜでしょうか?なぜなら、コンピュータが自身の無知を知っていれば、「分かりません、私に聞かないでください」と言い、危険な間違いを避けることができるからです。しかし、ここからが厄介なところです。コンピュータが自身の無知を見抜くことに本当に長けているかどうかを、どうやってテストすればよいのでしょうか?伝統的に、研究者たちは主に2つの「プロキシ(代理)テスト」を使用してきました。一つは分布外(OOD)検知で、「見たこともない、全く奇妙なものを見ているときに、それを察知できるか?」と問います。もう一つは**能動学習(アクティブラーニング)**で、「もし新しいデータを一つだけ学習できるとしたら、どれが最も多くのことを教えてくれるか?」と問います。大きな疑問は、これらのテストが、本当にコンピュータが自身の無知を察知する能力を測っているのか、それとも全く別の何かを測っているのか、ということです。
「Evaluating Epistemic Uncertainty: Beyond OOD Detection and Active Learning」と題されたこの論文は、私たちは「間違ったゲーム」に参加しているのだと主張しています。プラハ、ヘント、ミュンヘンの大学の研究チームである著者らは、奇妙なデータを見分けるための数学的な「正解」と、学習のための最適なデータを選ぶための「正解」、あるいは能動学習の「正解」は、実は「自身の無知(後悔/Regret)を察知する」ための数学的な「正解」とは完全に異なるものであることを発見しました。
これを理解するために、あなたが生徒を採点する教師であると想像してください。
- OODテストは、教師に「この問題はエイリアンによって書かれたものかどうか判別できますか?」と尋ねるようなものです。正解は、問題がどのように見えるかにのみ依存し、生徒が答えを知っているかどうかには依存しません。
- 能動学習テストは、「生徒が最も多く学ぶためには、次にどの問題を出すべきか?」と尋ねるようなものです。正解は、生徒の「将来の知識」がどれほど向上するかによって決まります。
- **後悔(Regert)テスト(エピステミック不確実性)**は、「この特定の質問に対して、生徒が単に知識不足であるために、どれほど間違える可能性があるか?」と尋けることです。
論文は、これら3つの「正解」がしばれて全く異なる方向を指し示すことを数学的に証明しています。あるコンピュータは、エイリアンの質問を見抜くことには長けていても、特定の数学の問題で失敗することを予見することには極めて劣っているかもしれません。実際、著者らは、関数「ロッセリーニ関数」に着想を得た、単純な一次元の「サンドボックス」の世界を構築し、OOD検知のための最善の戦略は特定の領域を拒絶するように指示する一方で、後悔を最小化するための最善の戦略はその同じ領域を受け入れるように指示することを示しました。これらは根本的に乖離しています。
この不一致があるため、著者らは、OOD検知や能動学習を、コンピュータが自身の無知を理解しているかどうかを判断するための「プロキシ」として使用することは欠陥があると主張しています。彼らは、OODテストで1位となった手法が、後悔テストでは10位になることもあること、またその逆も然りであることを示しました。例えば、CIFAR-10Hデータセット(多くの人間の意見が含まれた画像コレクション)を用いたテストでは、「エビデンシャル・ネットワーク(Evidential Networks)」は奇妙なデータの検知(OOD)には全く役に立ちませんでしたが、自身がどのように無知であり、間違いを犯す可能性が高いかを特定することにおいては絶対的な最善手でした。逆に、「ディープ・アンサンブル(Deep Ensembles)」は奇妙なデータの検知には優れていましたが、後悔を最小化することには失敗しました。
さらに、この論文は、AI分野で人気のある「もつれ解消(disentanglement)」という概念にも切り込んでいます。最近、一部の研究者は、コンピュータの「霧」のスコアと「無知」のスコアが高度に相関している(共に増減している)場合、コンピュータがこれら2つの概念を分離できていないと考えています。著者らはこれに異を唱えます。彼らは、スコアが高度に相関していても、コンピュータは依然として完璧な意思決定を下せる可能性があることを示しました。彼らは、単にスコアの相関をチェックするのではなく、より実用的な新しいテストである**パレート・ギャップ(Pareto-gap)**を提案しています。
パレート・ギャップを「意思決定マップ」と考えてみてください。3次元のグラフを想像してください。そこでは、回答する質問の数(カバレッジ)、犯す間違いの数(リスク)、そして回避する「無知」(後悔)の間でトレードオフが行われます。「完璧な」コンピュータは、このマップ上に滑らかな理想的な曲線を描きます。著者らは、現実のコンピュータの曲線が、その完璧な線にどれだけ近いかを測定しています。彼らは、スコア間の相関が高い手法(これは以前は悪いことだと考えられていました)であっても、非常に優れた曲線を描くことができ、運用上極めて有用であることを発見しました。
要約すると、著者らは、モデルが奇妙なデータを察知する能力や学習トピックを選ぶ能力を見るだけで、そのモデルが自身の無知を理解しているかどうかを判断することはできないと証明しています。彼らは、不確実性を「より良い意思決定を行うためのツール」として扱う新しいフレームワークを提供し、古いテスト方法が、実際には誤った結論へと導いていることを示しました。彼らの知見は、厳密な数学的証明と、高密度な人間による注釈を持つ現実世界のデータセットを用いた広範なベンチマークに基づいており、この分野は、便利ではあるが誤解を招きやすいプロキシ・テストへの依存をやめ、不確実性を「実際に回避される後悔(Regret)」に基づいて測定し始める必要があることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。