← 最新の論文
🤖 machine learning

Distributions In, Distributions Out: The Case for Soft-Label Training

本論文は、教師あり分類器の学習において、多数決による集約されたハードラベルではなく、アノテーターのラベルの全分布(ソフトラベル)を用いることで、精度が向上し、人間による注釈からの乖離が減少し、さらに、視覚および自然言語処理タスクにおけるモデルの不確実性が、真の人間同士の不一致とより良く一致することを実証している。

原著者: Agamdeep Singh, Ashish Tiwari, Hosein Hasanbeig, Priyanshu Gupta

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Agamdeep Singh, Ashish Tiwari, Hosein Hasanbeig, Priyanshu Gupta

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

知らないことを知る技術

想像してみてください。あなたはロボットに世界の「見え方」を教えようとしています。あなたはロボットにぼやけた形の写真を見せ、「これは猫ですか、それとも犬ですか?」と尋ねます。もしあなたが10人の異なる人々に同じ質問をしたとしたら、「猫」という票が6票、「犬」という票が4票集まるかもしれません。人工知能の世界において、これは古典的な問題です。つまり、世界が常に白黒はっきりしているわけではないということを、どうやって機械に理解させるか、という問題です。

長い間、これらの機械を訓練する標準的な方法は、単一の答えを強制することでした。私たちはそれら10人の人間の投票を集計し、ロボットに「答えは猫です」と伝えます。そして、4票の「犬」という意見は捨て去り、その画像には曖昧さが存在しなかったかのように扱います。これは、赤い止まれの標識を識別するといった、明確なものに対しては非常にうまく機能します。しかし、人間自身が同意できない場合には、この手法は破綻します。もし人間がトリッキーな画像を見て確信が持てない状態なのに、ロボットが「100%猫である」と言わなければならないとしたら、そのロボットは自分自身の自信について嘘をついていることになります。それは、雨が降る確率が50%であることを知りながら、単純な予報に合わせるために「絶対に雨が降ります」と言い張る気象予報士のようなものです。

本論文は、機械学習における特定の領域である**教師あり分類(supervised classification)について深く掘り下げています。簡単に言えば、これはラベル付きの例を示すことで、コンピュータに物事をカテゴリー(例えば、「丁寧」なテキストか「失礼」なテキストか、あるいは「猫」か「犬」か)に分類する方法を教えることです。著者たちが投げかける大きな問いは、「人間がラベルに対して意見が分かれたとき、コンピュータに単一の勝者を選ばせるべきか、それとも群衆全体の不確実性から学ばせるべきか?」**ということです。著者たちは、単一の答えを強制することは、現実の世界がどのように機能しているかについての貴重な情報を捨て去ってしまうことだと主張しています。

ソフトラベルの意義:群衆の声を聞かせる

この論文の著者であるAgamdeep Singh氏とMicrosoftの研究チームは、異なるアプローチをテストすることに決めました。彼らは、人間の意見のグループを一つの「ハード(硬い)」なラベル(例えば、単一の「猫」)へと集約する代わりに、回答の**完全な分布(full distribution)を用いてAIを訓練することを試みました。彼らはこれをソフトラベル訓練(soft-label training)**と呼んでいます。

次のように考えてみてください:

  • ハードラベル訓練は、トリッキーな質問に対してクラスの投票を行い、60%の生徒が答えは「A」で、40%が「B」だと考えているのを見た教師が、黒板に「答えはAです」と書くようなものです。教師は生徒に「答えはAだ。暗記しなさい」と言います。生徒は、クラスの意見が割れていたにもかかわらず、「A」に対して100%の確信を持つように学習します。
  • ソフトラベル訓練は、教師が黒板に「私たちのうち60%はAだと考え、40%はBだと考えています」と書くようなものです。教師は生徒に「答えは混ざり合っています。Aに対して60%、Bに対して40%の確信を持ちなさい」と言います。生徒は、その場の実際の混乱を反映するように学習します。

論文では、このアイデアを3つの異なるデータセットでテストしています。論理構造を理解するためのもの(ChaosNLI)、テキストの丁寧さを判断するためのもの(POPQUORN)、そして写真の中の物体を識別するためのもの(CIFAR-10H)です。いずれの場合も、データは混沌としており、人間が正しい答えについて真に意見を異にしているものでした。

彼らが発見したこと:不確実性はバグではなく、特徴である

結果は驚くほど明快でした。研究者たちが、「ハード」モデル(単一の答えで教えられたもの)と「ソフト」モデル(群衆全体の分布で教えられたもの)を比較したところ、ソフトモデルは、人間の不確実性を理解するという観点において、ほぼすべての重要な側面で勝利しました。

1. 人間の混乱に一致する能力が高い
最も重要な指標は、コンピュータの推測が、実際の人間による投票の広がりとどれだけ近いかでした。著者らは、この誤差を測定するために**KLダイバージェンス(KL divergence)という数学的ツールを使用しました。数値が低いほど、コンピュータが現実の人間により近いことを意味します。ソフトラベルモデルは、すべてのデータセットにおいて、この誤差を平均で32%**減少させました。平たく言えば、ソフトモデルは「私は完全には確信が持てず、具体的にはこれくらいの不確実性があります」と言うことに非常に長けており、人間がデータに対して実際に感じていた感覚と一致していたのです。

2. 正解率を損なわない
よくある懸念は、コンピュータに「不確実であること」を教えると、正しい答えを得る能力が低下するのではないか、というものです。論文は、これが事実ではないことを示しています。丁寧さのデータセット(POPQUORN)と画像データセット(CIFAR-10H)において、ソフトラベルモデルはハードラベルモデルと同等の精度を示しました。論理データセット(ChaosNLI)においては、ソフトラベルモデルの方がむしろ高精度でした(55.30% 対 51.75%)。つまり、不確実性に対して正直であることが、彼らを愚かにするのではなく、より賢くさせたのです。

3. 「いつ」不確実になるべきかを知っている
これはおそらく最も興味深い発見です。研究者たちは、コンピュータの「不確実性」(エントロピーによって測定)がサンプルごとにどのように変化するかを観察しました。その結果、ソフトラベルモデルにおいて、コンピュータの不確実性は、ハードラベルモデルよりも61%強く人間の不確実性と連動していることが分かりました。

  • もし人間がある特定の写真に対して混乱していれば、ソフトラベルモデルも同様に混乱していました。
  • もし人間が100%確信を持っていれば、ソフトラベルモデルも100%の確信を持っていました。
  • しかし、ハードラベルモデルは、人間が意見を割れている場合でも、自信満々に間違えたり、自信満々に正解したりする傾向がありました。彼らは曖昧さを「感じ取る」ことができなかったのです。

なぜこれが重要なのか

本論文は、すべての人間の意見の相違を単一の「多数決」へと集約してしまう従来の方法は、間違いであると主張しています。その方法は、人間の意見の相違を、修正されるべき「ノイズ」や「間違い」として扱っています。著者らは、専門家が意見を異にする場合、その相違こそがしばしば**「真実」**であると示唆しています。それは、世の中のいくつかの事柄(ジョークが丁寧かどうか、あるいは、ぼやけた動物が猫であるかどうかなど)が、本質的に曖昧であるという事実を反映しているからです。

回答の完全な分布に基づいて訓練することで、私たちはより誠実なAIシステムを構築できます。それらは、知らないことを知っているふりをすることはありません。著者らは、たとえ1枚の画像に対する人間の投票数が非常に少なくても(わずか6〜7票)、この手法は機能することに注意を促しています(投票数が多い場合はさらに効果的です)。

結局のところ、この論文は、安全性、丁寧さ、あるいは好みの判断といった、人間の判断が関わるあらゆるタスクにおいて、AIに単一の勝者を選ばせることをやめるべきだと提案しています。代わりに、群衆全体から学ばせるべきなのです。著者たちが述べているように、信頼できるAIを実現するためには、自分が何を知らないのかを知っているシステムが必要なのです。ソフトラベル訓練は、まさにそれを教えるための方法なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →