Position: Every Ground Truth is a Human Construction, not an Objective Truth
本ポジションペーパーは、機械学習におけるグラウンドトゥルース(正解)データセットは客観的な事実ではなく人間によって構築されたアーティファクトであることを論じ、「状況依存的な信頼性(situated reliability)」を通じてモデルの信頼性、透明性、および説明責任を向上させるために、その偶発的な性質を認めることを提唱するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに「猫」を認識させる方法を教えていると想像してみてください。あなたは数千枚の写真をロボットに見せ、「はい、これは猫です」「いいえ、これは犬です」とラベルを付けていきます。機械学習の世界では、あなたが与えるこれらのラベルは「グラウンド・トゥルース(正解の実態)」と呼ばれます。
長い間、科学者たちはこれらのラベルを「魔法の鏡」のように扱ってきました。彼らは、グラウンド・トゥルースとは、隠された宝の地図を見つける時のように、発見されるのを待っている完璧で客観的な現実の反映であると考えていたのです。
しかし、この論文は、その宝の地図はどこかに隠されているのではなく、私たちによって描かれているのだと主張しています。
著者であるCharlotte、Ericka、そしてKiriは、「グラウンド・トゥルース」とは空から降ってくる自然な事実ではないと言っています。それは「人間の構築物」なのです。それは、岩というよりは「レシピ」に近いものです。シェフが塩をどれくらい入れるか、いつかき混ぜるか、どの材料を使うかを決めるように、人間と機械は、AIを訓練するための「真実」を作り出すために、膨大な一連の選択を行っているのです。
「レシピ」の比喩
グラウンド・トゥルースのデータセットを作ることを、新しいブレンダーをテストするために巨大で複雑なスムージーを作ることに例えて考えてみましょう。
- フルーツ: どのフルーツを買うかを決めなければなりません。赤いリンゴだけにするのか、それとも緑のリンゴも入れるのか?
- カッター: 誰がフルーツをスライスするのか? プロのシェフか? 疲れ切ったインターンか? それともロボットのアームか?
- ブレンダー: 刃をどれくらいの速さで回転させるか?
- 味見: 誰がスムージーを「美味しい」と判断するのか?
論文は、もしこれらのステップのいずれかを変更すれば、異なるスムージーが出来上がるという点を指摘しています。「真実」(スムージーのレシピ)を変えれば、ブレンダー(AIモデル)が学習するものも全く異なるものになります。
なぜこれが重要なのか(「ピクセル」の問題)
著者たちは、なぜこれが重要なのかを示すために、実際の例を挙げています。コンピュータに手書きの数字を認識させるために使われる、MNISTという有名なデータセットがあります。1990年代当時、コンピュータは低速でメモリも少なかったため、データセットを作成した人々は、画像を128x128ピクセルから28x28ピクセルへと縮小することに決めました。
数十年前になされたこの一つの選択のために、今日の何千ものAIモデルは、28x28ピクセルの画像を見るように「のみ」訓練されています。もし今日撮影された高解像度の数字の写真を彼らに見せようとしても、彼らは読むことができません! 彼らは、当時のツールに合わせて下された決定によって、過去に縛り付けられているのです。彼らが学んだ「真実」は、数字そのものではなく、当時の利用可能なツールによって制限されていたのです。
「専門家」という神話
時として、私たちは専門家を、絶対的な真実を知っている「オラクル(神託)の神」のような存在だと考えがちです。あるいは、感情を持たず、ただ事実を記録するだけの「ロボットセンサー」のような存在だと考えることもあります。
しかし、論文はこう言います。「いえ、違います。」 専門家でさえ間違いを犯し、意見が食い違い、物事を異なる視点で捉えます。
- 医学の世界では、二人の医師が同じX線写真を見て、一人は「健康」と言い、もう一人は「病気」と言うことがあります。
- クラウドソーシングのプロジェクト(インターネット上で何千人もの人々に写真をラベル付けしてもらうようなもの)では、ある人はその写真を「幸せ」だと感じ、別の人は「悲しい」と感じるかもしれません。
もし私たちが、専門家を完璧なロボットであるかのように扱うなら、彼らの「真実」が、彼らの訓練や気分、そして与えられたルールによって形作られた「人間の意見」であるという事実を見落としてしまうことになります。
「状況的信頼性(Situated Reliability)」という考え方
著者たちは、私たちのAIが普遍的に完璧であると装うのをやめるべきだと提案しています。代わりに、**「状況的信頼性」**について語るべきだと述べています。
それは、サングラスのようなものだと考えてください。
- 晴れた砂漠では素晴らしい働きをします(特定のコンテキスト)。
- 暗い洞窟では最悪です(異なるコンテキスト)。
- 水中では役に立ちません。
サングラスは「壊れている」のではなく、状況的な用途を持っているのです。論文は、AIモデルも同様であると主張しています。特定の「グラウンド・トゥルース」で訓練されたモデルは、ある病院やある都市では完璧に機能するかもしれませんが、別の場所では惨めに失敗するかもしれません。私たちは、モデルが「どこで」「いつ」機能するのかについて、それがどこでも機能すると主張するのではなく、正直である必要があります。
私たちは何をすべきか?
この論文は「AIを作るのをやめろ」と言っているのではありません。私たちは**「正直な建設者」**になる必要があると言っているのです。
- 真実が魔法であると偽るのをやめる。 私たちがデータを構築するために選択を行ったことを認めましょう。
- レシピを書き記す。 データセットを共有するときは、どのようにそれを作ったのかを正確に説明すべきです。誰がラベル付けしたのか? どのようなツールを使ったのか? 何を省いたのか?
- 異なるレシピを試す。 たった一つの「グラウンド・トゥルース」を持つのではなく、AIがどのように変化するかを見るために、いくつかの異なるバージョンを作ってみるのもよいでしょう。
- 協力する。 機械学習の専門家は、その主題を実際に知っている人々(医師、生物学者、社会学者など)と対話し、その「真実」が現実世界において理にかなっているかどうかを確認する必要があります。
結論
この論文は、「グラウンド・トゥルース」とは固定され、不変の宇宙の事実ではないと示唆しています。それは、私たちの選択、私たちのツール、そして私たちの限界によって形作られた、人間が作った道具なのです。このことを認めることで、私たちは、すべてを完璧に見通す神であるふりをするのではなく、自らの限界を知る、より良く、より安全で、より誠実なAIを構築できるようになります。
著者たちは、この問題がまだ解決されたとは言っていません。彼らは、私たちが誤って「自信満々だが間違っているロボット」や、「ラボではうまく機能するが現実世界では失敗するモデル」を構築してしまわないように、**「このことについて話し始める」**必要があると言っているのです。それは、もう少し謙虚になり、機械に世界の捉え方を教える際にもっと慎重になるということなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。