One of the Above, None of the Above: Why the Same Model Should Not Predict Both
本論文は、新規性の予測には、適切に規定された文脈の中でカテゴリーの吸収とカテゴリーの開放を明示的に分離することが必要であり、タスクの構造が適切に考慮されている場合には、単純な組合せ論的ヌルモデルがピットマン・ヨー過程のような複雑な富める者がさらに富むモデルよりも優れた性能を示すことが多いことを論じている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
私たちの精神は、日々、世界をグループ分けすることに忙しくしています。新しい言葉を聞いたり、見慣れない動物を見たり、新しい種類の車に気づいたりするとき、脳はこう判断しなければなりません。「これは以前に見たことがあるものか、それとも全く新しいものか?」という問いです。この一瞬の判断こそが、知っている顔を認識することと、知らない人を見分けることの違いを生んでいます。数十年にわたり、学習やカテゴリー化の研究を行ってきた科学者たちは、多くの場合、この決定を一つの「コイン投げ」のような単純な事象として扱ってきました。彼らは、もしある項目が既存のグループに適合しない場合、自動的に新しいグループが作られるはずであり、既存のグループに固執する数学的仕組みと、新しいグループを作る際の数学的仕組みは同じであると考えてきました。
しかし、新しい研究は、この単純な見方が間違っている可能性を示唆しています。ワルシャワ医科大学のウカシュ・コナレク(Lukasz Konowalek)による研究は、脳はおそらくこれら二つのタスクに対して、二つの異なる戦略を用いていると主張しています。一つは、すでに知っていることを認識するための戦略であり、もう一つは、いつ新しいカテゴリーを作成すべきかを判断するための戦略です。この研究は、一つのモデルを用いて両方の行動を説明しようとすると誤差が生じること、そして、私たちが学習する文脈――すなわち、選択肢が閉じられた集合であるのか、あるいは開かれた無限のストリームであるのか――によって、ゲームのルールが完全に変わることを示しています。
実験を理解するために、会話、ビデオ、あるいは単語のリストのような、情報の流れ(ストリーム)を想像してみてください。その流れを進むにつれて、あなたは常に、次に現れるアイテムが、たった今見たものの繰り返しなのか、それとも新鮮な発見なのかを自問しています。研究者たちは、このストリームをテストするために、5つの異なる種類の現実世界のデータを用いました。彼らは、文書内での言葉の使い方、物語における人物や物体への言及の仕方、会話における話し方、そしてビデオエディターがシーンの変化をどのようにマークするかを調査しました。これらのストリームの中には、特定のソフトウェアで使用されるダイアログタグのように、選択肢のリストが固定されていて小さいものもあります。一方で、言葉や名前の無限の多様性のように、リストが開かれており、潜在的に無限であるものもあります。
研究者たちは、これらのストリームの次に何が起こるかを予測するコンピュータモデルを構築しました。彼らは主に二つのアプローチをテストしました。第一のアプローチは、彼らが「組合せ的(combinatorial)」モデルと呼ぶもので、単純なカウント方法です。これは、特定のアイテムがどれほど頻繁に繰り返されるかを無視して、これまでに現れた異なるアイテムの数と、全アイテムの数だけを見ます。これは、「これまでに見たものの数に基づくと、それらを構成する方法はいくつあるか?」という基本的な問いを投げかけます。第二のアプローチは、「富める者はさらに富む(rich-get-richer)」モデルです。このモデルは、あるアイテムが以前に何度も現れたのであれば、それが再び現れる可能性が高いと仮定します。つまり、人気のあるものはさらに人気を博すという前提に基づき、人気のあるアイテムに重みを与えます。
研究の結果、どのモデルが最適に機能するかという答えは、コンピュータが何を予測しようとしているかに完全に依存していることが分かりました。アイテムが既に見られたものであるかどうかを予測するタスク(吸収:absorption)においては、単純なカウントモデルが最適でした。しかし、アイテムが真に新しい発見であるかどうかを予測するタスク(開始:opening)においては、「富める者はさらに富む」モデルの方が優れた結果を示すことがよくありました。驚くべきことに、ストリームに小さな固定された選択肢のリストがある場合、このパターンは逆転します。そのような閉じたシステムでは、「富める者はさらに富む」モデルが繰り返しの検知に優れ、単純なカウントモデルが新しいアイテムの検知に優れています。
この「交差した」パターンこそが、核心となる発見です。これは、既知のものを認識することと、新しいものを見つけることの両方を完璧に説明できる単一の数学的規則は存在しないということを意味しています。単語が繰り返されることを予測することに長けているモデルは、新しい単語が現れることを予測することには不得意である場合が多く、その逆もまた同様です。研究者たちは、人々がアイテムを分類するよう求められる制御された実験でもこのアイデアをテストし、単に「新しい」という回答が可能かどうかをチェックするだけのモデルが、過去の頻度に基づいて推測しようとする複雑なモデルよりも優れた性能を発揮することを見出しました。
これらの結果は、私たちの精神が、未知の事象を単なる「認識の残り物」として扱っていないことを示唆しています。むしろ、脳はおそらく二つの別々のプロセスを実行しています。一つのプロセスは、現在の状況の構造に調整されており、アイテムが既存のパターンに適合するかどうかをチェックします。もう一つのプロセスは、未知の可能性に調整されており、現在のパターンでは不十分であり、新しいカテゴリーを開く必要があるかどうかを判断します。この区別は極めて重要です。なぜなら、それは人工知能をどのように構築すべきか、そして人間の学習をどのように理解すべきかを変えることになるからです。もし機械に人間のように学習させたいのであれば、単にパターンを見つけるだけでなく、パターンを破って新しい何かを始める方法を知るための、別のメカニズムを持たせなければなりません。研究は、タスクの文脈――世界が閉じていて有限であるのか、あるいは開いていて無限であるのか――が、私たちがどの時点でこれら二つの精神的ツールのどちらを使うべきかを決定するという結論で締めくくられています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。