Extremely coarse learning objectives induce human-aligned representations in AI vision models
本研究は、わずか8つ程度の広範なカテゴリを区別するといった極めて粗い学習目的でAIビジョンモデルを訓練することが、微細な分類や自己教師あり学習タスクで訓練されたモデルよりも、人間の神経応答や知覚的判断により密接に一致する内部表現を生み出すことを示している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
何十年もの間、科学者たちは人間の脳がいかにして光の奔流を世界の鮮明な画像へと変換しているのかを理解しようと試みてきました。彼らは、私たちの視覚システムが情報を整理し、自然界の混沌を「動物」、「道具」、「乗り物」といった整然としたカテゴリーに分類する方法の中に、その答えがあるのではないかと長らく疑ってきました。これらの仮説を検証するため、研究者たちは脳の構造を模倣した人工知能システムを構築し、数千もの特定の物体を認識するように訓練してきました。これらのデジタルな脳は強力なツールとなりましたが、一つの疑問が残っていました。それは、人間のような視覚的理解を築くために、脳は実際にこれほど膨大な数の特定のラベルを学習する必要があるのだろうか、という点です。おそらく、人間のように見るための秘訣は、膨大な物体の百科事典を暗記することではなく、もっと単純で、より広範な方法で世界を分類することを学ぶことにあるのかもしれません。
ジョンズ・ホプキンス大学の研究チームは、標準的なAI訓練の複雑さを削ぎ落とすことで、この可能性を検証することに乗り出しました。彼らは、一般的な慣行のように、人工ネットワークに対して1,000種類もの異なる画像のカテゴリーを区別するように教える代わりに、同じ画像をほんの一握りの非常に広範なグループに分類するように教えました。彼らはこれらのグループに対して人間によるラベルを使用しませんでした。代わりに、コンピュータ自身にデータ内の自然な区分を見つけさせ、「生物」と「機械」を分けたり、「屋内シーン」と「屋外シーン」を分けたりするようなカテゴリーを作成させたのです。その後、彼らはこれらのネットワークを数百個訓練し、グループの数をわずか2個から最大64個まで変化させながら、生成されたデジタルな脳が、実際のヒトの脳活動やヒトの観察者の行動とどの程度一致するかを比較しました。
結果は驚くべきものでした。研究者たちは、これらの極めて単純で粗いカテゴリーに基づいて訓練されたネットワークが、1,000もの全カテゴリーに基づいて訓練されたネットワークと同等、あるいはそれ以上に優れた、ヒトの脳活動に合致する視覚世界の内部マップを発達させていることを発見しました。彼らが、人工的な脳がヒトの視覚野のスキャンやマカク猿の脳からの記録とどの程度一致するかを測定したところ、わずか8つの広範なグループのみで訓練されたモデルは、最も複雑なモデルと同等の性能を示しました。さらに驚くべきことに、これらの単純なネットワークは、現在利用可能な最も高度な人工知能システムを含む他のどのモデルよりも、どの物体同士が互いに似ているかというヒトの判断に対して、より良く一致しました。
この発見は、人間のように見るマシンを構築するためには、膨大で詳細な特定の物体名のリストを学習させなければならないという、支配的な考え方に異を唱えるものです。この研究は、ヒトの視覚システムが、洗練された世界の理解を構築するために、きめ細かな1,000通りの分類タスクを必要としていない可能性を示唆しています。むしろ、画像を広範で意味のあるクラスターにグループ化する能力さえあれば、私たちの視覚を反映した視覚表現を生み出すには十分であると考えられます。研究者たちは、この効果が、古い単純な設計から現代の複雑なシステムに至るまで、異なるタイプのニューラルネットワーク・アーキテクチャにわたって成立すること、そして訓練データが限られている場合でも機能することを示しました。
チームはまた、これらの広範なカテゴリーを作成する特定の方法が重要であるかどうかについても調査しました。彼らは、カテゴリーが画像自体の統計的なパターンから導き出されたものであっても、「自然対人工」や「小さい対大きい」といった明確で人間が理解可能な概念によって定義されたものであっても、結果が変わらないことを発見しました。これは、鍵となる要因が、使用される特定のラベルではなく、学習目標自体の「粗さ(coarseness)」にあることを示しています。さらに本研究は、これらの粗い訓練を受けたネットワークが、単に複雑なネットワークが学習するものの簡略版を学んでいるのではなく、ヒトの知覚により密接に一致する、根本的に異なる方法で視覚情報を整理していることを示しました。
驚くほど単純な学習目標が、ヒトと一致する視覚を生み出すことを示すことで、この研究は、マシンが「見る」ために何が必要であるかという我々の理解を再構築しています。それは、人工知能が真に人間の知覚を反映するものへの道は、より多くのデータやより複雑なタスクを与えることにあるのではなく、世界をより広範で、より根本的な観点から見るように教えることにあるのかもしれない、ということを示唆しています。これらの知見は、単に強力であるだけでなく、人間が視覚的な経験をどのように知覚し、整理しているのかと真に一致するAIシステムを構築するための、新たな道を切り開くものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。