GPT-4o reads the mind in the eyes
この研究は、GPT-4oが正立した顔から精神状態を推論する際には人間を凌駕するものの、反転した顔に対しては性能が低下し、かつ人種的バイアスを示すことを明らかにしており、人間のような認知特性と、人間の認知とは異なる体系的な処理の違いが複雑に混在していることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大切なアイデア:AIは「場の空気」を読めるのか?
パーティーに参加しているところを想像してみてください。誰かの目を見ただけで、その人が退屈しているのか、不安を感じているのか、あるいは密かに楽しんでいるのかを瞬時に察知できます。人間はこのエキスパートであり、目を見るだけで「心を読み取る」ことができます。
この論文は、シンプルな問いを投げかけています。「超高性能なコンピュータ(GPT-4o)も、同じことができるのだろうか?」
研究者たちは単にAIに推測させただけではありません。「Reading the Mind in the Eyes Test(目による心の読み取りテスト)」と呼ばれる厳格なテストを実施しました。AIと人間のグループに目の写真を見せ、「この人は何を感じているか?」と問いかけました。答えは、4つの言葉のリスト(例:不安、自信、皮肉、退屈)の中から選ばなければなりません。
実験:上下逆さまのトリック
AIと人間がどのように考えているのかを探るため、研究者たちは古典的なトリックを使いました。それは、写真を上下逆さまにして見せることです。
- 人間の反応: 人間が顔を上下逆さまに見るとき、それはまるで、ほとんど理解できない外国語で書かれた本を読もうとしているようなものです。難易度は上がりますし、ミスも増えます。しかし、それでも感情を推測するために、同じ「心の辞書」を使用します。
- AIの反応: AIは、顔が正しい向きのときには、目の表情を読む能力において人間よりも優れていました。しかし、顔が上下逆さまになると、AIは単に少し混乱するだけでは済みませんでした。完全に道を見失い、精度はラン速な推測(当てずっぽう)から期待される水準すら下回りました。
たとえ話: 人間とロボットがパズルを解こうとしている場面を想像してください。
- 正しい向き: ロボットは天才であり、人間よりも速く正確にパズルを解いています。
- 逆さまの向き: 人間はただパズルを手に取ってひっくり返し、そのまま解き続けようとします。しかし、ロボットはパズルの解き方そのものを忘れてしまったかのように、パズルのピースを壁に向かって投げ始めます。
「バイアス」の問題:期待したものを見る
研究者たちは、異なる人種(白人と非白人)の顔を用いてAIのテストも行いました。
- 人間: この研究において、人々はあらゆる人種の目の表情を読むことにおいて、等しく優れた能力を示しました。
- AI: AIは、非白人の顔よりも白人の顔を読む方がはるかに上手でした。まるで、AIにはより深く理解している「お気に入りの」グループがあるかのようです。これは、おそらくAIが特定の顔に関するデータで多く学習されたためと考えられます。
「エラー」の探偵作業:なぜ間違えるのか
この研究の最も興味深い部分は、単に誰が正解したかではなく、どのように間違えたかという点にあります。
間違いを「雪に残った足跡」と考えてみてください。
- 人間の足跡: 人間が間違いを犯すとき、その足跡は少し散らばっています。もし「怖い」の代わりに「怒っている」と答えたなら、次は「幸せ」と答えるかもしれません。彼らのエラーはある程度ランダムであり、状況に応じて変化します。
- AIの足跡: AIの足跡は驚くほど一貫していました。もし間違いを犯すのであれば、毎回全く同じ間違いを犯すのです。
- ひねり: 顔が上下逆さまになっているとき、AIは単にランダムな足跡を残したわけではありません。AIは、正しい向きの顔に対して見せていたものとは全く異なる、完全に新しい、硬直したミスのパターンを生み出したのです。
結論: 人間は物事が難しくなったとき(逆さまのとき)、思考の「効率」は変わりますが、「論理」は維持します。しかし、AIは物事が難しくなると、全く別の、壊れた論理へと切り替わってしまうようです。
間違いに含まれる「情報」
研究者たちは、これらの間違いを分析するために「情報理論」という数学的概念を用いました。その結果、AIの間違いは人間よりも多くの情報を含んでいることが分かりました。
たとえ話:
- 人間の間違い: テストで適当に勘で答えている学生のようなものです。彼らの誤答からは、彼らが何を考えていたのかについては何も分かりません。
- AIの間違い: 「猫」と「犬」を常に混同するけれど、「猫」と「車」は決して混同しない学生のようなものです。たとえ間違っていたとしても、そのパターンを見れば、その脳(あるいはコード)がどのように概念を繋げているのかが正確に分かります。AIはただ推測していたのではなく、たとえ不正確であっても、特定のルールブックを一貫して適用していたのです。
研究結果のまとめ
- 超人的だが脆弱: GPT-4oは、通常の状態であれば目の表情を読む能力が非常に高く、しばしば人間を凌駕します。
- 反転効果: 顔が上下逆さまになると、AIは人間よりもはるかに深刻に崩壊します。
- 人種バイアス: AIは非白人の顔よりも白人の顔を読む方が得意ですが、この研究における人間にはそのような差は見られませんでした。
- 系統的なエラー: AIはランダムな間違いをしません。AIは非常に一貫しており、構造化された間違いを犯します。それは、人間とは根本的に異なる情報の処理方法(特に、逆さまの顔のようなトリッキーな入力に対する処理)を明らかにしています。
要するに、AIは極めて優秀ですが、融通の利かない学生です。学習データから表情の「正しい」読み方を暗記していますが、テストが特殊になったり(逆さま)、対象が異なったり(異なる人種)すると、人間のように適応することができません。ただ、壊れた台本に従うだけなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。