FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models
本論文は、20秒間のアイスブレイク動画から二者間の親密度を推論するためのベンチマークであるFriendBenchを紹介しており、最先端のマルチモーダルモデルが人間の精度に匹敵する一方で、それらは異なる手がかりに依存し、ペアを他人と分類するバイアスを示すのに対し、人間は音声を超えた可視的な行動的手がかりを独自に活用していることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ある部屋に入り、二人の人が話している場面を想像してみてください。彼らの名前も分からず、何を話しているかも聞こえていません。しかし、わずか数秒のうちに、彼らが近況を報告し合っている親友同士なのか、それともぎこちなく打ち解けようとしている初対面の他人なのかを、多くの場合見分けることができます。この超能力は「ソーシャル・インテリジェンス(社会的知性)」と呼ばれます。それは、言葉だけに耳を傾けるのではなく、人々がどのように動き、間を置き、互いにどのように視線を送っているかを観察することで、その場の「雰囲気(バイブス)」を読み取る能力です。数十年にわたり、科学者たちは人間がどのようにこれを行っているかを研究してきましたが、今、私たちは大きな問いを投げかけています。「コンピュータにもそれができるのだろうか?」と。AIコンパニオンやミーティング・アシスタント、介護ロボットの開発が進む中で、これらの機械には、私たちと同じくらい人間関係を理解することが求められています。しかし、彼らに教え込むためには、まず、彼らが本当にその場を「読み取って」いるのか、それとも単に推測しているだけなのかを見極めるための公平なテストが必要です。
そこで、まさにこのことをテストするために設計された新しい実験、FriendBenchが登場しました。研究者たちは、デジタルな「アイスブレイク(緊張をほぐす)」の挑戦を用意しました。彼らは96組のペアを取り上げ、「空を飛べるのと透明になれるのと、どちらがいいですか?」という同じおどけた質問に答える20秒間のクリップを録画しました。一部のペアはすでに友人や家族(親しい関係)であり、他のペアは初めて会ったばかりの人々(他人)でした。全員が同じ質問に答えたため、使われた「言葉」によって答えがバレることはありませんでした。唯一の手がかりは、彼らがどのように話し、どのように振る舞うかにありました。
研究者たちは、二つのグループにこの謎解きを依頼しました。一方は大人数の人間のボランティア、もう一方は7つの主要テック企業から集まった26種類のAIモデルです。彼らは、テキストの書き起こしのみを読む方法、音声を聞く方法、そしてビデオを見る方法の3つの方法で、AIと人間をテストしました。
結果は以下の通りでした。まず、テキストのみのバージョンは、誰にとっても行き止まりでした。人の姿や声がなければ、人間もAIも、ランダムに推測する場合よりも高い精度を出すことはできませんでした。これは、関係性を隠すために会話のトピックが制御されていたため、理にかなっています。
音声を追加すると、状況は改善しました。人間も最高のAIモデルも精度が向上し、声のトーンや「間」が真の手がかりを持っていることが示されました。しかし、本当の魔法はビデオを追加した時に起こりました。人間は人々の顔やボディランゲージを見ることができれば、大幅に賢くなりました。彼らはそれらの視覚的な手がかりを利用して、正解率をさらに高めました。しかし、AIモデルは壁にぶつかりました。最高のAIモデルはビデオクリップにおいて人間の集団と同等の精度に達しましたが、そこに至るプロセスは異なっていました。
AIモデルは、人間が行うような方法で「友情」を見たわけではありませんでした。代わりに、彼らは一つのパターンに強く依存していました。それは、ほとんどの場合で「他人」と推測するという戦略です。テストには友人と同じ数の他人が含まれていたため、このバイアスによって偶然にも全体のスコアは高く保たれましたが、それは彼らが「友人」を見逃していることを意味していました。一方で、人間はバランスを保ち、友人である場合と他人である場合の両方を正しく識別できました。
要するに、最高のAIモデルは現在、このタスクにおいて人間の精度に匹察していますが、それは、人間関係を真に理解するのではなく、「誰もが他人である」と仮定する戦略に頼ることで達成されています。彼らは声は聞いていますが、ボディランゲージを読み取るまでにはまだ至っていないのです。これは、AIがソーシャルなタスクにおいて習熟してきている一方で、人間のように人間関係を真に理解できるようになるには、まだ長い道のりがあることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。