LLM-Based Selection of Incongruent Verbal and Nonverbal Behavior for Virtual Humans
本論文は、エクマンの枠組みに基づいた言語・非言語の不一致に関する分類法を提案し、バーチャルヒューマンに対して文脈上適切な不一致行動を選択するために大規模言語モデルを用いることを調査し、ヒト被験者研究を通じて、意図した観察者効果を生み出す上でのそれらの有効性を検証するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
言葉の合間に存在する静かな空間において、人間のコミュニケーションはしばしば最も複雑な働きを見せる。私たちが話すとき、単に情報を伝達しているのではない。顔や目、そして姿勢を通じて、感情や社会的地位、そして隠された意図を投影しているのである。これらの非言語行動として知られる沈黙のシグナルは、言葉を補強することもあるが、言葉と矛盾することもある。人は「大丈夫です」と言いながら、顔をこわばらせて不安を表したり、賞賛を口にしながらも、皮肉を感じさせるトーンで話したりすることがある。体が口よりも真実を語ってしまうことや、礼儀正しい微笑みの後ろに真の感情を隠すこの能力は、人間が人間関係を築き、葛意を管理し、信頼を示すための根本的な部分である。何十年もの間、研究者たちはコンピュータにこの複雑さを模倣させるべく、人間のように動き、ジェスチャーをするバーチャルエージェントの構築を試みてきた。しかし、こうしたデジタルキャラクターの多くは、「言葉が幸せなら、顔も幸せであるべきだ」という単純なルールに限定されてきた。彼らは、時には言葉とは別のことを体が示すことこそが、最も正直な振る舞いになり得るということを理解できていなかったのである。
ノースイースタン大学の研究チームは、この限界を変えようと試みた。彼らは、大規模言語モデルとして知られる一種の人工知能を用いて、バーチャルヒューマンにこうした微妙で矛盾した振る舞いを自動的に生成させる方法を教えられるかどうかを検証したかった。これらのモデルは膨大なテキスト量で学習された強力なシステムであり、文脈やニュアンスを理解することができる。研究者たちは特定の問いを立てた。もしコンピュータに会話と状況の説明を与えた場合、コンピュータは、話し手が何か良いことを言っている時にあえて不幸そうに見えたり、悪いニュースを伝えている時に親しみやすく見えたりすべき場面を、判別できるのだろうか。彼らは単にコンピュータに推測させたいのではなく、人間が見た時にリアルだと感じられるような方法で、コンピュータがこれらの選択を行えるかどうかを確認したかったのである。
これをテストするために、チームはまず、人々がどのように言葉と行動を食い違わせるのかという多様な方法のマップを作成した。彼らは、人がこのような行動をとる主な理由を4つ特定した。一つはアイロニー(皮肉)であり、話し手が誰かを侮辱するために賞賛を用いたり、愛情を示すために批判を用いたりする場合である。もう一つはフェイス・セービング(面目を保つこと)であり、相手の感情を傷つけないように厳しい批判を温かい微笑みで和らげたり、あるいは自身の怒りを隠すために礼儀正しい微笑みを強いたりする場合である。また、デセプション(欺瞞)もあり、これは人が秘密の感情を隠そうとする場合である。そしてエモーショナル・レギュレーション(感情調節)があり、これは湧き上がってくる感情を抑えようとする場合である。これらのカテゴリーを用いて、研究者たちは、例えば業務量を増やした上司に対して部下が話す場面や、ティーンエイジャーの息子にフィードバックを与える母親といった、8つの具体的なシナリオを設計した。
研究者たちは、コンピュータに振る舞いを生成させるための3つの異なる方法をテストした。第一の方法では、コンピュータに発言された文章のみを与えた。第二の方法では、その文章に至るまでの会話の履歴を追加した。第三の、最も詳細な方法では、会話の履歴に加えて、話し手同士の関係性と社会的設定に関する記述を提供した。Claudeと呼ばれるモデルによって駆動されるコンピュータは、各文章に対してキャラクターの顔と目がどうあるべきかを決定するよう求められた。結果は明白であった。コンピュータに言葉だけを与えた場合、言葉がポジティブであれば顔もポジティブに、言葉がネガティブであれば顔もネガティブにするという傾向が強く見られた。しかし、研究者が完全なコンテキスト――権力構造、履歴、そして社会的圧力――を提供すると、コンピュータは言葉と矛盾する振る舞いを選択し始めた。部下が要求の厳しい上司に対して追加の仕事を承諾しなければならないシナリオでは、コンピュータは、控えめで抑制された微笑みと、一瞬視線を逸らす動作、そして唇を引き締める動作を選択した。コンピュータは、従業員が「はい」と言いながらも「ノー」と感じていることを理解していたのである。
コンピュータが生成した選択肢が実際に機能するかどうかを確認するため、研究者たちはそれらのデジタル指示をバーチャルヒューマンのビデオクリップへと変換し、人々に提示した。最初の研究では、参加者に一対のビデオを見せ、どちらの話し手がよりポジティブな態度を持っているかを判断させた。バーチャルヒューマンがポジティブなことを言っているのにネガティブな表情を見せた場合、人はその態度を、人間が幸せそうな表情を見せていた時よりも一貫してポジティブではないと評価した。逆に、人間がネガティブなことを言っている時に温かい微笑みを見せた場合、人はその態度を、人間が怒っている時よりもポジティブであると評価した。第二の研究ではさらに踏み込み、人々が目にした特定の感情を評価させた。結果は、コンピュータが選択した非言語的キューが、話し手の感情に対する人々の感じ方を変化させるほど強力であることを示した。もしコンピュータが、幸せな文章に合わせて眉をひそめる動作を選べば、人々はその話し手が実際には怒っているか、あるいは皮肉を言っていると感じた。もしコンピュータが、悲しい文章に合わせて温かい微笑みを選べば、人々は怒りではなく共感を感じた。
この研究は、人工知能に会話の完全な社会的コンテキストを提供することで、言葉だけに依存する場合よりもはるかに人間らしい非言語的振る舞いを生成できることを裏付けている。コンピュータは単に文章の感情を繰り返すのではなく、状況を解釈し、矛盾した反応を示すことが最も誠実な対応であると判断したのである。研究者たちは、彼らのシステムがジェスチャーや声のトーンを扱うにはまだ改善が必要であることや、ビデオが短尺であることを指摘したが、核心となる発見は極めて重要である。バーチャルヒューマンが、特にセラピストの訓練や交渉といった役割において真に説得力を持つためには、口が語る言葉とは異なる物語を体で語ることができなければならないことを示唆している。コンピュータは、時には真実は言葉の中ではなく、その間にある沈黙の中にこそ存在するのだということを学んだのである。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。