← 最新の論文
💻 computer science

Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion

本論文は、双方向クロスアテンションとゲート付きマルチモーダルユニットを介してテキスト、音声、および視覚的特徴を融合させることで、ECCV 2026のABAW11チャレンジにおいて、単一モードのベースラインおよびゼロショットモデルを大幅に上回る0.7394のマクロF1スコアを達成する、ビデオにおけるアンビバレンス(両価性)と躊躇を認識するためのマルチモーダルフレームワークを提案する。

原著者: Oussama Berhili, Yassine Ouzar, Larbi Boubchir

公開日 2026-07-20
📖 1 分で読めます☕ さくっと読める

原著者: Oussama Berhili, Yassine Ouzar, Larbi Boubchir

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

友人の様子を観察するだけで、その人が何を感じているのかを推測しようとしている場面を想像してみてください。時には簡単です。満面の笑みは「幸せ」を意味し、眉をひそめる顔は「悲しみ」を意味します。しかし、その人が葛藤しているような、難しい瞬間はどうでしょうか。例えば、声が震えているのに、顔は今にも泣き出しそうな様子で「大丈夫」と言っているときなどです。この混乱した感情の混ざり合いは、「アンビバレンス(両価性)」や「ためらい」と呼ばれます。それは、何かをしたいという気持ちと、それをするのが怖いという気持ちの間での、内なる綱引きのようなものです。コンピュータと人間の行動を研究する科学者たち(アフェクティブ・コンピューティングと呼ばれる分野)は、こうした微妙で複雑な信号を見つけ出す方法をコンピュータに教えようとしています。彼らは、一つの手がかり(例えば、声を聞くだけ、あるいは顔を見るだけ)では不十分なことが多いと知っています。人を本当に理解するためには、コンピュータは超スマートな探偵のように振る舞い、言葉、声のトーン、そして表情をすべて同時に組み合わせて、その人が真に何を感じているのかという謎を解き明かす必要があるのです。

この論文において、ウッサマ、ヤシーン、ラルビという研究チームは、まさにこのパズルを解くための「超探偵コンピュータ」を構築することに決めました。彼らは、ビデオ録画の中からアンビバレンスやためらいを見つけ出すことを目的とした、ABAW11というコンテストに参加しました。彼らはまず、3つの異なる「感覚」を個別にテストすることから始めました。テキストの書き起こしを読む脳、音声を聞く脳、そして顔のビデオを観察する脳です。その結果、単独の探偵としてはテキスト読み取りが最も優れており、正解率(Macro F1と呼ばれるスコアで測定)は約66.6%でした。音声リスナーはそれに僅かに続き、62.8%でした。そしてビデオウォッチャーは少し弱く、57.3%でした。興味深いことに、彼らが有名な「ゼロショット」AI(この特定のデータに対して学習されていないAI)を試したところ、正解率はわずか28.3%であり、この難しい仕事にはAIを特別に訓練する必要があることが証明されました。

しかし、本当の魔法は、探偵たちに一人で働かせるのをやめ、チームとして働かせたときに起こりました。研究者たちは、テキスト、音声、ビデオの脳が互いに会話できる特別なシステムを構築しました。彼らは「クロスアテンション(交差注意)」という手法を用いました。これは、各探偵にトランシーバーを与えて、「ねえ、ここで声が震えているよ、君の顔は見ている表情は緊張しているかな?」とか、「僕はためらう言葉を見たよ、君の音声は間(ま)を聞いているかな?」と問いかけさせるようなものです。これにより、「はい」と言いながらも自信がなさそうな声を出しているといった、矛盾を察知することが可能になりました。また、彼らは「ゲート付きマルチモーダル・ユニット(Gated Multimodal Unit)」も追加しました。これはスマートなマネージャーのように機能します。もし一人の探偵がぼやけた顔を見ていたり、質の悪い音声を聞いていたりする場合、マネージャーは「そのノイズの多い信号は一旦無視して、代わりにクリアなテキストに集中しよう」と指示を出すことができます。

最適な設定を見つけるための「Optuna」というスマートな探索ツールを用いてこのチームを訓練した後、結果は素晴らしいものでした。3人のチームが協力して動いた結果、テストで73.9%を記録し、これは最高の単独探偵よりも11.0%向上した数値でした。このことは、異なる感覚を互いにクロスチェックさせることで、コンピュータが単一の感覚だけでは捉えきれない、アンビバレンスを構成する微妙で相反する手がかりをより良く捉えられることを示唆しています。研究者たちは、テキスト、音、ビデオの間のこのような明示的なチームワークこそが、これらの困難な人間の感情を解き明かす鍵であると確信しており、他の人々も試せるように彼らのコードを公開しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →