← 最新の論文
🤖 AI

InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring

本論文は、既存の視覚のみのデータセットの限界に対処しつつ、ドライバーの感情認識、疲労検知、および注意散漫のモニタリングを促進するために、台本に基づいた車内シナリオからRGB、赤外線、音声、および対話テキストを統合した包括的なマルチモーダルデータセットであるInCarEmoを導入するものである。

原著者: Hao Yang, Yanyan Zhao, Kewei Zhao, Hongbo Zhang, Tian Zheng, Yusheng Liu, Xing Fu, Bichen Wang, Yu Zhang, Hao He, Zhen Wu, Xuda Zhi, Yongbo Huang, Bing Qin

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Hao Yang, Yanyan Zhao, Kewei Zhao, Hongbo Zhang, Tian Zheng, Yusheng Liu, Xing Fu, Bichen Wang, Yu Zhang, Hao He, Zhen Wu, Xuda Zhi, Yongbo Huang, Bing Qin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが車を運転しているところを想像してみてください。しかし、そこにあるのは単なるステアリングホイールやペダルだけではありません。あなたの乗り物が、まるで人格を持ち始めているかのようなのです。その車は、あなたが幸せなのか、疲れているのか、あるいは注意が散漫になっているのかを知りたがっています。そうすることで、あなたを安全に守るために役立ちたいと考えているのです。これが「アフェクティブ・コンピューティング(感情コンピューティング)」の世界です。これは、コンピュータに人間の感情を理解させるための、少し凝った呼び名です。これは、単に道路状況を読むだけでなく、「あなた」をも読み取る、超スマートな副操縦士のようなものだと考えてください。長い間、科学者たちは、あなたの顔を見たり、声を聞いたりすることで、この副操縦士を作り上げようと試みてきました。しかし、問題があります。彼らが使用してきた訓練データの多くは、白黒映画のようなものなのです。それは顔だけを見ているか、あるいは声だけを聞いているかのどちらかであり、私たちが運転しているとき、通常は誰か、あるいは何かと会話をしているという事実を無視していることがよくあります。それは、ジョークのオチを聞かずに、その人の口元だけを見てジョークを理解しようとするようなものです。真に安全で共感力のある車を作るためには、顔、声、言葉、そして会話の雰囲気といった、全体像を理解する必要があります。

ここで、ハルビン工業大学とSERESの研究者たちによる新しいプロジェクトである「InCarEmo」が登場します。これは、車のコンピュータに、実際の運転生活を捉えたフルカラーのサラウンド映画を手渡すようなものです。チームは、既存のデータセットにはパズルの極めて重要なピース、つまり車内で実際に起きている会話が欠けていることに気づきました。彼らは「InCar_Emo」という大規模な新しいデータライブラリを構築しました。これは、ドライバーがただ道路を見ているだけでなく、交通状況について話したり、旅行の計画を立てたり、あるいは車自体について議論したりしている場面を捉えたものです。彼らは、高精細カメラ(通常のカメラと、暗闇でも見える赤外線カメラの両方)、高品質のマイク、さらには話された正確な言葉の書き起こしを使用して、これらの瞬間を記録しました。

この論文では、このデータセットを3つの主要なタスクのためのツールキットとして紹介しています。それは、ドライバーがどのような感情(怒りや不安など)を抱いているかを特定すること、運転に集中できないほど疲れていることを察知すること、そしてスマートフォンや飲み物によって注意が散漫になっていることに気づくことです。この新しいデータが機能するかどうかをテストするために、研究者たちは「CAMEL」と呼ばれる軽量なAIモデルを構築しました。彼らは、AIが視覚、音、言葉のすべての情報を統合して使用した場合、単一の感覚のみを使用した場合よりも、ドライバーの状態を推測する精度が大幅に向上することを発見しました。例えば、カメラが苦戦するような低照度の条件下では、音声やテキストの手がかりがAIの正確性を維持する助けとなりました。また、本研究では、世界中の研究者が協力し合えるように、データの特別な英語版も作成されましたが、言語間で感情を翻訳することは難しいという点についても注記しています。最終的に、この論文は、AIにより豊かで現実的なドライバーの世界の視点を与えることで、単に賢いだけでなく、真に理解力があり、すべての人にとってより安全な車を構築できることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →