← Derniers articles
🤖 AI

InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring

L'article présente InCarEmo, un ensemble de données multimodales complet intégrant l'RGB, l'infrarouge, l'audio et le texte de dialogue issus de scénarios scénarisés en cabine afin de faire progresser la reconnaissance des émotions du conducteur, la détection de la fatigue et la surveillance de la distraction, tout en abordant les limites des ensembles de données existants uniquement visuels.

Auteurs originaux : Hao Yang, Yanyan Zhao, Kewei Zhao, Hongbo Zhang, Tian Zheng, Yusheng Liu, Xing Fu, Bichen Wang, Yu Zhang, Hao He, Zhen Wu, Xuda Zhi, Yongbo Huang, Bing Qin

Publié 2026-07-17
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Hao Yang, Yanyan Zhao, Kewei Zhao, Hongbo Zhang, Tian Zheng, Yusheng Liu, Xing Fu, Bichen Wang, Yu Zhang, Hao He, Zhen Wu, Xuda Zhi, Yongbo Huang, Bing Qin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous conduisez une voiture, mais qu'au lieu d'avoir simplement un volant et des pédales, votre véhicule commence à avoir une personnalité. Il veut savoir si vous êtes heureux, fatigué ou distrait afin de pouvoir vous aider à rester en sécurité. C'est le monde de l'« informatique affective » — un terme sophistiqué pour désigner l'apprentissage donné aux ordinateurs pour comprendre les émotions humaines. Voyez cela comme un copilote super intelligent qui ne se contente pas de lire la route, mais qui vous lit aussi, vous. Pendant longtemps, les scientifiques ont tenté de construire ce copilote en observant votre visage ou en écoutant votre voix. Mais il y a un problème : la plupart des données d'entraînement qu'ils ont utilisées sont comme un film en noir et blanc. Elles ne montrent que le visage ou n'entendent que la voix, et elles ignorent souvent le fait que, lorsque nous conduisons, nous parlons généralement à quelqu'un ou à quelque chose d'autre. C'est comme essayer de comprendre une blague en regardant seulement la bouche de la personne, sans entendre la chute. Pour créer une voiture véritablement sûre et empathique, nous devons comprendre l'image complète : le visage, la voix, les mots et même l'humeur de la conversation.

Voici InCarEmo, un nouveau projet des chercheurs de l'Institut de technologie de Harbin et de SERES, qui revient à offrir à l'ordinateur de la voiture un film en couleur et en surround de la vie réelle en voiture. L'équipe a réalisé que les ensembles de données existants manquaient d'une pièce cruciale du puzzle : la conversation réelle qui se déroule à l'intérieur du véhicule. Ils ont construit une nouvelle et massive bibliothèque de données appelée InCarEmo, qui capture des conducteurs non pas seulement en train de regarder la route, mais aussi en train de discuter du trafic, de planifier des trajets ou de discuter de la voiture elle-même. Ils ont enregistré ces moments en utilisant des caméras haute définition (à la fois classiques et infrarouges, qui voient dans l'obscurité), des microphones de haute qualité, et ont même transcrit les mots exacts prononcés.

L'article présente cet ensemble de données comme un outil pour trois missions principales : déterminer quelle émotion un conducteur ressent (comme la colère ou l'anxiété), repérer s'il est trop fatigué pour conduire, et remarquer s'il est distrait par son téléphone ou une boisson. Pour tester l'efficacité de ces nouvelles données, les chercheurs ont conçu un modèle d'IA léger nommé CAMEL. Ils ont découvert que lorsque l'IA utilisait toutes les informations ensemble — la vue, le son et les mots — elle était bien plus performante pour deviner l'état du conducteur que lorsqu'elle n'utilait qu'un seul sens. Par exemple, dans des conditions de faible luminosité où une caméra pourrait avoir des difficultés, les indices audio et textuels ont permis à l'IA de rester précise. L'étude a également créé une version anglause spéciale des données pour aider les chercheurs de différents pays à collaborer, bien qu'ils aient noté que la traduction des émotions à travers les langues est complexe. En fin de compte, l'article suggère qu'en offrant à l'IA une vision plus riche et plus réaliste du monde du conducteur, nous pouvons construire des voitures qui ne sont pas seulement intelligentes, mais véritablement compréhensives et plus sûres pour tout le monde sur la route.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →