InCarEmo: A Multimodal Dataset for In-Cabin Emotion Recognition and Driver State Monitoring
该论文介绍了 InCarEmo,这是一个综合性的多模态数据集,通过整合来自脚本化座舱场景的 RGB、红外、音频和对话文本,旨在推进驾驶员情绪识别、疲劳检测和分心监测,同时解决了现有仅基于视觉数据集的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在开车,但你的座驾不仅仅拥有方向盘和踏板,它还开始有了个性。它想知道你是在开心、疲惫还是分心,以便能帮助你保持安全。这就是“情感计算”(affective computing)的世界——一个关于教计算机理解人类情感的专业术语。把它想象成一个超级智能的副驾驶,它不仅能观察路况,还能读懂你。长期以来,科学家们一直试图通过观察你的脸部或聆听你的声音来构建这个副驾驶。但这里有一个问题:他们使用的大多数训练数据就像一部黑白电影。它要么只显示脸部,要么只听到声音,并且往往忽略了一个事实:当我们开车时,我们通常是在与某人或某物进行交谈。这就像试图通过只看一个人的嘴巴而不听其笑话的结尾,来理解这个笑话一样。为了打造一辆真正安全且具有同理心的汽车,我们需要了解全貌:脸部、声音、言语,甚至是对话的情绪。
于是,由哈尔滨工业大学和赛力斯(SERES)的研究人员推出的新项目 InCarEmo 登场了,它就像是递给汽车计算机一部关于真实驾驶生活的全彩环绕声电影。该团队意识到,现有的数据集缺失了拼图中的关键一块:车内正在发生的实际对话。他们构建了一个名为 InCarEmo 的大规模新数据库,该数据库捕捉到的不仅仅是驾驶员注视前方的瞬间,还有他们讨论交通状况、规划行程或讨论车辆本身的过程。他们使用高清晰度摄像头(包括普通摄像头和能看清黑暗环境的红外摄像头)、高质量麦克风,甚至对所说的确切词句进行了转录,记录了这些时刻。
该论文将这一数据集介绍为完成三大任务的工具包:识别驾驶员正在感受的情绪(如愤怒或焦虑)、发现他们是否因过度疲劳而无法驾驶,以及察觉他们是否因手机或饮料而分心。为了测试这些新数据是否有效,研究人员构建了一个名为 CAMEL 的轻量级人工智能模型。他们发现,当人工智能综合利用所有信息——视觉、听觉和文字时,它在预测驾驶员状态方面比仅使用单一感官时要出色得多。例如,在相机可能表现不佳的低光照条件下,音频和文本线索帮助人工智能保持了准确性。该研究还创建了一个专门的英文版本数据,以帮助来自不同国家的科研人员开展合作,尽管他们也指出,跨语言翻译情绪是一件复杂的事情。最终,论文表明,通过赋予人工智能一个更丰富、更真实的驾驶者世界视角,我们可以制造出不仅聪明、而且真正理解人类并能让每个人行驶得更安全的汽车。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。