← 最新论文
💻 computer science

YawDD+: Frame-level Annotations for Accurate Yawn Prediction

本文介绍了 YawDD+,这是一个通过半自动化流程生成的具有帧级标注的数据集,旨在克服粗粒度视频级标签的局限性,从而在 NVIDIA Jetson NANO 和 AGX 等边缘设备上实现高精度、高效的实时驾驶员疲劳检测。

原作者: Ahmed Mujtaba, Gleb Radchenko, Marc Masana, Radu Prodan

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed Mujtaba, Gleb Radchenko, Marc Masana, Radu Prodan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人通过观察打哈欠来识别司机是否正在打瞌睡。问题在于,机器人用来学习的“教科书”是由一位非常缺乏耐心的老师编写的。

问题所在:“整段视频”的谬误

过去,研究人员使用了一个名为YawDD的数据集。把这个数据集想象成一个电影文件,老师只是按下一个按钮说:“整部电影都是关于打哈欠的。”

但事实上,司机并不会在 30 秒的视频全程都在打哈欠。他们可能打两秒钟哈欠,然后和乘客交谈,接着微笑,最后恢复正常驾驶。通过将整段视频标记为“打哈欠”,老师无意中告诉机器人,交谈和微笑也是困倦的迹象。这就像教一个孩子“吃饭”意味着“坐在桌子旁”,所以孩子认为只要坐着就是在吃饭。这种“噪声”让机器人感到困惑,降低了其准确性并导致错误。

解决方案:“逐帧”侦探

本文的作者决定修正这本“教科书”。他们创建了一个新的、升级的数据集,名为YawDD+

他们不再标记整部电影,而是构建了一个半自动化流程(一条智能装配线),就像一名侦探,一次只查看视频中的一帧(就像翻看连环画中的单张照片)。

  1. 机器人助手:首先,一个计算机程序扫描视频,找到司机的脸,并专门放大到他们的嘴巴。
  2. 快速分类:一个轻量级 AI 模型观察那张嘴,并猜测:“它是像打哈欠那样张得很大,还是像平常那样闭合?”它有 80% 的时间非常有把握。
  3. 人工核查:对于机器人不确定的那 20% 的棘手情况(可能是光线不好,或者嘴巴半张),人类会介入以验证答案。

这个过程清理了数据,去除了“噪声”,让机器人能够清晰地看到何时发生打哈欠,何时没有发生。

结果:超快的车载大脑

研究人员不仅清理了数据,还测试了这种新方法是否可以在汽车内部的微型计算机(具体指如 NVIDIA Jetson 之类的设备)上运行,而不需要依赖云端庞大且昂贵的服务器。

可以将旧方法想象成试图用另一个国家的超级计算机来解拼图,这需要时间来回传输数据。而新方法就像有一位解谜天才直接坐在驾驶座上。

他们取得的成就如下:

  • 更高的准确率:通过使用干净的逐帧数据,他们的模型在识别打哈欠方面有了显著提升。他们在打哈欠分类上达到了99.34%的准确率,在检测嘴巴位置方面达到了95.69%。与旧有的、充满噪声的方法相比,这是一个显著的飞跃(提高了高达 6%)。
  • 速度:该系统速度极快。在小型车载计算机上,它可以处理每秒 115 帧。这意味着它几乎可以瞬间做出决策,这对安全性至关重要。
  • 效率:他们直接在小型车载计算机上训练了这些模型。训练一个模型周期仅需不到 9 分钟。这证明你不需要庞大的云服务器来构建智能司机监控系统;你可以直接在车辆内完成。

为何重要

该论文得出结论,通过简单地修正“教科书”(数据标签)使其更加精确,他们使得简单、轻量级的 AI 模型能够像冠军一样表现。这意味着汽车现在可以内置一个实时的“困倦检测器”,它支持离线运行,尊重隐私(因为视频从未离开汽车),并能瞬间做出反应以确保司机安全。

作者还指出,这种“清理”方法可用于其他需要区分相似动作的任务,但他们的首要关注点和在此处的成功案例严格局限于使驾驶员疲劳检测在边缘设备上更加准确和快速。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →