← 最新论文
🤖 machine learning

Can Webcam Gaze Constrain Mesa-Objectives in Driving Models? An Instrument Precision Analysis

本研究表明,由于该仪器的空间误差显著超过了大多数检测到的危险物体的尺寸,使得精确的注视点与物体归属在物理上变得无法实现,因此基于网络摄像头的眼动追踪无法约束自动驾驶模型中的中层目标(mesa-objectives)。

原作者: Lennox Anderson, Ahmed Boutar, Jonah Mulcrone, Tal Erez

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Lennox Anderson, Ahmed Boutar, Jonah Mulcrone, Tal Erez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何开车。你想让它能察觉到危险——比如行人踏下路缘,或者汽车突然刹车——就像人类那样。但这里有一个棘手的难题:有时,机器人会学习“捷径”。它们并不会真正理解什么是危险,而是可能仅仅因为在训练期间这样做很奏效,就学会了将“任何移动物体”都标记为危险。这就像一个学生记住了所有带有“狗”这个词的问题都是陷阱题,而不是在真正阅读故事。为了解决这个问题,科学家们在想:如果我们能在机器人学习时,展示人类在驾驶时是在“看”哪里呢?如果机器人看到人类在停车前会紧盯着红灯,也许它也会学会看向那里,而不是靠瞎猜。这个想法被称为使用“特权信息(privileged information)”——在练习阶段给学生额外的提示,而在最终考试时这些提示会被撤走,希望通过这些提示让学生学到正确的道理。

但问题在于,你如何获得这些提示呢?你不可能给每一位驾驶员都戴上价值百万美元、具有激光般精准度的眼动追踪头盔。所以,研究人员尝试使用普通的摄像头,就是那种内置在笔记本电脑或手机上的摄像头,来猜测人们在看哪里。他们建立了一个大规模实验,以观察这种廉价、简便的方法是否能教会自动驾驶汽车更加安全。他们收集了超过13.7万张快照,记录了人们在观看真实驾驶场景的行车记录仪视频时视线停留的位置。他们用各种类型的计算机大脑进行了测试,从简单的模型到非常复杂的、能够理解时间和序列的模型,甚至尝试了不同的“校准”方式来提高摄像头的准确性。他们想要看看,加入这些“人类在看哪里”的数据,是否能帮助机器人更好地发现危险。

简短的回答是:完全没用。研究人员发现,摄像头实在是太模糊、太不准确了,以至于根本无法发挥作用。他们发现,摄像头猜测的误差大约有196个像素宽。换个角度来看,他们试图识别的平均危险物体——比如停止标志、行人或交通灯——只有大约36个像素宽。想象一下,你试图用激光笔指向足球场上的一只小蚂蚁,但你的手抖得厉害,导致你的激光点覆盖了整个体育场。这基本上就是发生的情况。摄像头认为的人类注视点那个“圆点”太大了,以至于它同时覆盖了危险物体及其周围的一切。正因如此,机器人无法分辨人类是在看那个危险物体,还是仅仅在看它旁边的天空。

该团队做得非常彻底。他们并没有只做一次测试就放弃。他们尝试了“弱”校准(只需45次点击即可设置相机)和“超强”校准(440次点击)。他们测试了简单的模型,也测试了能够理解时间和序列的复杂模型。他们甚至在不同的随机设置下运行了五次实验,以确保他们不是碰巧运气好或运气差。在每一种情况下,结果都是一样的:摄像头的注视数据没有带来任何收益。事实上,数学计算表明,这种提升微乎其微,仅仅是随机噪声。研究人员得出结论:虽然利用眼动追踪来教机器人的想法非常高明,但廉家版的摄像头版本在物理层面上无法胜任这项工作,因为它的“视觉”太模糊,无法分辨细微且关键的细节。他们发表了这个“负面”结果,以避免其他科学家在同一个死胡同里浪费时间,证明了有时,知道什么行不通与知道什么行一样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →