← 最新论文
💻 computer science

Attune: A Self-Annotation Tool for Understanding Robot Operator Attention Profiles

本文介绍了 Attune,这是一种利用人工智能分析操作员眼动注视并生成注意力分布图谱的自我标注工具,从而为校准机器人行为提供实证指导,以在多机器人监督场景下有效管理人类注意力。

原作者: Puqi Zhou, Sungsoo Ray Hong, David Porfirio

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Puqi Zhou, Sungsoo Ray Hong, David Porfirio

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名飞船舰长,但你的任务不是驾驶一艘飞船,而是监管一支由微型自主无人机组成的庞大编队,它们正在繁忙的城市中配送披萨。你的工作是在一个控制室内坐着,面对着一面显示屏墙,每一块屏幕都显示着不同无人机的视角。如果一个无人机被卡住了或者看到了奇怪的障碍物,你必须立即察觉并告诉它该怎么做。这就是**多机器人监督(multi-robot supervision)**的世界。但棘手的部分在于:你的大脑注意力是有限的。如果你盯着一个无聊的无人机看太久,你可能会错过另一块屏幕上发生的危机;如果你跳来跳去太频繁,你会感到疲劳和困惑。科学家们称之为“操作员注意力(operator attention)”,他们正试图弄清楚不同的人是如何注视这些屏幕的,以便构建更好的控制室。核心问题是:我们如何设计机器人的行为,使其在需要时能吸引你的注意力,而在情况平稳时让你放松?

由此诞生了 Attune,一个由乔治梅森大学研究人员开发的新工具。把 Attune 想象成一面针对机器人操作员的“读心镜”。它不再仅仅是猜测为什么操作员会看向特定的屏幕,而是让操作员观看一段自己观察机器人的视频,然后询问:“嘿,为什么刚才你的眼睛跳到了那个屏幕?”这就像是在观看一场体育比赛的回放,但你不是在分析球员的动作,而是在分析自己的眼睛,以理解自己的习惯。研究人员开发这个工具是为了帮助设计师理解:每个操作员都是不同的;让一个人关注机器人的因素,可能会让另一个人忽略它。通过弄清这些个性化的“注意力特征(attention profiles)”,设计师最终可以调整机器人的行为,使其与坐在控制椅上的特定人员相匹配。

问题所在:“过多屏幕”的困境

想象你在玩一款电子游戏,必须同时观察六个不同的摄像头。一个摄像头显示机器人的头部,另一个显示它的抓取器(它的手),还有一个显示天花板。如果机器人掉了一个盒子,你需要立即看到它。但如果机器人只是在缓慢行走,你就不需要死死盯着它。问题在于,我们并不真正了解人类操作员为什么决定看一个摄像头,然后突然切换到另一个。是因为机器人做了什么酷炫的事情吗?是因为有什么闪亮的东西吸引了他们的注意吗?还是因为他们觉得无聊了?

目前,机器人设计师只能靠猜。他们可能会让机器人发出响亮的鸣叫声来引起注意,但这可能会让操作员感到烦躁,或者让他们以后忽略机器人。研究人员希望超越这种猜测。他们想要一种方法来询问操作员:“你为什么看那里?”并得到真实的答案。但如果他们在观察机器人时进行询问,他们可能会分心,从而无法自然地完成工作。因此,他们需要一种聪明的方法,在事后进行询问,而不破坏记忆。

解决方案:Attune,“眼动追踪”侦探

研究人员构建了一个名为 Attune 的工具。以下是它工作的步骤,使用了一个有趣的类比:

第一步:电影之夜
首先,操作员坐下来观看两个机器人执行任务(如清理厨房或在走廊搜索)的视频。在观看过程中,Attle 使用眼动追踪相机精确记录他们的眼睛注视位置,精确到毫秒。这就像是一个只拍摄操作员瞳孔的高科技摄像机。系统会记录眼睛从一个屏幕跳到另一个屏幕的时刻。这些跳跃被称为“注视转移(gaze shifts)”。

第二步:回放与“为什么?”
视频结束后,操作员进入一个特殊的“标注”房间。Attune 会向他们展示一个记录了他们眼睛跳跃时间的列表。这就像是他们自己注意力的精彩集锦。操作员选择一个跳跃点并点击“回放”。系统会放大那个瞬间,展示眼跳发生前后的机器人动作和视频画面。

然后,操作员需要解释自己的行为。Attune 会提出两个简单的问题:

  1. 你为什么离开旧的屏幕?(是机器人停止移动了吗?还是你觉得无聊了?)
  2. 你为什么到达新的屏幕?(你是看到了人吗?还是机器人看起来遇到了麻烦?)

操作员还可以说明这次跳跃是**反应性(reactive)的(发生了突发且响亮的事情,类似于“自下而上”的拉动)还是主动性(proactive)**的(他们因为好奇而决定检查机器人,属于“自上而下”的选择)。

第三步:模式侦探(AI 介入)
一旦操作员解释了一些跳跃行为,Attune 就会利用智能计算机大脑(AI)来寻找模式。这就像侦探注意到每次机器人掉落杯子时,操作员都会看向抓取器摄像头。或者,每当机器人停止移动时,操作员就会看向天花板摄像头。AI 将这些解释分组,并表示:“嘿,看起来每当机器人靠近人时,你都会检查头部摄像头。”

第四步:自动标注
现在,这个工具变得更酷了。它利用从前几次跳跃中学到的模式,将其应用到剩余的视频中。它会说:“我猜你之所以看这个屏幕,是因为机器人正在靠近一个人。对吗?”操作员只需回答“是”或“否”,并可能进行微调。这使得过程变得非常迅速,将一个漫长、枯燥的任务变成了一场快速的“寻找模式”游戏。

第五步:个人档案
最后,Attune 会为操作员提供一份其自身“注意力特征”的总结。这就像是一份成绩单,上面写着:“当你拿着重物时,你倾向于看机器人的手;但当机器人只是在行走时,你会检查天花板。”这份档案随后会被交给机器人设计师。他们可以用它来构建出符合该特定操作员思维方式的机器人。

他们发现了什么?

研究人员使用 12 名从未使用过此类工具的人测试了 Attune。他们观看了机器人在三种不同环境(客厅、厨房和走廊)中的视频。以下是他们的发现:

  • 每个人都是不同的: 最重要的发现是,没有两个人的行为是相同的。有些人会平等地观察所有六个摄像头视图,而有些人只看两三个。有些人是非常反应性的,一旦有东西移动就会跳过去看。而另一些人则是主动性的,会按特定顺序检查屏幕。这表明不存在一个“完美的”机器人界面;它需要根据个人进行定制。
  • 机器人驱动视觉: 研究发现,机器人的行为是人们看向某个屏幕的最大原因。如果机器人正在做精细动作(如拿起杯子),人们会密切观察。如果机器人只是静止不动或移动缓慢,人们就会看向别处。研究人员认为,如果机器人的动作令人困惑或难以理解,操作员的视线就会游离,因为他们试图弄清楚发生了什么。
  • “虚假记忆”陷阱: 研究人员注意到一个有趣现象,即“回放”法。有时,当人们观看回放时,他们并不是在回忆那一刻真实的想法,而是在用“现在已知结果”的逻辑来编造一个合理的解释。例如,如果在回放中看到机器人掉落了杯子,他们可能会说:“我看向那里是因为我知道它要掉了,”即便他们在当时其实并不知道。该工具帮助他们意识到了这一点,但也提醒我们,回顾自己的注意力并不总是 100% 准确的。
  • AI 是助手,而非老板: 参与者喜欢 AI 的建议,但前提是他们觉得 AI 是正确的。如果 AI 猜错了,会让操作员觉得工作量增加了。研究人员发现,人们希望 AI 是一个“脚手架(scaffold)”——即辅助他们思考的东西,而不是代替他们思考的东西。他们估计,AI 需要达到 80% 到 90% 的准确率,他们才会完全信任它。

这为什么重要

这篇论文并不声称已经永久解决了机器人监督的问题。事实上,研究人员非常谨慎地指出,他们的工具只是第一步。他们仅测试了两个机器人和预录制的视频,而不是目前正在医院运行的真实机器人集群。此外,他们使用的受试者并非专家,因此真正的机器人操作员可能会表现得不同。

然而,这项研究为机器人设计提供了一种全新的思考方式。与其猜测人类的需求,不如询问他们:“你为什么看那里?”并利用他们的答案来构建更好的系统。它将操作员从一个被动的观察者转变为机器人行为设计的积极合作伙伴。

研究人员还指出一个棘手的副作用:如果我们开始如此紧密地追踪每个人的注意力,我们需要注意隐私问题。我们不希望这些“注意力特征”被用于监视工人或评判其绩效。该工具旨在帮助机器人更好地服务于人类,而不是用来评判人类。

最终,Attune 是一座桥梁。它连接了人类眼睛移动的混乱、不可预测性,与机器人逻辑化、程序化的世界。通过理解“为什么”背后的“在哪里”,我们或许有一天能拥有机器人编队,让它们感觉不再是混乱的屏幕交通堵塞,而是一场协调有序的舞蹈,其中的每一个动作都是为了让身为人类舰长的你保持冷静、专注并掌控全局。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →