← 最新论文
💻 computer science

Leveraging Gaze and Set-of-Mark in VLLMs for Human-Object Interaction Anticipation from Egocentric Videos

该论文提出了一种结合“标记集合”提示、基于最近注视轨迹的用户意图理解以及新型逆指数采样策略的视觉大语言模型方法,显著提升了第一人称视角下人机交互预测的准确性并超越了现有最先进技术。

原作者: Daniele Materia, Francesco Ragusa, Giovanni Maria Farinella

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniele Materia, Francesco Ragusa, Giovanni Maria Farinella

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种让 AI 变得更“聪明”、更能预判人类下一步想做什么的新方法。想象一下,你戴着一个智能眼镜,它不仅能看到你眼前的世界,还能在你伸手去拿东西之前,就猜到你接下来要做什么,甚至在你不小心碰到烫锅之前提醒你。

为了做到这一点,作者给 AI 装上了三样“超能力”:

1. 核心任务:像读心术一样的“预判”

在日常生活(比如做饭、工作)中,我们总是先,然后,最后动手

  • 传统 AI 的困境:以前的 AI 就像个有点迟钝的旁观者,它只能看到你现在的动作,很难猜到你下一秒要拿哪个杯子,尤其是当桌上有很多杯子时。
  • 这篇论文的目标:利用第一人称视角(就像你戴着头盔摄像机看到的画面),让 AI 在你真正动手之前,就精准猜出你下一个要互动的物体是什么。

2. 三大“超能力”升级包

作者给 AI 的“大脑”(一种叫 VLLM 的大模型)加了三个特殊的插件,就像给侦探配了装备:

🕵️‍♂️ 插件一:Set-of-Mark(“重点标记笔”)

  • 问题:AI 看视频时,往往分不清哪里是重点,哪里是背景。就像你在一堆杂乱的厨房台面上找盐罐,AI 可能分不清盐罐和旁边的调料瓶。
  • 解决方案:作者让 AI 在视频的每一帧画面上,给不同的物体自动贴上半透明的“标签”或“轮廓”(就像给每个物体画了个圈,或者盖了个印章)。
  • 比喻:这就像老师批改作业时,用红笔把重点单词圈出来。AI 现在能一眼看到:“哦,这个被圈出来的‘锅’,可能是主角。”这让 AI 的视觉定位能力瞬间变强。

👀 插件二:Gaze Trajectory(“视线追踪轨迹”)

  • 问题:人的手还没动,眼睛通常已经先看向目标了。以前的 AI 忽略了“眼神”这个重要线索。
  • 解决方案:系统会记录用户最近看过的地方,并在视频上画出一条彩色的“视线轨迹”。
    • 红色圆圈代表你刚刚看过的地方。
    • 蓝色圆圈代表你之前看过的地方。
    • 这些圆圈连成一条线,像一条“思维路径”。
  • 比喻:这就像侦探在案发现场发现了一串脚印。AI 看到这条“视线脚印”通向那个玻璃碗,就会想:“既然他的眼睛一直盯着这个碗,那他接下来肯定是要拿它,而不是旁边的盘子。”

⏱️ 插件三:Inverse Exponential Sampling(“时间倒流聚焦法”)

  • 问题:视频很长,如果 AI 把每一秒都看一遍,会累死(计算量太大),而且很多中间过程是废话。
  • 解决方案:作者发明了一种特殊的“选帧”策略。
    • 普通的选帧是均匀取样(每隔 1 秒看一帧)。
    • 他们的策略是:越靠近“即将发生互动”的那一刻,看得越密!
  • 比喻:想象你在看一部电影,想知道主角什么时候会推门。你不会从头到尾每秒都看,而是在推门前的最后几秒,把画面放慢,一帧一帧地仔细看。这种方法让 AI 把精力集中在最关键的那几秒钟,忽略了无关紧要的中间过程。

3. 实验结果:真的有效吗?

作者在一个叫 HD-EPIC 的超级大数据库(里面全是第一人称视角的做饭视频)上测试了这套系统。

  • 结果:这套“组合拳”让 AI 的猜对率大幅超越了目前世界上最先进的其他方法。
  • 关键点
    • 如果只用“重点标记”,AI 会猜错(因为它不知道你要看哪)。
    • 如果只用“视线追踪”,AI 也会猜错(因为它看不清物体细节)。
    • 只有当“重点标记” + “视线追踪” + “时间聚焦”三者结合时,AI 才能像真正的“读心术大师”一样,精准预判你的下一步动作。

4. 总结:这有什么用?

想象一下未来的智能助手

  • 在厨房:当你伸手去拿热锅却没拿隔热手套时,眼镜会立刻报警:“小心烫!你刚才盯着锅,但没拿手套!”
  • 在工厂:当工人盯着危险的机器部件时,系统能预判他可能要进行的操作,提前发出安全警示。

一句话总结
这篇论文教 AI 学会了看重点(Set-of-Mark)、懂眼神(Gaze Trajectory)和抓关键时机(Sampling),让它从一个呆板的录像机,变成了一个能预判人类意图的贴心小助手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →