← 最新论文
🤖 AI

ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos

本文提出了首个面向第一人称视频的任务导向时空定位基准 ToG-Bench,通过引入任务导向、显隐双重及一对多定位等关键特性,系统评估了多模态大模型在具身智能场景下基于任务意图进行目标定位与推理的能力。

原作者: Qi'ao Xu, Tianwen Qian, Yuqian Fu, Kailing Li, Yang Jiao, Jiacheng Zhang, Xiaoling Wang, Liang He

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Qi'ao Xu, Tianwen Qian, Yuqian Fu, Kailing Li, Yang Jiao, Jiacheng Zhang, Xiaoling Wang, Liang He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ToG-Bench 的新项目,它就像是为“机器人管家”设计的一场高难度“找东西”大考

为了让你更容易理解,我们可以把这项技术想象成教一个刚入职的机器人管家如何听懂主人的“潜台词”并精准地干活

1. 以前的考试 vs. 现在的考试

以前的考试(传统 STVG):
想象一下,你给机器人看一段视频,然后问它:“视频里那个红色的杯子在哪里?”

  • 特点:指令很直白,直接描述了物体的样子(颜色、形状)。
  • 局限:这就像是在玩“大家来找茬”,机器人只需要认颜色、认形状。但在现实生活中,主人不会这么说话。

现在的考试(ToG-Bench):
现在,你给机器人看一段第一人称视角的视频(就像机器人自己眼睛看到的),然后说:"我想喝杯水。"

  • 挑战
    1. 听懂潜台词(显隐双重定位):你只说了“喝水”,没提“水龙头”或“杯子”。机器人得靠常识推理:要喝水,得先找到水龙头,可能还得找杯子。如果它只盯着你提到的“水”字,却找不到水龙头,任务就失败了。
    2. 一拖多(一对多定位):如果你说“把白板准备好开会”,机器人不能只盯着“白板”,它还得同时找到“马克笔”和“板擦”。这三个东西缺一不可,必须全部找对。
    3. 动态追踪:视频里机器人可能在走动,手在动,物体可能被挡住。它得在几秒钟甚至几分钟的视频里,一直死死盯住那个目标,不能跟丢。

2. 这个“考场”是怎么建的?

为了测试机器人够不够聪明,作者们造了一个ToG-Bench 题库

  • 素材来源:他们从真实的家庭环境视频(ScanNet)里挑了 100 段视频。
  • 出题方式:他们先用超级 AI(像 GPT-5 这种)生成各种“任务指令”(比如“洗个手”、“做个咖啡”),然后让人类专家像精修师一样,人工检查这些指令合不合理,并手动把视频里对应的物体(比如水龙头、咖啡机)在每一帧画面里的位置都框出来。
  • 规模:最终有了 2700 多条任务指令,涵盖了从“直接点名”到“需要推理”的各种难度。

3. 考试结果:机器人表现如何?

作者们找了 7 个目前最厉害的 AI 模型(包括 GPT-5、Gemini、Qwen 等)来参加考试,结果发现了一个尴尬的真相

  • “懂道理”但“手不准”
    现在的 AI 非常聪明,能听懂“我想喝水”意味着要找水龙头(语义理解很强,准确率很高)。但是,当让它在视频里精准地画出水龙头的位置,并且精确到每一秒时,它们就抓瞎了。

    • 比喻:就像一个人能背出“去厨房找水壶”的路线,但真让他走进厨房,却总是把水壶的位置指错,或者在走路时把水壶跟丢了。
  • “单挑”强,“群殴”弱
    如果任务只找一个东西,AI 还能凑合;如果任务需要同时找三个东西(比如准备白板),AI 的准确率就断崖式下跌。它们很难同时协调好多个目标。

  • “显性”强,“隐性”弱
    如果指令里直接说了“找水龙头”,AI 表现不错;如果指令是“洗个手”(没提水龙头),AI 就经常找不到那个没被提到的关键物体。

  • 视频越长,越容易晕
    视频稍微长一点,AI 画出的框就开始“漂移”,一会儿偏左,一会儿偏右,甚至跟丢了目标。

4. 这篇论文的意义是什么?

这就好比给现在的 AI 照了一面照妖镜

  • 它告诉我们,虽然现在的 AI 像“博学的教授”,能听懂复杂的任务指令,但它们还缺乏“灵活的手脚”,无法在真实、动态、充满干扰的现实环境中精准地操作物体。
  • ToG-Bench 就是为了解决这个问题而生的。它不再考 AI“认不认识物体”,而是考 AI“能不能为了完成任务,聪明地找到并锁定所有需要的东西”。

总结一句话
这篇论文说,现在的机器人管家虽然听得懂“我想喝杯水”这种话,但找不到水龙头,也拿不稳杯子。ToG-Bench 就是专门用来训练和测试它们如何从“只会认字”进化到“真正能干活”的标尺。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →