← 最新论文
💻 computer science

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

本文介绍了 GuideMe,这是首个用于流式视频的多领域基准测试,旨在评估和训练多模态大语言模型在闭环交互式任务引导方面的能力,研究揭示了尽管目前的模型擅长提供指令,但在实时错误检测和纠正性反馈方面仍面临显著困难。

原作者: Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试学习如何组装一件复杂的家具,或者烹饪一道复杂的菜肴。你有一个非常聪明、博学的的朋友(一个人工智能),他读过所有的说明书,也看过所有的烹饪节目。

问题所在:
目前,如果你向这位朋友寻求帮助,他在你完成整个过程之后给出指令清单方面表现出色。他可以告诉你:“嗯,你先做了第1步,然后做了第2步,接着你犯了一个错误。”但他们不擅长做一名实时教练。他们无法在你工作时观察你,发现你正准备使用错误的螺丝刀,并立即说:“等等!停下!那个工具用错了!”

目前的多数 AI 模型就像是一个在电影结束后才写影评的影评人。他们并不擅长做一个会在拍摄场景时大喊“剪切!”的导演。

解决方案:“GuideMe”
这篇论文的作者构建了一个新的测试场,叫做 GuideMe。你可以把它想象成一个专门为 AI 教练打造的巨大健身房。

  • 训练内容: 他们创建了一个包含超过 2,400 个视频(涵盖烹饪、修理物品、日常任务和健身等)的大型库,总时长超过 223 小时。
  • 练习项目: 他们不仅仅是给视频打标签;他们将这些视频转化成了互动对话。在这个健身房里,AI 必须:
    1. 给出下一个指令。
    2. 观察用户执行该指令。
    3. 至关重要的一点是: 如果用户犯了错,AI 必须立即发现并说:“不,那样不对,试试这个。”
    4. 如果用户做得很好,AI 则必须知道保持沉默,不要打断。

重大发现
研究人员将许多不同的 AI 模型(包括著名的商业模型和开源模型)放入了这个健身房进行测试,以观察它们的表现。结果令人惊讶,甚至有些令人失望:

  • “话痨型”: 一些 AI 太过于急于表达。即使在用户表现良好时,它们也会不停地大声指挥,或者在错误的时间给出建议。这就像是一个即便在你只是做拉伸动作时也从不停歇说话的教练。
  • “沉默型”: 其他 AI 则过于害羞。它们眼睁睁看着用户犯下巨大的错误却一言不发,只是等待用户主动寻求帮助。它们就像是一个坐在长凳上坐着看你失败的教练。
  • 差距: 这些 AI 其实非常擅长说:“接下来你应该做什么。”但它们在最难的部分表现得很糟糕:观察你正在做什么,意识到它错了,并即时进行纠正。

他们如何衡量成功
为了给 AI 打分,他们使用了三部分组成的评分卡:

  1. 时机(Timing): AI 是否在准确的时刻说话,还是太早或太晚了?
  2. 行为(Behavior): AI 是否知道何时保持沉默,何时开口说话?(这是最难的部分)。
  3. 质量(Quality): 当 AI 确实开口说话时,其建议是否真的有帮助且正确?

底线结论
论文得出结论:虽然 AI 在描述视频和提供逐步清单方面已经变得非常出色,但它距离成为一个可靠的实时教练仍有很长的路要走。它可以告诉你食谱,但它还无法通过观察你的烹饪过程来阻止你烤焦吐司。作者希望这个新的“健身房”(GuideMe)能帮助未来的 AI 开发者训练他们的模型,使其成为真正的互动教练,而不仅仅是消极的旁白叙述者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →