← 最新论文
💻 computer science

IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models

本文介绍了 IntentVLM,这是一种受前向 - 逆向建模启发的新颖两阶段视频 - 语言框架,通过将任务分解为目标候选生成和结构化选择,实现了最先进的开放词汇人类意图识别,从而显著减少了幻觉并达到了与人类相当的性能。

原作者: Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides, Olivier Sigaud, Mohamed Chetouani

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides, Olivier Sigaud, Mohamed Chetouani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在厨房里观察一位朋友。你看到他们打开冰箱,拿出一盒牛奶,然后走向咖啡机。

标准的机器人可能只会说:“这个人正拿着牛奶”或“这个人靠近咖啡机”。但一个真正有用的机器人需要理解他们为什么要这样做。这位朋友是在煮咖啡吗?他们只是在确认牛奶是否在那里?还是他们正准备为客人把牛奶倒进杯子里?

本文介绍了IntentVLM,这是一种专为解决上述问题而设计的机器人新型“大脑”。它能帮助机器人推断人类计划做什么,即使机器人之前并未被教导过一份具体的可能答案清单。

以下是其工作原理,通过简单的类比来说明:

问题:“多项选择”陷阱

大多数现有的机器人就像参加多项选择题考试的学生,老师只给他们五个选项可选。如果答案不在列表中,机器人就会卡住或猜错。

  • 旧方法:机器人看到牛奶和咖啡,必须从固定列表中选择,例如:"A) 煮咖啡,B) 泡茶,C) 清理”。如果这个人实际上是在做“热巧克力”,机器人可能会失败,因为列表中没有这个选项。
  • 新方法(IntentVLM):机器人能够理解开放式的想法。它不需要预先编写的列表。它可以自行推断出“制作热巧克力”。

解决方案:两步侦探过程

作者们受到人类大脑运作方式的启发。他们称之为**“前向 - 逆向建模”**。这就像侦探分两步解决谜案:

步骤 1:“如果……会怎样”生成器(前向模型)
机器人不是立即猜测答案,而是首先像头脑风暴一样运作。它观察视频并问道:“这个人做这件事的所有可能原因是什么?”

  • 类比:想象侦探列出嫌疑人。“也许他们在煮咖啡。也许他们在为泡茶加热牛奶。也许他们只是在检查保质期。”
  • 机器人根据所见内容生成这些“候选想法”的简短列表。

步骤 2:“最佳匹配”裁判(逆向模型)
一旦机器人有了可能性列表,它就扮演起严格裁判的角色。它再次观察视频并问道:“这些想法中哪一个最符合证据?”

  • 类比:侦探查看线索(这个人拿起了马克杯,而不是茶杯)并说:“好吧,‘泡茶’不符合。‘检查日期’也不符合。‘煮咖啡’完全吻合。”
  • 机器人从自己的列表中选出最佳匹配项。

为何这很特别

  1. 减少“幻觉”:人工智能有时会凭空捏造(产生幻觉)。通过强制机器人先列出可能性,然后从中选择最佳项,可以防止机器人胡乱猜测。这就像要求学生先展示解题过程,再给出最终答案。
  2. 开放思维:由于机器人自行生成想法列表,它不受限于有限的词汇表。它能够理解人类可能拥有的复杂、独特的意图。
  3. 高效:研究人员使用了一种“智能捷径”(称为 LoRA)来训练机器人。这就像给机器人一本专门的笔记本来学习新技能,而无需重写其整个大脑。这保持了机器人的速度,且不会让它忘记如何执行其他任务(如识别物体)。

结果

团队在两个不同的挑战中测试了这个机器人“大脑”:

  • IntentQA:一项测试,要求机器人回答关于视频中人们试图做什么的问题。
  • Inst-IT Bench:一项测试,旨在观察机器人在学会理解意图后,是否仍能识别物体和场景。

结果:

  • 新机器人的准确率约为80%,与之前的方法相比有了巨大飞跃(提高了约 30%)。
  • 在这些测试中,它的表现与人类相当。
  • 至关重要的是,学习理解意图并没有让机器人“忘记”如何识别物体或理解场景。它保持了其通用知识的完整性。

总结

IntentVLM 是一个教导机器人像侦探一样思考的系统:首先,设想行动的所有可能原因,然后,利用证据选出最合乎逻辑的一个。这使得机器人能够以灵活、自然的方式理解人类的目标,使其成为日常任务中更好的伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →