想象一下,你正在厨房里观察一位朋友。你看到他们打开冰箱,拿出一盒牛奶,然后走向咖啡机。
标准的机器人可能只会说:“这个人正拿着牛奶”或“这个人靠近咖啡机”。但一个真正有用的机器人需要理解他们为什么要这样做。这位朋友是在煮咖啡吗?他们只是在确认牛奶是否在那里?还是他们正准备为客人把牛奶倒进杯子里?
本文介绍了IntentVLM,这是一种专为解决上述问题而设计的机器人新型“大脑”。它能帮助机器人推断人类计划做什么,即使机器人之前并未被教导过一份具体的可能答案清单。
以下是其工作原理,通过简单的类比来说明:
问题:“多项选择”陷阱
大多数现有的机器人就像参加多项选择题考试的学生,老师只给他们五个选项可选。如果答案不在列表中,机器人就会卡住或猜错。
- 旧方法:机器人看到牛奶和咖啡,必须从固定列表中选择,例如:"A) 煮咖啡,B) 泡茶,C) 清理”。如果这个人实际上是在做“热巧克力”,机器人可能会失败,因为列表中没有这个选项。
- 新方法(IntentVLM):机器人能够理解开放式的想法。它不需要预先编写的列表。它可以自行推断出“制作热巧克力”。
解决方案:两步侦探过程
作者们受到人类大脑运作方式的启发。他们称之为**“前向 - 逆向建模”**。这就像侦探分两步解决谜案:
步骤 1:“如果……会怎样”生成器(前向模型)
机器人不是立即猜测答案,而是首先像头脑风暴一样运作。它观察视频并问道:“这个人做这件事的所有可能原因是什么?”
- 类比:想象侦探列出嫌疑人。“也许他们在煮咖啡。也许他们在为泡茶加热牛奶。也许他们只是在检查保质期。”
- 机器人根据所见内容生成这些“候选想法”的简短列表。
步骤 2:“最佳匹配”裁判(逆向模型)
一旦机器人有了可能性列表,它就扮演起严格裁判的角色。它再次观察视频并问道:“这些想法中哪一个最符合证据?”
- 类比:侦探查看线索(这个人拿起了马克杯,而不是茶杯)并说:“好吧,‘泡茶’不符合。‘检查日期’也不符合。‘煮咖啡’完全吻合。”
- 机器人从自己的列表中选出最佳匹配项。
为何这很特别
- 减少“幻觉”:人工智能有时会凭空捏造(产生幻觉)。通过强制机器人先列出可能性,然后从中选择最佳项,可以防止机器人胡乱猜测。这就像要求学生先展示解题过程,再给出最终答案。
- 开放思维:由于机器人自行生成想法列表,它不受限于有限的词汇表。它能够理解人类可能拥有的复杂、独特的意图。
- 高效:研究人员使用了一种“智能捷径”(称为 LoRA)来训练机器人。这就像给机器人一本专门的笔记本来学习新技能,而无需重写其整个大脑。这保持了机器人的速度,且不会让它忘记如何执行其他任务(如识别物体)。
结果
团队在两个不同的挑战中测试了这个机器人“大脑”:
- IntentQA:一项测试,要求机器人回答关于视频中人们试图做什么的问题。
- Inst-IT Bench:一项测试,旨在观察机器人在学会理解意图后,是否仍能识别物体和场景。
结果:
- 新机器人的准确率约为80%,与之前的方法相比有了巨大飞跃(提高了约 30%)。
- 在这些测试中,它的表现与人类相当。
- 至关重要的是,学习理解意图并没有让机器人“忘记”如何识别物体或理解场景。它保持了其通用知识的完整性。
总结
IntentVLM 是一个教导机器人像侦探一样思考的系统:首先,设想行动的所有可能原因,然后,利用证据选出最合乎逻辑的一个。这使得机器人能够以灵活、自然的方式理解人类的目标,使其成为日常任务中更好的伙伴。
以下是论文《IntentVLM:通过视频 - 语言模型的前向 - 逆向建模实现开放词汇意图识别》的详细技术总结。
1. 问题定义
本文解决了人机交互(HRI)中开放词汇人类意图识别的挑战。
- 核心挑战: 与物理动作不同,意图是潜在的心理状态,不可直接观测。现有方法通常依赖封闭词汇方法(预定义的标签集),无法捕捉无约束环境中人类目标的细微差别、多样性及复合动机。
- 现有方法的局限性:
- 封闭集分类: 将模型限制在固定的标签空间内,限制了表达力。
- 直接生成: 大型语言模型(LLM)或视觉 - 语言模型(VLM)在无约束情况下被要求直接从视频中推断意图时,往往会导致幻觉和预测不一致。
- 静态感知: 许多先前的工作依赖静态图像,未能捕捉理解意图所必需的时间动态和上下文演变。
- 目标: 开发一种系统,能够在不依赖预定义动作词汇的情况下,从视频流中推断出人类意图的自由形式自然语言描述,同时保持鲁棒性并减少幻觉。
2. 方法论:IntentVLM
作者提出了IntentVLM,这是一种受认知科学中前向 - 逆向建模启发的新颖两阶段视频 - 语言框架。核心假设是:大脑首先模拟可能的未来状态(前向),然后逆向推理以推断意图(逆向)。
架构概览
该框架利用两个冻结的视频 - 语言模型(VLM),并辅以**LoRA(低秩自适应)**适配器进行参数高效微调。过程分为两个连续阶段:
阶段 1:目标候选生成(“前向”步骤)
- 输入: 观测视频序列(VO)和文本查询(QO)。
- 功能: 生成模块产生一组多样化的K个合理目标候选(Gt={G1,...,GK}),用以解释观测到的行为。
- 机制: 这充当“提议”步骤,基于视觉上下文模拟潜在的结果或目标。它扩展了搜索空间以包含开放词汇的可能性,而不是限制在固定列表中。
- 实现: 对 Qwen3-VL 模型(80 亿参数)进行微调以生成这些候选项。
阶段 2:结构化选择(“逆向”步骤)
- 输入: 原始视频、查询以及阶段 1 生成的候选目标集。
- 功能: 推理模块评估候选项并选择最合理的单一意图。
- 机制: 这充当“专家”角色,对候选项进行推理,根据其与视觉证据和上下文信息的一致性进行排序。
- 实现: 单独微调一个 Qwen3-VL 实例(20 亿或 40 亿参数)来执行选择。最终输出是后验概率最高的目标,被视为推断出的意图。
训练策略:
- 参数高效微调(PEFT): 仅训练 LoRA 适配器,保持基础 VLM 权重冻结,以保留通用世界知识并防止灾难性遗忘。
- 损失函数: 在生成的 token 与真实标签(阶段 1 为候选项,阶段 2 为真实意图)之间计算交叉熵损失。
3. 主要贡献
- 开放词汇框架: 超越封闭集分类,转向生成 - 选择范式,使模型能够识别预定义训练词汇中不存在的意图。
- 受认知启发的两阶段设计: 明确将意图识别分解为提议(生成假设)和选择(验证假设)。这种结构模仿了人类的认知过程(前向 - 逆向建模),与直接生成相比显著减少了幻觉。
- 最先进的性能: 在意图识别基准测试中实现了类人性能,显著优于现有基线。
- 鲁棒性与效率: 证明了模块化设计防止了灾难性遗忘(保留通用场景理解能力),并且与更大的基线模型相比,使用较小的模型规模(40 亿参数)即可实现高性能。
4. 实验结果
该模型在两个基准测试上进行了评估:IntentQA(意图识别)和Inst-IT Bench(实例级推理)。
- IntentQA 性能:
- 准确率: IntentVLM 在测试集上达到了约 80% 的准确率。
- 对比: 这代表了相对于现有基线(如 HME、HQGA、VGT)的约 30% 的提升,并且与人类性能(78.49%)相匹配。
- 消融实验: 40 亿参数模型的表现优于 20 亿版本。与零样本设置相比,微调显著提升了性能。
- 开放词汇能力:
- 在自由形式生成设置(不提供候选选项)中,标准 VLM 的直接生成表现不佳(ROUGE 分数<20)。
- 通过候选选择机制约束生成空间,IntentVLM 的两阶段方法在开放词汇设置中将性能平均提升了约 5 个点。
- 泛化性(灾难性遗忘):
- 在 IntentQA 上的训练并未降低模型在Inst-IT Bench上执行实例级推理的能力。微调后的模型仍与零样本对应模型保持竞争力。
- 效率: 40 亿参数的 IntentVLM 实现了与超过 70 亿参数模型相当的性能,突显了更优的规模 - 性能权衡。
5. 意义与影响
- 推进人机交互: 通过使机器人能够理解微妙、开放的人类目标(例如“煮咖啡”与“烧水泡茶”),而无需预编程脚本,IntentVLM 为更具主动性和社会意识的机器人助手铺平了道路。
- ** bridging 认知科学与人工智能:** 该工作成功将前向 - 逆向建模的理论概念转化为实用且可扩展的深度学习架构。
- 推理的可靠性: 结构化推理方法(先生成后选择)为生成式 AI 中常见的“幻觉”问题提供了解决方案,使其更适合护理或辅助机器人等安全关键应用。
- 可扩展性: 使用 LoRA 适配器允许在不进行全量微调的计算成本下,高效地将大型基础模型适配到特定认知任务。
总之,IntentVLM 表明,将意图识别分解为结构化的两阶段认知过程,使视频 - 语言模型能够实现对人类复杂开放词汇目标的类人理解,为下一代智能机器人系统提供了坚实的基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。