MolmoPoint: Better Pointing for VLMs with Grounding Tokens
该论文提出了 MolmoPoint,一种通过生成特殊指向令牌直接选择视觉令牌(而非生成文本坐标)来实现更直观、细粒度点选的新机制,从而在图像、GUI 和视频点选任务上取得了新的最先进性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 MolmoPoint 的新模型,它的核心任务是教人工智能(AI)如何更聪明、更精准地“用手指”在图片或视频上指东西。
为了让你轻松理解,我们可以把现在的 AI 想象成一个刚学会说话但还没学会指路的小学生,而 MolmoPoint 就是给这个小学生装上了一套**“超级指路系统”**。
1. 以前的痛点:笨拙的“坐标描述法”
以前的做法:
想象一下,你让 AI 在一张照片里指出“左边那辆车的刹车灯”。
传统的 AI 就像是一个只会背坐标的机器人。它不能直接指,它必须先在脑子里画一个巨大的网格,然后告诉你:“我在第 1024 行、第 567 列的位置”。
- 缺点: 这就像你让朋友找东西,朋友却告诉你:“往东走 342 步,再往北走 128 步”。
- 太累: 说这一串数字要占用很多“脑容量”(Token),导致说话慢、成本高。
- 容易错: 如果图片分辨率变了(比如从手机屏变成了 4K 电视),原来的坐标就全乱了,机器人就迷路了。
- 不直观: 它得先学会复杂的数学坐标系,才能开始指。
2. MolmoPoint 的创新:直接的“目光锁定法”
现在的做法(MolmoPoint):
MolmoPoint 换了一种更直观的方式。它不再背坐标,而是直接**“看”**。
当它听到“指一下刹车灯”时,它会直接扫描图片里的那些小方块(视觉标记),然后选中包含刹车灯的那一块。
它的“三步走”指路策略(就像用放大镜找东西):
第一步(
):粗略定位 - 比喻: 就像你拿着一张大海报,先大致指出“刹车灯在海报的左上角那个区域”。
- 动作: 模型先选中一个大的图片块。
第二步(
):精细聚焦 - 比喻: 接着,你拿出一个放大镜,只盯着刚才选的那个左上角区域,说:“哦,刹车灯在这个小格子里”。
- 动作: 模型在刚才选的大块里,再选一个更小的细节块。
第三步(
):精准落点 - 比喻: 最后,你在这个小格子里,用笔尖精准地点在刹车灯的中心。
- 动作: 模型在这个小格子里确定最终的一个点。
这个方法的妙处:
- 不用背坐标: 它不需要知道“第几行第几列”,它只需要知道“我刚才看的那块东西”。无论图片多大,它都能用同样的逻辑指准。
- 省字数: 以前指一个点要报一串长数字,现在只需要发三个特殊的“指令词”(就像按了三个快捷键),速度快多了。
- 更聪明: 如果它已经“看”到了刹车灯,它就能直接指过去,不需要重新计算。
3. 防止“指手画脚”的刹车机制
问题:
有时候 AI 太兴奋了,指了一个点还想指下一个,结果指了一堆乱七八糟的点,或者死循环。
解决方案:
MolmoPoint 加了一个**“指完了”(No-More-Points)**的开关。
- 比喻: 就像老师告诉学生:“指完这个就停,不要乱指了。”如果 AI 觉得已经找全了,它就发出一个特殊的信号说“指完了”,然后乖乖闭嘴。这大大减少了 AI 犯傻(生成多余点)的情况。
4. 它有多强?(实战表现)
作者训练了三个版本的模型,并在各种场景下测试,效果惊人:
- 看自然图片(MolmoPoint-8B):
- 在“指路考试”(PointBench)中,它拿到了第一名。以前指路像是指路牌,现在像是指路员,精准度大幅提升。
- 看电脑屏幕(MolmoPoint-GUI-8B):
- 这是它的杀手锏。现在的 AI 助手要帮你操作电脑(比如“点击那个红色的下载按钮”)。以前的 AI 经常点错位置,MolmoPoint 因为能处理高分辨率屏幕,指得非常准,在专业测试中也是第一。
- 比喻: 以前是盲人摸象,现在是指哪打哪。
- 看视频(MolmoPoint-Vid-8B):
- 不仅能指静态图,还能在视频里指。比如“指一下视频里那只正在跳起来的狗”。它不仅能指,还能跟踪(Tracking),就像用激光笔跟着视频里的物体跑,不会跟丢。
- 在人类测试中,大家更喜欢它的指路方式,因为它更自然、更准确。
5. 总结:为什么这很重要?
这就好比给 AI 装上了一双**“会思考的眼睛”和“灵活的手指”**。
- 以前: AI 像个只会读地图的导航员,路稍微变一点它就晕了,说话还啰嗦。
- 现在(MolmoPoint): AI 像个经验丰富的向导,看到东西直接指,不管路怎么变,它都能精准定位。
这对我们意味着什么?
- 机器人更聪明: 机器人能更准确地抓取物体(比如“把那个红色的苹果拿给我”)。
- 电脑助手更好用: 未来的 AI 助手能帮你操作复杂的软件,点菜单、填表格,就像你自己在操作一样精准。
- 效率更高: 因为不需要计算复杂的坐标,AI 反应更快,成本更低。
简单来说,MolmoPoint 让 AI 从**“死记硬背坐标”进化到了“直观视觉指路”**,这是让 AI 真正理解世界并与我们互动的一大步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。