← 最新论文
🤖 AI

MolmoPoint: Better Pointing for VLMs with Grounding Tokens

该论文提出了 MolmoPoint,一种通过生成特殊指向令牌直接选择视觉令牌(而非生成文本坐标)来实现更直观、细粒度点选的新机制,从而在图像、GUI 和视频点选任务上取得了新的最先进性能。

原作者: Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun Tripathi, Mohammadreza Salehi, Sangho Lee, Taira Anderson, Winson Han, Ranjay Krishna

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun Tripathi, Mohammadreza Salehi, Sangho Lee, Taira Anderson, Winson Han, Ranjay Krishna

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 MolmoPoint 的新模型,它的核心任务是教人工智能(AI)如何更聪明、更精准地“用手指”在图片或视频上指东西。

为了让你轻松理解,我们可以把现在的 AI 想象成一个刚学会说话但还没学会指路的小学生,而 MolmoPoint 就是给这个小学生装上了一套**“超级指路系统”**。

1. 以前的痛点:笨拙的“坐标描述法”

以前的做法:
想象一下,你让 AI 在一张照片里指出“左边那辆车的刹车灯”。
传统的 AI 就像是一个只会背坐标的机器人。它不能直接指,它必须先在脑子里画一个巨大的网格,然后告诉你:“我在第 1024 行、第 567 列的位置”。

  • 缺点: 这就像你让朋友找东西,朋友却告诉你:“往东走 342 步,再往北走 128 步”。
    • 太累: 说这一串数字要占用很多“脑容量”(Token),导致说话慢、成本高。
    • 容易错: 如果图片分辨率变了(比如从手机屏变成了 4K 电视),原来的坐标就全乱了,机器人就迷路了。
    • 不直观: 它得先学会复杂的数学坐标系,才能开始指。

2. MolmoPoint 的创新:直接的“目光锁定法”

现在的做法(MolmoPoint):
MolmoPoint 换了一种更直观的方式。它不再背坐标,而是直接**“看”**。
当它听到“指一下刹车灯”时,它会直接扫描图片里的那些小方块(视觉标记),然后选中包含刹车灯的那一块。

它的“三步走”指路策略(就像用放大镜找东西):

  1. 第一步():粗略定位

    • 比喻: 就像你拿着一张大海报,先大致指出“刹车灯在海报的左上角那个区域”。
    • 动作: 模型先选中一个大的图片块。
  2. 第二步():精细聚焦

    • 比喻: 接着,你拿出一个放大镜,只盯着刚才选的那个左上角区域,说:“哦,刹车灯在这个小格子里”。
    • 动作: 模型在刚才选的大块里,再选一个更小的细节块。
  3. 第三步():精准落点

    • 比喻: 最后,你在这个小格子里,用笔尖精准地点在刹车灯的中心。
    • 动作: 模型在这个小格子里确定最终的一个点。

这个方法的妙处:

  • 不用背坐标: 它不需要知道“第几行第几列”,它只需要知道“我刚才看的那块东西”。无论图片多大,它都能用同样的逻辑指准。
  • 省字数: 以前指一个点要报一串长数字,现在只需要发三个特殊的“指令词”(就像按了三个快捷键),速度快多了。
  • 更聪明: 如果它已经“看”到了刹车灯,它就能直接指过去,不需要重新计算。

3. 防止“指手画脚”的刹车机制

问题:
有时候 AI 太兴奋了,指了一个点还想指下一个,结果指了一堆乱七八糟的点,或者死循环。

解决方案:
MolmoPoint 加了一个**“指完了”(No-More-Points)**的开关。

  • 比喻: 就像老师告诉学生:“指完这个就停,不要乱指了。”如果 AI 觉得已经找全了,它就发出一个特殊的信号说“指完了”,然后乖乖闭嘴。这大大减少了 AI 犯傻(生成多余点)的情况。

4. 它有多强?(实战表现)

作者训练了三个版本的模型,并在各种场景下测试,效果惊人:

  • 看自然图片(MolmoPoint-8B):
    • 在“指路考试”(PointBench)中,它拿到了第一名。以前指路像是指路牌,现在像是指路员,精准度大幅提升。
  • 看电脑屏幕(MolmoPoint-GUI-8B):
    • 这是它的杀手锏。现在的 AI 助手要帮你操作电脑(比如“点击那个红色的下载按钮”)。以前的 AI 经常点错位置,MolmoPoint 因为能处理高分辨率屏幕,指得非常准,在专业测试中也是第一
    • 比喻: 以前是盲人摸象,现在是指哪打哪。
  • 看视频(MolmoPoint-Vid-8B):
    • 不仅能指静态图,还能在视频里指。比如“指一下视频里那只正在跳起来的狗”。它不仅能指,还能跟踪(Tracking),就像用激光笔跟着视频里的物体跑,不会跟丢。
    • 在人类测试中,大家更喜欢它的指路方式,因为它更自然、更准确。

5. 总结:为什么这很重要?

这就好比给 AI 装上了一双**“会思考的眼睛”“灵活的手指”**。

  • 以前: AI 像个只会读地图的导航员,路稍微变一点它就晕了,说话还啰嗦。
  • 现在(MolmoPoint): AI 像个经验丰富的向导,看到东西直接指,不管路怎么变,它都能精准定位。

这对我们意味着什么?

  • 机器人更聪明: 机器人能更准确地抓取物体(比如“把那个红色的苹果拿给我”)。
  • 电脑助手更好用: 未来的 AI 助手能帮你操作复杂的软件,点菜单、填表格,就像你自己在操作一样精准。
  • 效率更高: 因为不需要计算复杂的坐标,AI 反应更快,成本更低。

简单来说,MolmoPoint 让 AI 从**“死记硬背坐标”进化到了“直观视觉指路”**,这是让 AI 真正理解世界并与我们互动的一大步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →