← 最新论文
💻 computer science

PointRL: Learning Point-Level Vision-Language Grounding from Verifiable Annotation Evidence

PointRL 引入了一种可验证的强化学习框架,该框架将异构标注(如边界框和掩码)转化为隐藏证据,用于训练视觉语言模型进行点级定位,从而显著提高了多个基准测试中的准确性和空间推理能力。

原作者: Jingyang Su, Pu Cao, Xiuze Jin, Longyue Zhang, Qing Song, Lu Yang

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingyang Su, Pu Cao, Xiuze Jin, Longyue Zhang, Qing Song, Lu Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,有一台计算机可以通过摄像头观察世界,并能用人类语言理解它所看到的内容。这就是视觉语言模型(vision-language models)所承诺的前景——一种将文字与图像相连接的人工智能。多年来,这些系统一直被教导通过在物体周围画框或涂抹形状来指出物体。虽然这些方法很有用,但在需要精准度的任务中(例如机器人手臂去够一个特定的按钮,或数字助手点击屏幕上的链接),它们可能会显得笨拙。一个坐标,一个简单的点,通常是告诉机器确切看向何处或采取何种行动的一种更直接、更高效的方式。然而,教导计算机进行精准指向却出人意料地困难。如果你要求一个人指着一个“红杯子”,他们可能会指着把手、杯缘或杯身;这些都是正确的。但如果你要求计算机从一个单一、固定的答案中学习,它就会被这种自然的灵活性所困扰。它很难理解许多不同的点都可以是正确的,或者一条指令可能需要同时指向多个不同的物体,而不遗漏任何一个或重复指向同一个位置。

一个研究小组开发了一种名为 PointRL 的新方法来解决这个问题,使这些智能系统能够以更高的可靠性学习如何进行指向。研究人员并没有强迫计算机为每张图像背诵一个单一、僵化的答案,而是创建了一个像严格而公正的评分员一样的系统。他们利用现有的数据——例如物体的框图、轮廓或物体列表——并将它们转化为计算机的指令。至关重要的是,他们在计算机的学习过程中将原始的图形和列表隐藏了起来。这些隐藏的记录作为“标准答案”,供一个数字检查器用于评估计算机的猜测。当计算机生成响应时,检查器会将预测的点与隐藏的证据进行对比。它不仅仅是在寻找完美的匹配,还会检查这些点是否落在正确的区域内,点的总数是否符合请求,以及计算机是否避免了重复指向同一个位置或被无关细节分散注意力。

这一方法的成果是显著的。在旨在衡量指向能力的标准挑战集测试中,该系统的整体准确率从大约 56% 提高到了接近 66%。这种进步不仅仅是让位置变得稍微接近了一点,而是使系统在执行复杂指令方面变得更加出色,例如计数多个物体,或根据功能而非仅仅根据外观来寻找物体。研究人员发现,即使将该方法应用于其从未见过的不同类型的任务和数据集,它依然表现良好,这表明通过这种类型的隐藏且可验证的反馈进行学习是一种强大的工具,可以教导机器进行空间推理。通过将指向任务视为一个满足一系列规则的问题,而非寻找一个单一固定点的问题,研究人员展示了这些模型可以学会以一种此前难以实现的细致程度来理解视觉世界。这项工作表明,通过使用隐藏的证据来引导学习,我们可以帮助人工智能不仅理解图像中有什么,还能理解确切地在哪里与之交互。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →