UniVR: Thinking in Visual Space for Unified Visual Reasoning
本文介绍了 UniVR,这是一个利用 VR-GRPO 强化学习范式的新型框架,旨在实现直接从原始视觉数据中进行统一的视觉推理、物理动力学理解和长期规划,并在无需依赖文本或特定任务启发式方法的情况下,在新建的 VR-X 基准测试上取得了显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人如何系鞋带、折叠床单或解决一个复杂的迷宫。长期以来,实现这一目标的最高明方法是编写一本冗长且详尽的英文(或任何语言)说明书,然后寄希望于机器人能够阅读它、理解物理规律,并尝试绘制出步骤图。
但转折在于:UniVR 提出,也许我们一直想得太复杂了。与其强迫机器人先将世界翻译成文字,不如让它直接“用图像思考”。
“用文字思考”的问题所在
目前的超智能 AI 模型就像是读遍了世间所有书籍的博学图书管理员。它们可以用完美的语法告诉你如何打结。但当它们试图真正动手去做时,往往会因为物理常识而跌跤。它们可能会说:“现在,把绳子拉紧。”但在它们的脑内电影中,绳子可能会穿过桌面,或者绳结会神奇地自行解开。
论文指出,依赖文本来描述现实世界,就像试图仅用数学方程来描述草莓的味道一样。你能得到数据,却错失了那种混乱且动态的真实感。即使是最优秀的模型,在被要求进行长序列动作规划(如烹饪一顿饭或在房间里穿行)时,生成的视频也经常会出现物理定律失效、物体消失或逻辑无法自洽的情况。
解决方案:UniVR 与“视觉健身房”
走进 UniVR 的世界。把这想象成一个全新的 AI 训练营,这里的学生不被允许说话,他们只能通过观察和实践来学习。
UniVR 不是通过阅读手册来学习,而是直接从原始视频演示中学习。它观看成千上万段人类系结、折叠衣服或解决谜题的片段。它不需要老师说“第一步:抓住绳子”,它只需通过观察视觉流就能领悟其中的规律。
为了确保 AI 不仅仅是在随机猜测,研究人员构建了一种特殊的训练方法,称为 VR-GRPO。想象一位严格但公正的教练在监督 AI 练习:
- 全局教练(The Global Coach): 检查机器人是否真的完成了任务(例如:“结打好了吗?”)。
- 步骤聚焦教练(The Step-Focal Coach): 这是其中的核心秘诀。全局教练可能会忽略微小的错误,比如手滑了一下,或者球在动作过程中向错误的方向滚动。步骤聚焦教练则会放大这些棘手的瞬间。如果 AI 的“脑内电影”在中间过程变得摇晃或不合逻辑,这位教练就会捕捉到它并说:“喔,这在物理上讲不通!重来。”
这种结合确保了 AI 不仅仅是在最后阶段侥幸成功,而是必须在每一步都保持逻辑严密且符合物理规律。
大考:VR-X
为了验证这是否奏效,团队构建了一个巨大的障碍赛场,名为 VR-X。它就像一个大型视频游戏关卡,包含 16 种不同类型的挑战,从复杂的长程任务(如机械臂操控和烹饪)到快速的脑力测试(如视觉谜题和物体搜索)。
结果如何?UniVR 不仅通过了测试,甚至是在冲刺。
- 在这个全新的基准测试中,UniVR 的表现比以往的方法提升了高达 25%。
- 尽管它是一个相对较小的模型(拥有 340 亿个参数),但它在长程规划任务上的表现,竟然击败了像 Gemini 3 Pro 结合其他工具这类规模大得多的文本密集型系统。
- 它不仅在任务完成度上有所提升,在理解图像方面也变得更强,在 MMMU 和 MME 等标准视觉测试中也取得了更高的分数。
这意味着什么(以及它并不意味着什么)
论文对这项技术的定位非常明确。
- 它 不是 一个能解决所有 AI 问题的魔杖。作者明确指出,如果仅依赖文本,目前的模型在精细物理层面仍然存在困难。
- 它 是 一个强有力的证明,证明 AI 可以直接从视觉数据中学习复杂的推理,而不需要持续不断的文本指令流。
- 其结果是在其特定的基准测试(VR-X)以及多个现有的公开测试中经过衡量与证实的。作者认为,这种“在视觉空间中思考”的方法是构建更好世界模型的强大途径,但他们并未声称这是人工智能的终极答案。
简而言之,UniVR 展示了有时学习世界运作规律的最佳方式,不是去读一本关于它的书,而是投身其中,仔细观察,并通过观察事物如何移动和变化来领悟其中的规则。这是迈向一种不再仅仅是“谈论”世界,而是真正“看见”世界的 AI 的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。