← 最新论文
🤖 AI

Mull-Tokens: Modality-Agnostic Latent Thinking

本文介绍了 Mull-Tokens,这是一种模态无关的潜在令牌框架,使多模态模型能够在文本和图像模态之间执行自由形式的中间推理,从而在不依赖脆弱的工具调用或耗时的图像生成的情况下,显著提升在复杂空间与谜题解决任务上的性能。

原作者: Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和富有创意的类比对论文《Mult-Tokens: Modality-Agnostic Latent Thinking》(多令牌:模态无关的潜在思维)的解释。

核心难题:在一维中思考

想象你正在尝试解决一个复杂的三维拼图,比如魔方或七巧板。如果你试图仅用文字来解它,你可能会说:“把红色块移到左边,然后旋转蓝色块。”但文字对此而言既缓慢又笨拙;它们难以轻松描述形状、深度或部件在空间中如何契合。

当前的 AI 模型擅长“说话”(文本)和“看”(图像),但当它们试图对空间、时间或物体运动进行推理时,往往会跌跌撞撞。

  • 旧方法(仅文本): AI 试图用文字描述拼图。它容易迷失在细节中并犯错。
  • “过度”方法(图像 + 文本): 一些研究人员尝试让 AI“绘制”其思维。但这就像要求一位厨师停止烹饪,写下一份食谱,画一道菜的图,再写另一份食谱,最后才端上食物。这既昂贵又缓慢,且 AI 常常搞不清哪张图对应哪句话。

解决方案:“多令牌”(魔法草稿纸)

作者提出了一种更简单、更智能的工具,称为Mult-Tokens

将 AI 的大脑想象成一个厨房。

  • 文本令牌就像厨师的口头指令。
  • 图像令牌就像厨师在便签上实际画图。
  • 多令牌则像一块魔法、无形的草稿纸

当 AI 面对难题(如空间拼图)时,它不再大声喊出一大段文字或绘制整幅图画,而是暂停,在这张无形的草稿纸上书写。

为何它如此神奇?

  1. 模态无关性: 这是一个 fancy 术语,意为“它不在乎思维采取何种形式”。这张草稿纸可以容纳旋转立方体的心理图像,也可以是路线的符号地图。它不必是文字,也不必是完整的图像。它只是纯粹的“思维数据”。
  2. 紧凑性: 典型的文本解释可能需要 200 个词,一张完整的图像可能需要数百个像素。而多令牌方法仅需20 到 40 个令牌即可解决问题。这就像解释一道数学题时,是写十页论文,还是仅仅在餐巾纸上潦草地写下关键公式。

训练过程:三步健身法

研究人员不仅给了 AI 这张草稿纸,还必须教会它如何使用。他们采用了一个三步训练流程:

  1. 热身(学习思维语言):
    首先,他们向 AI 展示人们解决拼图的示例。有时解决方案涉及绘图,有时涉及句子。他们教导多令牌模仿这些步骤。

    • 类比: 这就像学生观察老师解题,有时看到老师写数字,有时看到老师画图。学生学到“草稿纸”可以容纳两者。
  2. 自由练习(放手):
    接下来,他们不再向 AI 展示如何解决问题,只展示最终答案。他们告诉 AI:“这是拼图。用你的草稿纸来解,但我不告诉你该在上面写什么。只要得出正确答案即可。”

    • 类比: 老师停止给出提示,只说:“解这道题。”学生学会以自己最有效的方式使用草稿纸,而不仅仅是模仿老师。
  3. 强化(奖励良好思维):
    最后,他们使用了一种名为GRPO(强化学习)的技术。如果 AI 利用草稿纸得出正确答案,它就获得“金星”;如果它未经思考就猜测,则一无所获。这鼓励 AI 真正使用草稿纸进行推理,而不仅仅是猜测。

结果:更快更聪明

该论文在四个涉及拼图、三维空间推理和视频分析的困难基准测试中测试了这种新方法。

  • 胜利: 使用多令牌的 AI 平均表现比现有最佳方法高出3%。在最难的拼图测试中,其提升幅度达16%
  • 速度: 由于它仅使用约 20 个“思维令牌”,而非数百个词或图像,因此运行速度更快、成本更低。
  • 灵活性: AI 学会了决定何时使用草稿纸。对于一些简单问题,它跳过草稿纸;对于困难的空间拼图,它则大量使用。

核心结论

该论文认为,我们无需强迫 AI 为了深度思考而“说话”或“绘图”。相反,我们可以赋予它一个模态无关的潜在空间——一个私密的内部“思维室”,它可以在其中自由混合图像与概念,而无需生成完整句子或图像所带来的开销。

这就像赋予人类一种无声的内部独白,可以在不将其大声描述出来的情况下可视化三维物体。其结果是:AI 在空间拼图上表现更佳,速度更快,效率更高。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →