← 最新论文
🤖 machine learning

Multimodality as Supervision: Self-Supervised Specialization to the Test Environment via Multimodality

本文提出了测试空间训练(Test-Space Training, TST),这是一种利用专门从特定测试环境中收集的多模态数据进行跨模态学习的自监督方法,旨在开发出能够与在规模化互联网数据集上预训练的通用模型相媲美的专业化模型,从而减少对外部数据的依赖。

原作者: Kunal Pratap Singh, Ali Garjani, Rishubh Singh, Muhammad Uzair Khattak, Efe Tarhan, Jason Toskov, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Kunal Pratap Singh, Ali Garjani, Rishubh Singh, Muhammad Uzair Khattak, Efe Tarhan, Jason Toskov, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一个刚出生的婴儿,又盲又聋,突然在房间里醒来。你完全不知道什么是“椅子”或“狗”。但就在这时,你睁开了眼睛,看到了一个形状。与此同时,你的耳朵听到了一种声音,你的手感受到了一种质感。你的大脑并不需要老师来告诉你这个形状、那个声音和那种感觉都属于同一个物体,它就能自动理解。这就是**多模态(multimodality)**的魔力:利用多种感官来理解世界,而无需人类为每一件事进行标注。

长期以来,构建人工智能(AI)的科学家们试图通过给计算机喂食来自整个互联网的数百万张图片来教导它们,就像一个学生在巨大的图书馆里背诵每一本书一样。这种方法效果很好,但很混乱,需要海量的数据,并且往往忽略了机器人实际所处的那个特定房间。研究人员提出的核心问题是:我们能否仅通过机器人现有的传感器,教它成为其自身特定世界的专家,而不需要下载整个互联网?这篇论文深入探讨了这个问题,探索了 AI 是否可以通过交叉引用自身的眼睛、深度传感器和其他工具,像一个好奇的婴儿学习自己的家一样,来观察并理解其特定的环境。


论文:教 AI 成为局部专家

发表在 ICLR 2026 会议上的这篇论文,作者提出了一种名为**测试空间训练(Test-Space Training, TST)**的新型 AI 训练方法。他们并没有试图构建一个知道世界上每间房子的“通才”机器人,而是决定构建一个能完美掌握某一特定房子的“专才”机器人。

你可以这样理解:想象你正在搬进一间新房子。你可以花数年时间阅读关于地球上每间房子的旅游指南(“通才”方法),或者你也可以仅仅通过在自己家里走动一周,触摸墙壁、观察家具、聆听地板的吱呀声(“专才”方法)。论文指出,对于生活在那间房子里的机器人来说,第二种方法实际上要好得多。

他们是如何做的
研究人员创建了一个“沙盒”(一个受控测试环境),其中放置了一个配备多种传感器的虚拟智能体。这个智能体不仅拍摄照片(RGB 图像),还使用深度传感器(观察距离远近)、表面法线(观察墙壁的角度),甚至模拟了其他感官。

他们让这个智能体在其特定的“测试空间”(一个数字化的房间或房屋)内四处走动并收集数据。然后,他们使用了一个巧妙的技巧,称为跨模态学习(Cross-Modal Learning)。这就像是在玩一个“猜缺失部分”的游戏。AI 尝试通过观察照片来预测深度传感器会看到什么,或者根据深度图来预测照片的内容。通过不断重复这一过程,AI 建立起对该特定房间的深刻理解,而无需任何人告诉它“那是椅子”或“那是门”。它之所以能理解,是因为不同的传感器相互印证。

重大发现
论文展示了一些令人惊讶的结果,挑战了“数据越大越好”的观点。

  1. 局部知识胜过全局数据(有时): 当他们将这个“专才”模型应用于寻找物体或描述房间等任务时,它的表现出奇地好。事实上,当他们仅使用设备自带的传感器(没有外部帮助)时,该模型的表现足以与那些在数十亿张互联网图像上训练的大型模型相媲美。这表明,对于生活在特定房屋中的机器人来说,彻底了解那间房子比略微了解每间房子更有价值。
  2. 多感官 > 多图片: 研究人员发现,向训练数据中添加更多类型的传感器(模态)比单纯增加互联网上的图片更有效。如果你有一个拥有 8 种传感器的机器人在一个房间里,它学习的速度和质量都会比一个仅靠摄像头观察 1,000 个不同房间的机器人更高。这就像是一个由 8 名侦探组成的团队在同一间房子里破解谜案,要比一名侦探观察 1,000 个犯罪现场更高效。
  3. “蒸馏”技巧: 为了让他们的模型更强大,他们使用了一个聪明的捷径。他们提取了其他强大的预训练 AI 模型(如 CLIP 或 DINOv2)的“思想”(特征图),并将这些思想视为“新传感器”。他们并没有使用这些模型所训练的互联网数据,而仅仅使用了这些模型在特定测试空间上的输出。这就像是拿走了一位名厨的菜谱笔记,并用这些笔记来教一位当地厨师如何完美地烹饪一道特定的菜肴,而这位当地厨师甚至不需要去拜访那位名厨的厨房。这个“专才”模型最终在特定的测试环境中击败了“通才”模型。

他们排除了什么
论文明确反对了“构建良好的 AI 必须依赖海量、多样化的互联网数据集”这一观点。他们证明了,如果你拥有来自目标环境的丰富的多模态数据,那么依赖外部数据并不总是必要的。他们还发现,仅仅拥有来自不同地方(更多房子)的数据,其帮助程度并不如拥有来自同一地方(同一房子中的更多传感器)的丰富数据。

他们有多确定?
作者根据进行的实验对其发现充满信心。他们使用标准指标(如衡量 AI 分割图像能力的 mIoU,以及衡量物体检测能力的 mAP)来衡量结果。

  • 他们发现,其“仅传感器”模型具有竞争力,但并未完全达到使用“蒸馏”伪标签的版本的高度,这表明在缩小与全监督模型之间的差距方面仍有提升空间。
  • 他们发现,其“专才”模型(TST-MM)在测试空间中达到了最先进的水平(state-of-the-art),在语义分割和物体检测等任务上超越了 DINOv2 和 4M-21 等通才模型。
  • 他们展示了一个清晰的权衡:模型对特定空间的专业化程度越高,它在处理新的、未见过的空间时的泛化能力就越差。这证实了他们成功创建了一个专家,而非通才。

总结
这篇论文暗示了我们构建现实世界 AI 的方式可能会发生转变。与其试图构建一个了解整个互联网的“超级大脑”,我们或许更应该构建“局部专家”,让他们利用现有的所有传感器,深度学习周围的即时环境。对于许多现实世界的应用(如家用机器人或数字助手)来说,成为一名专家不仅仅是一种折中方案——它是一种更优越的策略。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →