← 最新论文
🤖 machine learning

Graph is a Substrate Across Data Modalities

本文提出了以表示为中心的 G-Substrate 框架,该框架通过统一的结构模式和交错的角色训练,将图结构视为跨异构模态和任务的持久性基底,从而通过积累结构规律性,超越了传统的孤立学习方法。

原作者: Ziming Li, Xiaoming Wu, Zehong Wang, Jiazheng Li, Yijun Tian, Jinhe Bi, Yunpu Ma, Yanfang Ye, Chuxu Zhang

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziming Li, Xiaoming Wu, Zehong Wang, Jiazheng Li, Yijun Tian, Jinhe Bi, Yunpu Ma, Yanfang Ye, Chuxu Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和创意类比对论文《图是跨数据模态的基底》的解释。

核心问题:“一次性蓝图”

想象你是一位建筑师。每当你建造一座房子,你都会画一张蓝图。但在当前的人工智能世界中,一旦房子建成,你就把蓝图扔进垃圾桶。然后,当你需要建造一座桥梁时,即使物理规则(重力、承重)对两者都相同,你也要从零开始绘制一张的蓝图。

在人工智能领域,就是这些蓝图。它们是展示事物如何连接的地图(例如分子中的原子、照片中的物体,或故事中的事件)。

目前,人工智能模型将这些图视为特定任务的消耗品

  • 如果一个 AI 学习将照片映射为物体图,它在描述完照片后就会丢弃该图。
  • 如果另一个 AI 学习将故事映射为事件图,它在分析完故事后就会丢弃该图。

尽管这些图的结构往往相似(例如,许多事物连接到一个中心点的“枢纽”),但 AI 每次都必须从头重新学习这些模式。这就像木匠每次需要钉钉子时都要重新发明锤子一样。

新想法:“通用基底”

作者提出了一种新的思维方式:图是一种基底

基底想象成花园里一层肥沃的土壤。

  • 旧方法: 你种下番茄,收获后,为了种玫瑰而翻动土壤。土壤每次都被扰动并重置。
  • 新方法(G-Substrate): 你将土壤视为永久共享的基础。你种下番茄,让根系稳固,然后在同一块土壤中种下玫瑰。土壤(图结构)持续存在,积累养分(知识),并支持不同的植物(任务)同时生长。

在这个新框架中,图不仅仅是一个临时输出;它是一个持久的中间状态,在不同类型的数据(图像、文本、分子)和不同任务(推理、预测、生成)之间保持活跃和有用。

他们如何实现:两个魔法工具

为了让这种“通用土壤”发挥作用,作者构建了一个名为G-Substrate的框架,包含两个主要工具:

1. 通用翻译器(统一结构模式)

不同的语言有不同的语法,但它们都有名词和动词。同样,分子图(原子)和场景图(房间中的物体)在表面上看起来不同。

  • 问题: 在分子上训练的 AI 不懂“场景图”的语言。
  • 解决方案: 作者创建了一个通用翻译器。他们强制所有图,无论来源如何,都必须用完全相同的简单格式书写:(实体 A) —(关系)—> (实体 B)
  • 类比: 想象聚会上每个人都说不同的语言。与其进行分离的对话,大家同意只说一种简单的“通用皮钦语”。现在,懂得如何建桥的人可以轻松与懂得如何烤蛋糕的人交谈,因为他们都使用相同的基本句子结构。

2. 角色扮演游戏(交错训练)

在旧方法中,图要么被“制造”(生成),要么被“阅读”(理解),但很少两者兼得。

  • 问题: 如果你只训练图被制造,它在被阅读时就会表现不佳。这就像训练一个只写不读的作家;他们可能会写出毫无意义的文字,因为他们不知道什么样的故事是可读的。
  • 解决方案: 作者使用交错训练策略。他们取同一个图,并在训练过程中不断切换其角色。
    • 步骤 1: AI 查看照片并构建一个图(角色:生成器)。
    • 步骤 2: AI 拿那个完全相同的图,尝试用它解决一个谜题(角色:求解器)。
    • 步骤 3: AI 查看文本故事并构建一个图。
    • 步骤 4: 它利用该图回答问题
  • 类比: 想象一个学习下棋的学生。与其只与电脑对弈,他们被迫下一盘棋,然后立即用相同的棋盘状态指导朋友,接着基于该棋盘解决一个谜题。因为他们必须以多种方式使用该棋盘,所以他们比只下一盘棋就停止的学生能更快、更深地掌握下棋的真正规则。

结果如何?(实验结果)

研究人员在四个截然不同的领域测试了该方法:

  1. 数学/逻辑: 解决图谜题(如寻找最短路径)。
  2. 化学: 描述分子。
  3. 视觉: 描述图片中的内容(场景图)。
  4. 语言: 梳理故事中的事件。

发现:

  • 性能提升: G-Substrate 方法在几乎所有类别中都击败了旧有的“丢弃蓝图”方法。
  • “甜蜜点”: 当 AI 需要进行复杂推理(如跨越长路径连接点)时,收益最大。
  • 韧性: 即使图略有混乱或不完美(如带有污渍的蓝图),系统仍然运行良好。这表明,通过强制 AI 以多种方式使用图,它学到了核心结构,而不仅仅是死记硬背表面细节。

总结

该论文认为,我们目前将图结构视为一次性工具,浪费了人工智能的潜力。通过将图视为永久共享的基础(基底),并强制 AI使用同一个图进行构建和理解,我们可以创造出更智能、更高效的模型。这些模型能够从图像、文本和科学之间的结构相似性中学习,而不是将它们视为完全不同的世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →