← 最新论文
🤖 machine learning

Agentic Graph Token Reasoning

本文介绍了“智能体图标记推理”(Agentic Graph Token Reasoning),这是一种新颖的框架,它将图标记化从静态、单次的执行过程转变为一种动态、逐步的推理能力,使大语言模型能够根据需求主动选择并编码图视图,从而在不同领域显著超越现有基准模型,并实现向未知任务的零样本迁移。

原作者: Zhuoyi Peng, Yi Yang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhuoyi Peng, Yi Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解开一个谜团,但你拥有的不是单一的线索,而是一个巨大且纠缠不清的网络。在数据科学的世界里,这个网络被称为图(graph)。把图想象成一个巨大的社交网络,其中每一个人都是一个“节点(node)”,而每段友谊都是连接他们的“线(line)”。但这里有一个转折:在许多现实世界的图中,这些人(或节点)不仅仅是点;他们承载着丰富的故事,比如科学家的研究论文、产品的描述,或是蛋白质的功能。

长期以来,计算机很难阅读这些网络,因为它们使用的语言与附着在节点上的文本并不相通。于是,大语言模型(LLMs)登场了——它们是能够撰写文章并解决谜题的超级智能 AI 聊天机器人。为了让这些 AI 机器人理解图,研究人员发明了图标记(graph tokens)。把图标记想象成一张“神奇的摘要卡”。与其将整个混乱的网络喂给 AI,不如用一种特殊的工具将图的一个小部分(比如一个人及其朋友)压缩成一个微小、稠密的编码块,以便 AI 能瞬间读取。这就像是将一整座图书馆浓缩成一个完美的书签。

但问题在于:使用旧方法使用这些神奇卡片,就像一位侦探只挑选了一个线索,将其锁进盒子里,然后试图在再也不打开盒子的情况下解决整个谜团。如果第一个线索不够充分,侦探就会陷入僵局。AI 无法询问:“等等,我需要看看邻居的邻居!”因为整个系统已经固定死了。这篇论文提出了一个简单但具有革命性的问题:如果 AI 可以像真正的侦探一样,一步步地选择它要观察哪些线索,只在需要时才抓取所需的信息,会怎样?


会自主选择线索的侦探

这篇论文介绍了一种被称为**代理图标记推理(Agentic Graph Token Reasoning)**的新思维方式。来自香港科技大学的作者朱卓一(Zhuoyi Peng)和杨毅(Yi Yang)提出,我们不应该强迫 AI 在一个静态的快照中观察图,而应该让 AI 成为一个主动搜寻证据的“智能体(agent)”。

在旧方法(论文称之为“单次触发/single-shot”)中,系统会在 AI 看到问题之前就决定要对图的哪一部分进行总结。这就像是一个图书管理员基于猜测递给你一本书,而你必须回答关于这本书的问题,却不被允许打开封面或要求换另一本书。如果猜错了,AI 就会失败。

新方法 AGT 完全改变了游戏规则。其工作原理如下:

  1. 提问: 你针对一个特定的节点提出问题(例如:“这种蛋白质是否有危险?”)。
  2. 选择: AI 停下来思考:“我目前的信息还不够。我需要查看我的直接邻居。”它发出一个指令来获取那个特定的视图。
  3. 神奇卡片: 图编码器立即将那个特定的视图转化为一个新的“图标记”(一张神奇的摘要卡),并将其滑入 AI 的记忆中。
  4. 循环: AI 阅读这张新卡片,再次思考,并可能决定:“好吧,现在我需要看看这个人所属的整个社区。”它再去获取另一张卡片。
  5. 回答: 这个循环不断重复,直到 AI 觉得自己拥有了足够的证据来给出自信的回答。

作者意识到,解决图问题的“证据”很少在开始时是显而易见的。有时答案在于节点自身的文本;有时在于它连接的人;有时则在于整个集群。通过让 AI 按需选择视图,系统能够适应问题的难度。简单的问题只需快速浏览;困难的问题则需要深度挖掘。

三阶段训练集训营

教导 AI way 这样做并不容易。作者发现,如果你只是让 AI 与图对话,它往往会忽略图标记,而仅仅根据文本进行猜测,因为文本更容易理解。为了解决这个问题,他们构建了一个三阶段训练流水线:

  • 第一阶段:学习阅读。 首先,他们教会了 AI 这些“神奇卡片”(图标记)究竟代表什么。他们使用了自监督任务,让 AI 仅通过观察标记就能重建节点的文本,或预测两个节点是否相连。这确保了 AI 真正理解了图数据,而不仅仅是理解文字。
  • 第二阶段:鲁棒的侦探。 接下来,他们教会了 AI 如何追踪线索。他们创建了一些场景,其中图数据被轻微破坏(例如移除了一些连接),以迫使 AI 依赖于标记的“内容”而非被微小的变化所迷惑。这使得 AI 的推理变得“鲁棒(稳健)”。
  • 第三阶段:真相测试。 最后,他们使用了一种“偏好优化”技术。他们向 AI 展示两条路径:一条是图证据与文本证据一致的路径,另一条是文本被篡改导致与图不一致的路径。AI 会因为选择了图与文本一致的那条路径而获得奖励,这教会了它要信任图结构而非误导性的文本。

结果:更聪明、更快、且具备零样本迁移能力

该论文在七种不同类型的图上测试了这种新方法,涵盖了从引用网络(论文引用其他论文)到蛋白质相互作用以及在线购物习惯等各种类型。

结果令人印象深刻。新的 AGT 模型大幅超越了现有方法。例如,在学术论文数据集(ogbn-arxiv)上,其 30 亿参数版本的得分达到了 73.0%,比排名第二的同规模模型高出 9 个百分点以上。在产品网络中,它达到了 76.8%

但真正的魔力发生在**零样本迁移(zero-shot transfer)**中。研究人员在一种类型的图(学术论文)上训练模型,然后在它从未见过的完全不同的图(如社交网络或蛋白质链)上进行测试,且无需任何额外训练。AGT 模型不仅生存了下来,而且表现出色。在蛋白质数据集(STRING-db)上,它在零样本设置下实现了 37.4% 的准确率,而其他方法难以突破 20%。

作者还发现了它为何如此成功。他们将这种“图标记”方法与 AI 必须将图作为纯文本阅读(就像读一份很长的名单)的版本进行了对比。图标记版本表现得好得多,尤其是在处理未见过的新数据时。这表明,“图标记”格式以纯文本无法实现的方式保留了图的结构形状。文本版本丢失了连接的“形状”,而标记版本则将其完整保留,从而让 AI 能够对结构本身进行推理。

这为什么重要

这项工作表明,我们在处理复杂数据时,使用 AI 的方式正在发生转变。我们不再将图视为必须一次性总结完毕的静态图像,而是将其视为 AI 可以逐步探索的交互式环境。论文指出,“媒介”本身与推理过程同样重要。通过将推理保持在图的语言(标记)中,而不是将其全部翻译成文字,AI 能够始终立足于数据的真实结构。

作者总结道,这种“代理式(agentic)”方法释放了大型语言模型在图分析方面的全部潜力,让我们从一个只能被动阅读预选摘要的读者,转变为一个知道该去追逐哪些线索的主动探索者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →