← 最新论文
🤖 machine learning

Evaluating LLMs on Large-Scale Graph Property Estimation via Random Walks

本文介绍了 EstGraph,这是一个大规模基准数据集,包含四项利用随机游走采样来评估大语言模型在上下文长度约束下推断大规模图属性能力的估计任务。

原作者: Sunil Kumar Maurya, Xin Liu

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Sunil Kumar Maurya, Xin Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解一座拥有数百万栋建筑和道路的巨大、 sprawling 城市的布局。你是一位侦探专家(即人工智能),但你有一条非常严格的规则:你只能携带一个小小的记事本。你无法写下整张城市地图,因为它太大,根本装不下。

这就是本文要解决的核心问题:当人工智能无法一次性看到整个网络(如社交媒体平台或互联网)时,它如何理解这个巨大的网络?

以下是研究人员所做工作的简要拆解,使用了日常类比。

问题:“大得装不下”的困境

此前,研究人员在微小的、玩具大小的图(例如只有 20 栋房子的社区)上测试人工智能。人工智能在那里表现优异。但现实世界的网络就像整个国家。如果你试图向人工智能提供一个国家中每一个连接的列表,它的“内存空间”(上下文长度)就会耗尽,并开始猜测或幻觉出那些不存在的东西。

本文认为,我们需要停止在玩具社区上测试人工智能,转而开始在真实的、巨大的城市上测试它,在这些城市中,我们只能一次窥视几条街道。

解决方案:“随机游走”策略

既然人工智能无法看到整座城市,研究人员就给了它一个新工具:随机游走

想象一下,派一名蒙着眼的游客进入城市。游客从一栋随机建筑出发,选择一条随机街道,走到下一栋建筑,再选另一条随机街道,如此继续。他们没有地图,只是漫无目的地游荡。

研究人员并没有要求人工智能看到整座城市。相反,他们让人工智能在图上进行许多短途的随机游走。然后,他们给人工智能一份这些游走的“成绩单”。这份成绩单包括:

  • 游客访问了多少栋独特的建筑。
  • 游客撞到同一栋建筑的频率(碰撞)。
  • 与游客访问的建筑相连的道路(边)有多少。
  • 游客看到的建筑的“受欢迎程度”(度)。

人工智能的任务是查看这些零散的报告,并推测出整体图景

四大挑战(任务)

研究人员设置了四个具体的游戏来测试人工智能的侦探技能:

  1. 猜测城市规模:

    • 任务: “根据我们的游客撞到同一栋建筑的次数,这座城市总共有多少栋建筑?”
    • 类比: 这就像“生日悖论”。如果你在一个小群体中遇到两个生日相同的人,那么这个群体一定很小。如果你需要遇到很多人才能找到一个共同的生日,那么这个群体就很大。人工智能利用这种逻辑来估算节点的总数(建筑)。
  2. 计算社区(邻里)数量:

    • 任务: “这座城市中存在多少个不同的社区或团簇?”
    • 类比: 在现实城市中,人们倾向于与邻居交往。如果游客在特定区域反复遇到同一群人,人工智能可以推测:“啊,这一定是一个关系紧密的社区。”人工智能必须计算这些不同群体的数量。
  3. 识别城市的“氛围”(结构):

    • 任务: “这座城市是随机的混乱、完美的网格,还是中心辐射系统?”
    • 类比:
      • 网格: 就像棋盘,每个街区看起来都一样。
      • 随机: 就像一个毫无模式的杂乱建筑工地。
      • 无标度(BA): 就像一座拥有几个巨大的市中心枢纽(超级热门节点)和成千上万条小侧街的城市。
        人工智能必须根据它访问的建筑的“受欢迎程度”,判断它是哪种类型的城市。
  4. 寻找 VIP(有影响力的节点):

    • 任务: “这个网络中谁是最重要的?”
    • 类比: 有些人之所以出名,是因为他们与其他名人相连(PageRank)。人工智能必须仅通过观察随机游走者最常访问谁,来猜测谁是“枢纽”。

他们发现了什么?

研究人员在从 100 个节点到230 万个节点不等的图上测试了几款顶级人工智能模型(如 o3、Gemini 和 Sonnet)。

  • 好消息: 即使没有看到整张地图,人工智能模型在猜测城市规模和识别网络的“氛围”(结构)方面也出奇地出色。有些模型的准确度几乎与人类使用的传统数学公式相当。
  • 坏消息: 人工智能在寻找确切的"VIP"或计算确切数量的社区方面稍显吃力,特别是在非常复杂、混乱的图中。
  • 关键洞察: 人工智能并不需要整张地图。它只需要来自随机游走的正确统计数据。通过总结游走数据(例如,“我们看到了 500 个独特节点,其中 50 个被访问了两次”),他们可以将这些信息塞进人工智能的小记事本中。

结论

本文介绍了一个名为EstGraph的新基准。它表明,如果你不再试图强迫人工智能背诵整本百科全书,而是给它一些精心挑选的、穿过数据的“随机游走”,人工智能就能对巨大、现实世界的网络的规模、形状和结构做出出奇聪明的估计。

这就像教导一名侦探去侦破整个国家的罪行,不是通过向他们展示每一张照片,而是让他们采访几名随机证人,并让他们推断出城市的大小和帮派的位置。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →