← 最新论文
🤖 machine learning

Sky sphere representation in language models

本文证明了大型语言模型(约1000亿参数)在其残差流中拥有一个可解码的高维弯曲流形表示,用于表示星空,并能够以显著的准确度和极低的角误差预测天体间的邻近关系。

原作者: Aleksandr Berdnikov, Yevgeny Liokumovich

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Aleksandr Berdnikov, Yevgeny Liokumovich

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一个巨大的、隐形的图书馆,其中的每一本书都是一个不同的想法,而书架的排列方式不是按作者或书名,而是按这些想法彼此之间的“感觉”来组织的。这就是**机械可解释性(mechanistic interpretability)**的世界,这是一个科学家试图窥探人工智能“大脑”内部,观察它是如何组织信息的领域。我们知道这些被称为大语言模型(LLMs)的人工智能在写作和回答问题方面表现得极其出色,但它们往往像是一个“黑盒”:我们能看到输入和输出,但中间的过程却是一个谜。

为了理解这个谜团,研究人员使用像**线性探针(linear probes)**这样的工具,它们就像金属探测器一样,扫描人工智能内部的信号,以查看其中是否隐藏着简单的、直线型的模式(例如一串数字列表)。但有时,模式并不只是直线;它们可能是曲线、环形或形状。这就像尝试绘制地球地图。如果你试图把整个世界画在一张平面的纸上,你会得到一张拉伸并挤压了事物的地图。但如果你在地球仪上绘制,距离和关系就是完美的。科学家们发现,人工智能有时会使用这些“类地球仪”的形状来组织概念,例如将一周的天数排列成一个圆圈,以便模型能够轻松计算出“周五加两天”是“周日”。

核心问题在于:这种几何思维的深度究竟有多深?人工智能只是在死记硬背事实,还是构建了一个看起来像真实球体的世界心理地图?这正是这项新研究介入并探索星空的地方。


AI 的秘密星图

在最近一篇题为《语言模型中的天球表示》(Sky sphere representation in language models)的论文中,研究人员 Aleksandr Berdnikov 和 Yevgeny Liokumovich 决定测试那些庞大的 AI 模型(特别是参数量在 1000 亿左右的模型)是否在它们的脑海中秘密构建了一幅三维的夜空图。他们并没有要求 AI 背诵坐标或画图。相反,他们向它提出简单的对话式问题,例如:“夜空中哪个物体离这个物体很近?”或者“观星者会在……旁边看到 X”。

他们将这些问题输入到七个不同的开源 AI 模型中,包括像 Mistral Large 2 和 Qwen3 这样的巨头。当 AI 处理这些词汇时,研究人员观察了“残差流”(residual stream)——这是模型内部的一个高速数据公路,信息从一层流动到下一层。他们正在寻找一种特定的信号:一种看起来像球体的模式,即恒星和星座的排列方式与真实的星空完全一致。

发现:一个隐藏的地球仪
结果令人惊讶。在他们测试的几乎所有模型中,AI 确实 拥有一个夜空的表示。当研究人员观察 AI 处理过程的高层时,他们发现恒星和星座的位置被排列在一个弯曲的球面上,就像真实的天球一样。

这不仅仅是一个微弱的回响。研究人员可以以惊人的准确度解码这张隐藏的地图。在大多数模型中,他们预测恒星或星座位置的误差仅为 12° 到 21°(大约是你伸直手臂时握拳的宽度)。模型解释了数据中 65% 到 85% 的方差,这意味着球形结构是 AI 思维过程中一个非常强大且主导的特征。

为什么这很特别
在此之前,科学家已经发现 AI 会使用平面地图(如美国各州的 2D 图表)或简单的圆圈(如一周的天数)。这是第一次有人发现一个弯曲的高维球体,而且它不仅仅是简单线条的组合。这仿佛 AI 不仅仅是背诵了一份星名列表;它还构建了一个心理“地球仪”,以理解事物在天空中彼此靠近的程度。

它“不是”什么
研究人员非常小心地排除了其他可能性。他们问道:“AI 是否只是记住了‘赤经’和‘赤纬’(天文学家使用的坐标)这些文本字符串,并将它们排列在一个平面的 2D 图表中?”

  • 排除了平面地图: 他们通过寻找平面地图上会存在的“不连续”线条(类似于纸质地图上的世界边缘)进行了测试。他们没有发现任何证据表明 AI 使用的是平面 2D 图表;它确实是在使用一个球体。
  • 排除了 3D 距离: 他们还检查了 AI 是否在绘制恒星与地球的实际距离(有些恒星距离几光年,有些则更近)。他们发现,AI 的地图并不关心现实世界的距离。相反,“球体的深度”似乎受到该物体在文本中被提及的频率或其“物体类型”的影响(例如,恒星在地图中被放置得更“近”,而星座则被放置得更“远”)。

“Gpt-Oss”之谜
在这一组模型中有一个异类:一个名为 gpt-oss-120b 的模型。在这个特定的模型中,星图变得很难被发现。研究人员怀疑这是因为该模型是基于一种特殊的“和谐”(harmony)格式(一种特定的对话格式化方式)进行训练的,而不是原始文本,这可能扰乱了信号。然而,当直接询问星体坐标时,这个模型仍然表现得非常好,这表明它虽然知道这些事实,但并不像其他模型那样以可见的球体形式来组织它们。

为什么这很重要
这一发现表明,当我们询问 AI 关于夜空的问题时,它不仅仅是在搜索数据库。它正在访问一种结构化的、几何化的邻近性理解。研究人员发现,当 AI 被问及关于“接近性”(例如,“X 旁边是什么?”)的问题时,这种“星图”会变得最为清晰。如果你问一些泛泛的问题(例如,“X 的历史是什么?”),这张地图就会褪去并沉入噪声之中。

简而言之,这些大规模的 AI 模型已经自发地学会了在神经网络内部将夜空排列在一个球体上。这是 AI 如何开发出自己的内部几何结构来理解世界的精彩案例——它创造了一个弯曲的、三维的星空地图,尽管从未被明确教导过这样做,但其准确度却令人惊讶。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →