Geometric Representations of Knowledge Inside Biological Large Language Models: an Empirical Analysis
这项实证研究表明,尽管生物学大语言模型(SCFMs)确实编码了一种真实的、低维的且部分线性化的生物学知识几何结构,但这种结构规模有限、通常呈非线性纠缠状态,并且在很大程度上与经典的基于表达的方法(如 PCA)所能恢复的内容相重叠,未能达到自然语言模型中所观察到的那种清晰且规则的几何形态。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你拥有一座巨大的、神奇的图书馆,其中的每一本书都是来自人体的一个活细胞。多年来,科学家们一直试图阅读这些书,以了解我们的身体是如何运作的,但文本非常混乱且难以解读。最近,一种新型的“超级阅读器”——生物大语言模型(Biological Large Language Model,简称 Biological LLM)被发明了。这些计算机程序通过训练数百万个细胞“书籍”来识别模式,就像你的手机键盘学习预测你下一个要输入的词一样。
科学家们一直在问一个大问题:这些超级阅读器是否以一种整齐、笔直的方式组织知识?在常规语言模型(那些写文章或与你聊天的模型)中,研究人员发现像“国王”和“王后”这样的概念位于一条直线上,而相反的概念也只是简单的步进关系。这就像一张完美组织的地图,每个概念都有自己清晰的街道。科学家们曾希望这些生物超级阅读器也能拥有类似的整齐、直线型的地图,用于处理诸如“健康 vs. 生病”或“生长 vs. 休息”之类的情况。如果它们确实如此,就意味着我们可以轻松地微调计算机的思维,从而理解疾病或发育过程。但正如我们将要看到的,这些生物模型的内部地图更像是蜿蜒起伏、充满丘陵的森林小径,而不是整齐的城市街道。
机器内部的地图:是森林,而非高速公路
在这项研究中,一位名叫 Olivia Denvis 的研究人员决定深入探索四种这样的生物超级阅读器(分别命名为 scBERT、Geneformer、scGPT 和 UCE),以观察它们是否真的拥有那种整齐的、直线型的组织结构。她将它们视为探险家,将它们送入一个包含 420,000 个细胞的大型数据集,这些细胞带有关于它们是什么、生活在哪里以及正在做什么的详细笔记。随后,她将这些模型的内部“地图”与科学家们使用了数十年的传统、可靠工具(如被称为 PCA 的简单数学技巧)进行了对比。
以下是她的发现:这些模型确实拥有一张地图,但它并不是大家所期望的那种清晰、笔直的高速公路。
1. 地图紧凑,但拥挤
首先,研究人员检查了模型使用多少空间来存储信息。想象一个巨大的仓库(模型的完整大小),本可以容纳 1,280 个货架。研究发现,模型实际仅使用约 12 到 26 个货架来存储知识。这是一个极低维度的空间,这很好,因为这意味着模型非常高效。然而,这个空间是“各向异性”的,用专业术语来说,它的形状像一个长而窄的圆锥体,而不是一个圆球。较小的模型被挤压在更窄的圆锥体内,这表明它们的思维方式可能有些“局促”。
2. 简单的事物是直的,困难的事物是弯曲的
当研究人员要求模型识别一些简单事物时,例如“这是一个来自男性的还是女性的细胞?”或“它属于免疫系统吗?”,模型表现得非常出色。它们可以画出一条直线来区分这些类别,就像语言模型那样。事实上,对于这些简单的类别,模型的表现几乎是完美的。
但转折点在于:当她询问那些更有趣的内容时——比如“这个细胞是生病的吗?”、“这是哪种特定的亚型?”或“它处于发育的哪个阶段?”——直线法则失效了。知识依然存在,但它被缠绕在了曲线之中。
- 证据: 当研究人员尝试使用一条简单的直线来预测细胞的发育时间时,其准确率仅为 61%。但当她让计算机遵循数据的自然曲线路径(就像沿着蜿蜒的小径行走,而不是横穿田野)时,准确率跃升到了 80%。
- 结论: 模型了解复杂的事物,但它们以一种弯曲的、非线性的方式存储这些知识,简单的直线无法轻易触及。这与语言模型不同,在语言模型中,即使是复杂的概念通常也位于直线上。
3. “方向盘”有点摇晃
在语言模型中,如果你想改变一个词的含义(比如把“快乐”变成“悲伤”),你只需要加上一个特定的向量(一个方向),它就能完美运作。研究人员尝试对生物模型也进行这种操作。她尝试通过添加一个方向向量来“操控”细胞的身份。
- 结果: 它起作用了,但成功率仅为 54% 到 66%。虽然比抛硬币猜正反要好,但远不及语言模型中那种完美的控制力。有时,试图改变一件事会意外地改变另一件事。不同想法的方向虽然大致平行,但并不完全一致,且关联性较弱。
4. 模型之间达成共识,而非达成“真相”
研究人员还检查了这四个模型是否以相同的方式思考。它们彼此之间具有中度的相似性(约 55% 到 74% 相似),这很不错。但当她将它们与生物学知识的“金标准”(即描述现实中细胞类型如何相互关联的详细地图)进行比较时,模型的相似度仅为 36% 到 45%。
- 惊喜之处: 这些模型看起来其实更像传统的数学工具(PCA),而不是真实的生物学真相。它们收敛于一个共享的、简化的数据视图,这个视图更接近基础数学,而非复杂的生物学现实。
5. “深层”知识位于中间层
最后,她观察了这些知识存在于模型的哪些层(即其“大脑”)中。
- 简单身份: 了解“这是哪种细胞”的信息会随着模型层数的加深而增强。
- 疾病状态: 了解细胞是否生病的信息在中间层达到顶峰,并随着模型变深而逐渐消退。
- 批次效应(Batch Effects): 模型在早期层级能够很好地忽略技术噪声(例如哪台机器拍摄的照片),但它们并没有完全忘掉这些噪声。
总结
那么,结论是什么?生物大语言模型是真实存在的,它们确实持有几何形式的知识地图。但它不是我们在语言模型中看到的那种干净、笔直、完美组织的地图。相反,它是一个“部分线性化、低维度”的地图。
这些模型擅长处理简单的事情(比如分辨男性细胞和女性细胞),但对于那些复杂且具有临床重要性的事情(如疾病或发育),知识是弯曲且纠缠在一起的。模型所拥有的绝大部分“直线型”知识,实际上是我们通过简单的传统数学工具就能获得的东西。模型学到的“新东西”确实存在,但它们隐藏在曲线之中,使得读取和利用变得更加困难。
研究得出结论:虽然这些模型很有用,但它们并不是人们所期望的那种“直线型”突破。未来的真正挑战不仅仅是构建更大的模型,而是构建更好的工具,去读取那些隐藏着最重要的生物学秘密的、弯曲且蜿蜒的小径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。