← 最新论文
💻 bioinformatics

Tokenizing single-cell transcriptomes as a native language for large language models

本文介绍了 CellTok,这是一种将连续的单细胞转录组图谱分词为与预训练大语言模型兼容的离散序列的新颖方法,从而实现了一个统一的框架,用于共同处理细胞数据、生物学背景和文本指令,以执行诸如细胞识别、疾病推断和状态生成等多种任务。

原作者: Xiao, C., Ding, Y., Bian, H., Chen, Y., Wei, L., Zhang, X.

发布于 2026-07-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiao, C., Ding, Y., Bian, H., Chen, Y., Wei, L., Zhang, X.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,生物学的世界就像一座巨大的图书馆。长期以来,科学家们在这个图书馆里拥有两种截然不同的书。一个书架上摆满了人类语言:用文字编写的故事、指令和描述。另一个书架则存放着单细胞转录组,它们就像是单个细胞内部分子活动的复杂、连续且高维的地图。

多年来,这两个书架之间一直互不往来。如果你想使用一个能够阅读人类语言的超智能人工智能(大语言模型,简称 LLM)来理解一个细胞,这个 AI 会陷入困境。对于 AI 来说,细胞的分子地图是一种“外语”。它可以阅读关于某个细胞的文本描述,但它无法实际“阅读”细胞的原始数据,也无法将其与其他想法进行组合或预测接下来的变化,因为数据并不在它的原生格式中。

CellTok 的出现,就像是一个万能翻译官,将细胞这种“外语”转化成了 AI 的“母语”。

神奇的翻译器:将细胞转化为乐高积木

把细胞的基因表达谱想象成一幅巨大、杂乱且连续的画作。这幅画很美,但对于基于文本的 AI 来说,直接处理起来非常困难。CellTok 使用了一种特殊的工具(矢量量化自编码器),将这幅画切割成紧凑、整齐的离散标记(tokens)序列

想象一下,你把那幅画变成了短小的乐高积木链。每块积木都是一个特定的、离散的代码,代表了细胞状态的一部分。随后,CellTok 将这些乐高积木直接加入到 AI 的词汇表中。突然间,AI 不仅能看到单词,还能看到“细胞积木”,它们与“心脏”、“疾病”或“生长”等词汇并列在一起。

论文表明,通过这种方式处理细胞,AI 终于可以像处理文本一样,去阅读、组合和生成细胞数据。

AI 现在能做什么(有趣的部分)

一旦 AI 学会了说“细胞积木语”,它就能解决一些非常酷的谜题:

  • 识别细胞:就像你可以通过阅读一个句子知道它是在描述一只猫,AI 可以观察一串细胞积木并说:“啊,这是一个 T 细胞!”它的表现如此出色,甚至击败了许多专门的生物学模型,甚至超越了那些仅仅在进行猜测的大型通用 AI 模型。
  • 阅读细胞群体:生物学不仅仅关乎单个细胞,更关乎群体。CellTok 可以同时观察一整组细胞积木。它可以分辨出一群健康的细胞和一群生病的细胞之间的区别,即使这些细胞是混合在一起的。
  • 预测对话:细胞之间会进行交流。论文显示,CellTok 可以观察两组细胞,并预测它们正在使用什么样的“信号通路”(就像化学形式的文本信息)来进行沟通。这就像 AI 可以监听两个社区之间的对话,并猜出它们正在讨论什么。
  • 时间旅行:AI 还可以弄清楚事件发生的顺序。如果你向它展示不同发育阶段的细胞(例如从第 4 天到第 61 天生长的脑类器官),它可以按正确的时刻表进行排列。它甚至暗示自己可以根据时间的流动,推测出它从未见过的某一天细胞的样子。
  • 创造新细胞:这是最疯狂的部分。如果你给 AI 一个文本描述,比如“为我制作一个第 31 天的细胞”,它可以生成细胞积木序列,经过解码后,这些序列会转化回真实的基因表达谱。这就像 AI 在写故事的同时,又画出了与之匹配的图画。

CellTok 不是什么(“并非如此”清单)

了解这篇论文没有声称什么非常重要。作者明确指出:

  • 它目前还不是万能的神药。 论文明确表示这只是一个“概念验证”。这是一种新的思考方式,而不是一个解决了所有生物学问题的成品。
  • 它不是通过仅仅记住标签来工作的。 论文通过将真实的疾病名称(如“COVID-19”)替换为枯燥的中性名称(如“状态 A”)进行了测试。当名称变得枯燥时,AI 的表现变差了。这证明 AI 实际上是在利用单词的生物学含义,而不仅仅是记住“COVID-19”总是与“坏细胞”联系在一起。
  • 它在每个细节上并不完美。 论文承认,将连续的画作转化为乐高积木可能会丢失一些微小的、细粒度的细节。他们建议未来的工作需要弄清楚究竟哪些信息在翻译过程中丢失了。

他们的确定程度如何?

作者对自己的结果充满信心,但使用了谨慎的措辞。他们论证展示了 CellTok 在许多任务中的有效性。他们暗示这种方法开启了一扇新的大门。

例如,在谈到 AI 对新时间点的泛化能力时,他们表示结果暗示该模型学习到了发育过程中的“局部连续性”,而不仅仅是记住了特定的天数。在讨论细粒度细节的丢失时,他们指出这可能压缩或丢弃了信息,将其视为一个有待探索的局限性,而非已证实的失败。

大局观

把 CellTok 想象成一座桥梁。在此之前,生物学数据和 AI 语言位于两个相对的岛屿上。CellTok 用“标记”(即乐高积木)搭建了一座桥梁,让 AI 可以走过去探索细胞之岛。它允许科学家用直白的英语向 AI 提问,并获得深深植根于真实生命分子数据的答案。

论文总结道,这不仅仅是一个新工具,更是一种全新的观察方式。它表明单细胞数据终于可以成为 AI 的“母语”,让我们能够在同一个共享空间内对细胞、群体和生物学知识进行建模。这是迈出的第一步,是一个充满希望的实验,也是我们如何利用 AI 来理解生命的一个非常令人兴奋的新篇章。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →