← 最新论文
💻 bioinformatics

Assessing Codon Language Models for Context-Aware Codon Optimization in Nucleic Acid-Based Medicines

本研究将三种专注于密码子的掩码语言模型与传统方法进行了基准测试,结果表明,虽然没有单一模型在所有任务中都占据主导地位,但它们能有效捕捉翻译上下文以生成具有更优表达性能的变体,这表明在多个模型之间进行采样是优化核酸类药物的一种极具前景的策略。

原作者: Toneyan, S., Scholz, K., De Donno, C., Noack, F., Auslaender, S., Cijsouw, T., Payne, J. L.

发布于 2026-08-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Toneyan, S., Scholz, K., De Donno, C., Noack, F., Auslaender, S., Cijsouw, T., Payne, J. L.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你的身体就像一座巨大且繁忙的工厂,其中被称为核糖体的微型机器正在不断地制造蛋白质——这些是维持你生命所必需的工具和结构。为了让这些机器运转起来,工厂会接收一套用特殊代码编写的指令,即 DNA。这段代码由被称为“密码子”的词组成,它们就像句子中的三字母单词。这里的转折在于:就像你可以通过说“big”、“large”或“huge”来表达同样的意思一样,遗传密码也有许多不同的三字母单词,它们都代表同一种氨基酸(蛋白质的构建模块)。这被称为“同义”变异。

多年来,试图利用这些指令制造药物(核酸类药物)的科学家们一直使用一种简单的策略来让工厂运行得更快:他们将稀有的词替换为常见的词,并假设越常见的词,机器读取的速度就越快。这就像是重写一份食谱,只使用在每家当地杂货店都能买到的食材。但最近,一种新型的计算机大脑——“掩码语言模型”(Masked Language Model, MLM)进入了对话。这些模型与那些能够完成你的短信或撰写故事的 AI 属于同类,因为它们理解单词是如何组合成句子的,而不仅仅是看单词出现的频率。核心问题在于:这些聪明的 AI 是否真的掌握了简单“常见词”策略所忽略的某些知识?如果它们确实掌握了,这意味着我们可以制造出更好、更有效的药物,让我们的身体能更高效地生产它们。

这篇论文旨在通过测试三个这样的高级 AI 模型——CaLM、EnCodon 和 CodonTransformer——来观察它们是否真的是密码子优化的下一个重大突破。研究人员将这些模型视为一场才艺表演中的参赛者,针对九项不同的挑战对它们进行了测试,包括如何在不改变原意的情况下重写现有的遗传句子(回译),以及它们预测蛋白质行为的准确度。他们还在实验室中进行了真实的实验,使用一种名为 SEAP 的发光报告蛋白,以观察 AI 设计的序列是否比传统方法能让细胞产生更多的蛋白质。

结果喜忧参半,但带有一个非常令人期待的转折。这三个 AI 模型各不相同;它们并不只是选择相同的“常见词”,而是创造出了具有不同风味的独特序列。有趣的是,没有哪一个 AI 模型是每一项测试中无可争议的冠军。在某些情况下,基于词频的简单、传统方法仍然表现稳健。然而,当研究人员深入观察时,他们发现 AI 模型正在做一些特别的事情:它们正在观察一个更广泛的“上下文窗口”,理解一个词如何与其邻居配合,而不仅仅是统计一个词在字典中出现的次数。

真正的关键点来自实验室实验。由这些 AI 模型设计的序列实际上优于传统方法以及商业供应商提供的序列。无论细胞是进行短时间的蛋白质表达(瞬时表达),还是永久保留这些指令(稳定集成),情况都是如此。这表明 AI 模型确实捕捉到了简单频率计数所忽略的更深层次的“翻译上下文”。论文得出结论,虽然没有哪个模型是完美的,但这些 AI 工具是有效且互补的。它建议,最好的策略可能是让几种不同的模型都尝试解决这个问题,从而增加找到适合新药的完美遗传序列的机会。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →