GENEB: Why Genomic Models Are Hard to Compare
为了解决由于基准测试碎片化和协议不兼容导致基因组基础模型难以比较的问题,本文引入了 GENEB,这是一个统一的大规模诊断基准,通过评估 40 个模型在 100 个任务上的表现,揭示了聚合排名的不稳定性,并证明了架构与预训练的一致性往往比模型规模更为重要。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正试图教一台计算机去阅读生命的秘密说明书。这份说明书是用仅由 A、C、G 和 T 四个字母组成的语言编写的。这些字母构成了 DNA 代码,指导着从微小的细菌到巨大的橡树等每一种生物如何构建自身并运作。近年来,科学家们构建了“基础模型”(foundation models),它们就像是读过数十亿页 DNA 说明书的超级聪明学生。它们被期望能如此透彻地理解这门语言的规则,以至于能够预测诸如基因的行为,或特定的序列是否会导致疾病之类的问题。
但问题在于:想象一下,如果一个班级的每个学生都参加了不同的测试,使用了不同的词典,并且由不同的老师评分。有的学生可能擅长拼写但语法极差,而有的学生可能是语法专家却不擅长拼写。如果你只看他们的最终成绩,你无法判断谁才是真正的全才。你无法得知那位“语法专家”是因为水平不行而没通过拼写测试,还是因为测试本身不公平。这正是 DNA AI 领域正在发生的情况。不同的研究团队构建自己的模型,在自己独特的任务集上进行测试,并声称自己的模型是“最好的”。但由于他们并没有参加相同的测试,没有人能够进行公平的比较。这就像试图通过比较一名游泳运动员在泳池中的成绩和一名跑步运动员在跑道上的成绩来决定谁是世界顶尖运动员一样,缺乏统一的标准。
这就是名为 GENEB 的一项新研究介入并试图解决混乱的地方。研究人员 Daria Ledneva、Mikhail Nuridinov 和 Denis Kuznetsov 决定为 DNA 模型建立一场大规模、统一的“奥林匹克运动会”。他们收集了 40 个不同的基因组基础模型——有些规模庞大,有些规模较小,有些是在人类 DNA 上训练的,有些则是在细菌或植物上训练的——并将它们置于完全相同的 100 项挑战之中。这些挑战涵盖了 13 种不同类型的生物学任务,例如寻找 DNA 中的特定开关(启动子)、识别基因如何被开启或关闭(组蛋白修饰)或识别病毒。他们使用了一套严格且公平的评分系统,来观察这些模型在“冻结状态”下的表现,这意味着模型在测试期间无法学习任何新知识;它们必须完全依赖于已经学到的知识。
实验结果令人惊讶,并打破了一些普遍的认知。首先,研究发现并非越大越好。在 AI 领域,有一个流行的观点是:只要把模型做大(给予更多的“脑力”或参数),它就会自动变得更聪明。但 GENEB 表明,这并不是灵丹妙药。他们发现,一个仅有 8600 万个“参数”(衡量大小的指标)的小型模型,实际上可以大幅度超越一个拥有 70 亿个参数的巨型模型。事实上,那个巨型模型在某些任务上的表现甚至比随机猜测还要差,仅仅是因为它是在错误的 DNA 类型(细菌)上进行训练的,而测试的内容却是关于人类 DNA 的。这就像请一位精通意大利菜的厨师去烹饪传统的日本料理;无论这位厨师多么有名望或昂贵,如果他不了解食材,他都会感到吃力。
其次,研究发现模型的训练内容比其规模更重要。一个专门针对人类 DNA 或多种物种混合数据进行训练的模型,在处理人类相关任务时,表现要优于一个仅在细菌数据上训练的庞大模型。研究人员表明,如果模型的“饮食”(训练数据)与它稍后要吃的“饭菜”(测试任务)不匹配,它就会失败。例如,在人类数据上训练的模型在识别植物基因方面表现糟糕,而在细菌数据上训练的模型则无法理解人类基因是如何进行剪接的。论文指出,为了让这些模型真正发挥作用,需要喂给它们正确类型的资料,而不是仅仅把它们做大。
最后,论文认为并不存在单一的“冠军”模型。就像体育比赛一样,一个模型可能擅长跑步,但在游泳方面表现很差。研究发现,在一个任务中表现顶尖的模型,在另一个任务中可能处于垫底位置。这意味着,与其寻找一个“统治一切”的最佳模型,科学家和医生更需要根据具体工作选择合适的工具。如果你需要预测人类基因是如何受调控的,你应该选择在人类表观遗传数据上训练的模型。如果你需要识别植物基因,你需要一个在植物数据上训练的模型。论文总结道,目前通过单一排行榜来对这些模型进行排名的方式具有误导性,我们需要一种更细致、按类别划分的方法,来为特定的生物学问题选择合适的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。