Classical baselines outperform released deep-learning ITS classifiers, which collapse on ITS2 where predictions follow the flanking regions
这项研究表明,虽然用于真菌 ITS 序列的深度学习分类器在全长参考序列上实现了高准确度,但它们在常用的 ITS2 子区域上表现出剧烈的失败,因为它们依赖于侧翼区域而非条形码本身,从而导致在现实的环境元条形码场景中,经典的基准方法表现显著优于它们。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在真菌的微观世界中,科学家们依赖一段特定的遗传密码来识别物种,就像图书管理员使用条形码对书籍进行分类一样。这段被称为内部转录间隔区(ITS)的代码位于真菌 DNA 的其他基因之间,其差异性足以作为一种独特的标识符。几十年来,研究人员一直利用这一区域来编目环绕在我们身边的无形真菌生命,从森林中的蘑菇到家中生长的霉菌。然而,现代技术使得仅对这段代码中一个微小且便捷的片段——即被称为 ITS2 的部分——进行测序成为可能,而不必处理完整的遗传记录。这种捷径更快且更便宜,允许科学家同时处理数千个样本,但它提出了一个关键问题:当最先进的计算机程序只看到这个微小的片段时,它们是否仍能识别出该真菌?
最近,一个研究小组着手测试人工智能在该领域的极限。他们检查了两种强大的深度学习分类器,这些复杂的计算机模型经过数百万条真菌序列的训练,能够高精度地预测物种名称。这些模型因其识别真菌的准确率超过 90% 而备受赞誉,但它们是基于完整的、全长的遗传记录进行训练的。研究人员想知道,如果将这些模型输入实际环境调查所产生的短促、部分序列,这些模型是否仍然有效。为了找出答案,他们利用数千条真菌序列创建了一个公平的测试,将人工智能的表现与依赖直接比对而非复杂学习的传统方法进行了对比。
结果显示,人工智能出现了严重的失效。当研究人员向模型输入全长遗传记录时,深度学习分类器的表现尚可,尽管仍略逊于传统方法。然而,一旦输入被限制为仅有的短促 ITS2 片段,人工智能的表现便彻底崩溃。在处理这个短片段时,深度学习模型的准确率降至约 18% 到 28%,与保持在近 90% 的稳健且准确的传统方法相比,这简直是灾难性的失败。这些曾被吹捧为真菌识别未来的人工智能模型,在面对现实世界中最可能遇到的数据时,实际上已经停止了工作。
研究人员随后调查了发生这种情况的原因,怀疑模型并没有真正读取它们应该识别的“条形码”。他们进行了一项巧妙的实验:取出一个真菌的短促 ITS2 片段,并用另一种完全不同类型的真菌的侧翼遗传区域将其包围起来。如果模型确实是在读取 ITS2 条形码,它们应该能识别出原始真菌。然而,模型却压倒性地识别出了捐赠者真菌,即那些被附加了周围遗传物质的真菌。在其中一个案例中,模型正确识别出捐赠者科属的查询比例接近 64%,而识别出实际真菌的比例不足 1%。这证明了模型并非在观察条形码本身,而是在依赖于缺失的周围遗传背景。
这一发现解释了为什么模型会失败得如此惨烈。人工智能通过观察整个遗传记录(包括条形码前后的区域)来学习识别真菌。当面对单独的短片段时,模型实际上处于“盲视”状态,无法找到它们被训练去识别的特征。更糟糕的是,模型并未表达出它们的困惑。它们的置信度评分失去了区分熟悉真菌与新颖真菌的能力,这意味着输出结果无法对预测可能错误提供任何警告。在其中一个模型的案例中,它依然表现得过度自信,尽管其判断大多是错误的,却给了研究人员一种虚假的安全感。研究结论指出,这些深度学习工具所报告的高准确率是一种幻象,是由测试数据与环境调查实际情况不匹配所造成的。若要使这些工具发挥作用,必须对其进行重新训练或重新设计,使其理解接收到的短片段与构建它们时的全长记录有着本质的区别;否则,科学家们应当依赖那些经受住时间考验的、更简单且更可靠的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。