A large-scale evaluation of tree shape indices reveals potential pitfalls
本研究通过使用新的 Python 库“treeshapy”对超过 4500 万棵经验树中的 54 种系统发育树形状指数进行大规模评估,揭示了诸如根敏感性、规模依赖性和指数冗余性等关键陷阱,旨在为未来更谨慎且有效的树形状分析提供指导。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
地球上的生命由一段广阔的、分支式的历史相连,这是一棵延伸回数十亿年前的家族树。科学家通常将这段历史表示为一种图表,其中的线条发生分叉,以展示物种是如何从共同祖先中分化出来的。这些被称为系统发育树的图表不仅仅是关于谁与谁有亲缘关系的图片;它们的整体形状讲述了一个关于进化如何发生的故事。有些树形宽阔且茂密,暗示许多物种在同一时间快速进化;而另一些则细长且稀疏,暗示着一种缓慢而稳定的变革进程。几十年来,研究人员一直试图使用被称为“指数”的数学工具来测量这些形状。这些数字旨在捕捉树状结构的本质,从而让科学家能够比较不同的生命群体,并测试关于生物多样性如何增长的理论。然而,直到现在,还没有人测试过这些工具在应用于科学数据库中存在的数百万棵真实世界的树时,是否真的能可靠地发挥作用。
一支研究团队最近决定对这些测量工具进行终极测试。他们从两个主要的公共收藏库中收集了超过 45,000,000 棵真实的进化树,其数据规模是前所未有的。为了处理如此海量的信息,他们开发了一种全新的开源软件工具,专门用于计算 54 种不同的形状指数。他们的目标简单而关键:观察当这些数字应用于实际生物数据的混乱且复杂的情况时,是否依然能够站得住脚,而非仅仅适用于理论模型。他们的发现表明,许多科学家得出的结论是基于那些比此前认为的要脆弱得多的测量结果。
研究显示,树的形状通常不是一个固定的属性,而是高度依赖于起点(即“根”)的放置位置。在许多进化树中,根的确切位置是不确定或存在争议的。研究人员发现,对于测试的 54 个指数中的 14 个,即使根的位置发生轻微移动,也会导致形状值发生剧烈变化。只有 5 个指数在根的位置改变时仍保持稳定,而其余的指数则表现出中度的敏感性。这意味着,如果研究人员不确定一棵树的根部位置,那么他们计算出的形状可能只是这种不确定性的产物,而非进化历史的真实反映。这些数值不仅是略有偏差,它们甚至可能因为树的方向不同而产生根本性的误导。
另一个重大发现涉及树的大小本身。研究人员观察到,除了 5 个指数之外,几乎所有的指数都与树中的物种数量有着内在联系。即使科学家尝试使用标准技术对数据进行归一化处理以消除大小的影响,这种相关性依然存在。这造成了比较过程中的一个显著问题:一棵拥有百种物种的树和一棵拥有千种物种的树无法使用这些工具进行公平的比较,因为数值的不同仅仅是因为其中一棵树规模更大,而不是因为它们的形状在本质上有差异。这就像试图用一把尺子去比较一颗小卵石和一块大巨石的密度一样;大小的差异掩盖了形状的差异。
研究人员还发现,这 54 个指数中的许多个并不是相互独立的。相反,它们的大型群体会步调一致地联动,通过上升或下降来描述树的同一个方面。这种冗余意味着,使用长串的指数列表并不一定会提供更完整的图像;它往往只是以不同的方式重复同样的信息。研究建议,为了获得对树形状的真正理解,科学家必须仔细挑选一小组多样化且互不相关的指数。这种方法可以捕捉树结构的不同侧面,而不会在冗余数据上浪费精力。
最终,这项大规模评估为未来的进化生物学提供了必要的指导。它并非否定树形状分析的价值,而是要求一种更加谨慎和严谨的方法。通过识别哪些工具是稳定的,哪些工具容易出错,这项研究提供了一条清晰的前行路径。科学家现在可以选择适合自己工作的指数,确保他们对生命历史的结论是建立在坚实的基础之上,而非建立在随视角微调而变化的测量结果之上。研究人员已向公众开放了他们的新软件,邀请科学界采用这些更审慎的标准,并以更高的精度来解读生命历史的形状。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。