Statistical Analysis of Network Collections Using Persistent Homology and Functional Data Analysis
本文介绍了函数拓扑数据分析(funTDA),这是一个将函数与拓扑数据分析相结合的新型框架,通过克服非欧几里得结构和节点对应关系变化带来的挑战,实现了对网络集合进行统计推断,包括均值/方差计算、主成分分析以及假设检验。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在试图破解谜题的侦探,但你寻找的不是指纹或脚印,而是事物之间那些看不见的联系。在科学世界中,这些联系被称为网络(networks)。把网络想象成社交媒体上巨大的好友网,或是你体内基因相互交流的地图,甚至是故事中单词相互连接的方式。通常,科学家一次只研究其中一个网络。但如果你想比较数百个不同的网络,看看它们是如何变化的呢?也许你想知道,一个快乐的人的“友谊网”是否看起来与一个悲伤的人不同,或者一个患流感的人的“基因网”是否与健康的人不同。
问题在于,这些网络是杂乱无章的。它们不会像木棒一样整齐地摆放在尺子上。一个网络可能有100个点(节点),而另一个可能有1,000个。有些点的连接是强而粗的线,而另一些则是弱而细的线。有些线是单向的,而另一些则是双向的。因为它们如此不同,你不能仅仅使用标准的尺子或基础的计算器来测量它们。这就像是试图仅用卷尺来比较云朵的形状和山的形状;工具并不匹配。这就是统计学家一直试图解决的谜题:当每一个网络都是独一无二的时候,你该如何测量一个杂乱、变化的网络的“形状”?
这篇论文介绍了一个巧妙的新工具包,叫做 funTDA(代表函数拓扑数据分析,Functional Topological Data Analysis),用以解决这个谜题。作者 Catherine Higgins、Hulin Wu 和 Michelle Carey 提出了一种方法,将这些杂乱的网络转化为数学家能够处理的平滑、波动线条。他们通过观察网络内部的“洞”和“环”来实现这一点。想象一下吹起一个气球;如果你在上面戳个洞,形状就会改变。在网络中,“环”是一个连接组成的圆圈,你可以从一个点出发,绕行一周回到原点,而无需折返。这种新方法通过追踪随着我们慢慢调高连接的“音量”,这些环是如何出现和消失的。
这种方法并不试图将一个网络中的每一个点与另一个网络中的每一个点进行匹配(这就像是试图将两片不同海滩上的每一粒沙子进行匹配),而是忽略了点的具体名称,转而关注整体形状。它将网络转化为一个“持久图(persistence diagram)”,这就像是一张显示环何时诞生以及何时消亡的地图。然后,它将那张地图转化为一个“持久景观(persistence landscape)”,这本质上是一系列山丘和山谷。一旦杂乱的网络被转化为这些平滑的山丘,作者就可以使用标准的统计工具——比如寻找平均山丘或观察山丘如何波动——来比较不同的网络组。
作者首先用计算机模拟测试了这个想法。他们创建了数千个具有不同连接程度(有些稀疏,有些稠密)的虚构网络,并询问他们的新方法是否能区分它们。结果非常令人振奋:该方法成功地分离了不同类型的网络,将相似的网络归为一类,并将不同的网络分开。他们还将该方法与试图将网络强行转化为标准形状的旧技术进行了比较。旧方法在面对具有不同点数或有向性(单行道)的网络时显得力不从心,但新的 funTDA 方法轻松应对了这些差异。
最后,作者将他们的方法应用于现实世界的数据。他们观察了简·奥斯汀和查尔斯·狄更斯小说中的词汇网络,以查看故事中单词连接的方式是否具有不同的拓扑“形状”。他们还研究了暴露于 H3N2 流感病毒的人群的基因网络,比较了发病者(有症状)与未发病者(无症状)的情况。在这两个案例中,该方法都发现了具有统计学意义的差异。对于流感研究,它表明即使基因本身是相同的,患病者的基因网络在拓扑结构上也与健康的人不同。这篇论文并不声称已经解决了网络科学中的所有问题,但它表明,这种观察连接“形状”的新方式是理解从文学到生物学等复杂系统的强大且灵活的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。