An association measure for mixed-type variables
本文提出了一种新的标签不变性关联度量 及其高效样本估计量 ,用于在不依赖参数假设或任意整数编码的情况下,稳健地量化并检验实值变量与分类变量之间的关系。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图破解谜题的侦探:案件中的两个线索究竟是指向同一个罪犯,还是仅仅是随机的噪音?在数据科学的世界里,这就是寻找“关联性”的永恒追求。有时,线索都是数值(比如身高和体重),我们有许多工具可以衡量它们是如何共同起舞的。其他时候,两个线索都是类别(比如眼睛颜色和最喜欢的冰淇淋口味),我们也有一套不同的工具来处理。但如果其中一个线索是数值(比如一个人的年龄),而另一个是没有自然顺序的类别(比如他们喜欢的冰淇淋口味:香草、巧克力或草莓)时,会发生什么呢?这就是“混合类型”问题。这是一个现实生活中的常见谜题,从研究收入是否影响政治党派选择,到观察基因活性水平如何预测癌症亚型。麻烦在于,旧的解决这类谜题的工具经常会失效。它们可能会强迫你将“香草”、“巧克力”和“草莓”转化为数字 1、2 和 3。但是等等——为什么香草是“1”而草莓是“3”?这种顺序是伪造的!如果你把它们调换成 3、1、2,旧的工具可能会给你一个完全不同的答案,仿佛谜题本身仅仅因为你重新排列了标签就发生了变化。这使得结果变得摇摆不定且不可靠。
这时,一群来自首尔大学的新侦探出现了,由金容载(Yongjae Kim)、文海恩(Haeun Moon)和郑成圭(Sungkyu Jung)领导。他们构建了一个全新的测量尺,名为 (读作“xi-prime”),专门为这些混合的线索而设计。他们的核心思想是停止假装类别具有等级。与其问“香草是否比巧克力大?”,不如用一种更简单、更聪明的方式提问:“如果我按年龄将所有人排成一列,邻居们是否倾向于喜欢相同的冰淇淋口味?”如果答案是肯定的,那么就存在某种联系。如果口味像纸屑一样随机散布,那么就没有联系。
作者展示了这种新度量标准具有惊人的稳定性。在他们的模拟实验中,他们尝试了每一种可能的重命名冰淇淋口味的方式(六种口味共有 720 种排序方式!)。旧的方法,比如查特吉(Chatterjee)著名的 ,会根据名称的变化而剧烈跳动,有时因为标签的打乱而判定为“无联系”,有时又判定为“强联系”。而新的 呢?它始终保持纹丝不动,每次都给出相同的答案。他们从数学上证明了这种度量方法适用于任何数值与类别的组合,并且他们甚至找到了极其快速的计算方法(时间复杂度为 ,这意味着它可以处理庞大的数据集而不显疲态)。他们在来自癌症基因组图谱(TCGA)的真实癌症数据上进行了测试,发现它能发现其他方法错过的微妙关系,尤其是当这种联系不是简单的直线关系,而是某种更复杂的形式(例如数据变异程度的变化)时。虽然他们并未声称这能解决宇宙中的所有问题,但他们的模拟和现实世界测试表明,与那些依赖标签的旧式技巧相比,这是一种更可靠、更公平且更快速的识别数值与类别之间联系的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。