POSSE-kNN: Pathwise Out-of-Bag Selected Subspace Ensembles for Binary Classification
本文介绍了 POSSE-kNN,这是一种路径式 k-最近邻集成方法,它结合了自助采样、随机特征子空间和袋外筛选,以基于局部类别几何结构来动态选择邻居,并证明了在十个二元基准数据集上,与既有分类器相比,其在聚合准确率、Cohen's kappa 指数和 Brier 分数方面均表现出更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一条茂密且雾气弥漫的森林中寻找最佳路径,以到达特定的目的地。在计算机科学的世界里,这有点类似于“机器学习”,即算法尝试根据数据做出聪明的猜测。一种流行的做法叫做“k-最近邻”(kNN)。把 kNN 想象成一个游客,他向看到的五个最近的人询问方向。如果这五个人中的大多数都说“向左转”,那么游客就向左转。这种方法很简单,在开阔的田野中效果很好,但在有着蜿蜒小径的森林里,它可能会感到困惑。如果那些说“向左转”的人排成了一条长长的、弯曲的线,那么一个只看直线距离最近的人的游客可能会错过整个群体而迷失方向。
这篇论文正是针对这一问题:我们如何帮助我们的数字游客在数据森林中导航那些弯曲、复杂的路径,而不至于陷入困境?研究人员正在构建一个更好的“询问邻居”策略的版本。他们不仅仅是在寻找最近的人;他们是在寻找那些像跨越溪流的踏脚石一样,在逻辑链条上相互连接的人。他们还使用了一个被称为“袋外”(Out-of-Bag, OOB)筛选的聪明技巧,这就像是一组侦察兵在正式旅程开始前,用自己的地图进行实战演练,只保留那些没有让他们迷路的地图。
论文的故事:寻找路径的更好方法
研究人员 Zardad Khan 及其团队推出了一种名为 POSSE-kNN 的新方法。你可以将其想象成一支试图解开谜题的超级探险队。与其让一个探险家观察地图,不如创建 500 个不同的“候选”探险家。每一个都略有不同:他们通过稍微不同的视角(随机特征子空间)观察森林,并采取独特的路径来寻找他们的邻居。
以下是他们特殊的“路径式”(Pathwise)方法是如何运作的。想象一下,你就是站在查询点(你需要做出决策的地方)的探险家。
- 第一步: 你环顾四周,找到离你最近的一个人。
- 连锁反应: 你不是寻找距离你最近的下一个人,而是寻找离你刚刚找到的第一个人最近的人。然后,你寻找离那个人最近的人。接着,你寻找离那个人最近的人。
- 路径: 你不断重复这个过程,直到你拥有一条由 个人组成的链条。这创造了一条“路径”,它遵循着人群的局部形状,即使人群是弯曲或扭曲的。这比仅仅寻找离你直线距离最近的五个人要聪明得多,因为那些人可能全都挤在一个奇怪且毫无帮助的簇群中。
但是等等,500 个探险家也太多了,会产生很多噪音。有些探险家可能并不擅长导航。因此,团队使用了 袋外(OOB) 筛选。在最终比赛之前,他们让这 500 名探险家中的每一位使用一组他们 没有 进行训练的数据进行一次练习赛。如果一名探险家在练习中迷路了,他就会被踢出团队。研究人员保留了前 25% 的探险家(即 500 人中的佼佼者 125 人),并让他们对最终答案进行投票。这就像一场真人秀,评委淘汰掉那些未能通过挑战的选手,留下冠军来决定胜负。
他们的发现
团队在 十个不同的数据集(这些数据集就像十种不同类型的森林,从小型医疗记录到大型工程数据不等)上测试了这种新的 POSSE-kNN 方法。他们将该方法与六种其他成熟的方法进行了比较,包括标准 kNN、随机森林(Random Forests)和支持向量机(SVM)。
结果非常令人振奋。在整体排名中,POSSE-kNN 脱颖而出。
- 准确率(Accuracy): 它平均在 0.740 的时间内得到正确答案。这是所有测试方法中的最高分。
- 可靠性(Reliability): 它在 Cohen's kappa (0.412)(衡量该方法与真相一致程度的指标)以及 Brier score (0.175)(衡量其概率预测的信心和正确程度的指标)方面也取得了最佳成绩。
该方法在 十个数据集中的八个 上获得了第一名或并列第一。然而,论文谨慎地指出,它并不是解决所有问题的“万灵药”。在两个特定的数据集(一个叫 ILPD,另一个叫 Chscase Vine)上,其他方法的表现略好。例如,在 Chscase Vine 数据集上,一种名为 SVM 的线性方法表现更好,这表明有时“森林”实际上是一条直线,不需要复杂的路径。
“有多少个邻居?”的问题
研究人员还尝试改变了邻居的数量(),将其设为 3、5 或 7。他们发现,对于某些“森林”(如“Heart”数据集),无论他们选择哪个数字,该方法都表现出色。但对于其他一些(如“ILPD”),改变数字并没有什么帮助,有时采用不同的策略反而更好。这表明,虽然路径式方法很强大,但你仍然需要根据具体要解决的问题来调整你的设置。
底线
论文结论认为,POSSE-kNN 是一个强大且具有竞争力的工具。它表明,通过结合一种“踏脚石”式的寻找邻居方式和一个严格的“练习赛”过滤机制,我们可以构建出更好的分类器。它并未声称已经解决了机器学习领域的每一个问题,但它展示了当数据是弯曲且复杂时,遵循路径往往比仅仅观察直线距离最近的人是更好的主意。作者指出,未来的工作应该研究如何让它更快,以及如何自动微调设置,但就目前而言,它是帮助计算机在现实世界数据的混乱、蜿蜒森林中导航迈出的坚实一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。