在现代数据科学的广阔版图中,计算机通过筛选海量信息来寻找模式,其中出现了两种截然不同的工具来帮助人类理解机器的行为。第一种工具被称为特征选择(feature selection),它扮演着严厉编辑的角色。它的职责是审视原始数据集,并决定哪些信息对于解决问题是真正必要的,从而舍弃其余部分,以保持模型的简洁与高效。它追问的是:“我们需要知道什么?”第二种工具被称为特征归因(feature attribution),其运作方式则大不相同。它并不试图在计算机学习之前简化数据,而是对一个已经训练完成的模型进行审问。它追问的是:“模型究竟利用了什么来做出那个特定的决策?”这种第二种方法在可解释人工智能领域变得至关重要,因为人们要求了解计算机做出选择背后的逻辑,从医疗诊断到贷款审批皆是如此。多年来,这两类方法一直处于各自独立的圈子里,统计学家专注于前者,而人工智能研究人员则专注于后者,两者极少直接比较其结果。
南丹麦大学的一个研究小组决定通过将这两种方法视为同一枚硬币的两面来弥合这一差距。他们收集了来自这两个家族的十二种最重要的算法——六种来自传统的特征选择侧,六种来自现代的特征归属侧——并将它们置于严格的面对面测试之中。他们在二十三个不同的高维数据集上运行了这些方法,这些数据集包含了来自基因组学和图像识别等领域的复杂信息,在这些领域中,数据点的数量往往远超可用样本的数量。研究人员不仅观察了这些方法的表现如何,还检查了方法之间的相似性、当数据发生轻微变化时其选择的稳定性,以及每种方法所需的时间和计算能力。他们在两种不同的场景下测试了这些方法:一种是允许选择广泛的特征范围,另一种是强制方法仅选择极小比例的数据,以模拟只能保留最关键信息的极端情况。
结果揭示了一个完全取决于任务目标的有趣性能分歧。当目标是预测特定结果(例如对图像进行分类或诊断病情)时,特征归属方法始终优于传统的特征选择方法。那些追问“模型使用了什么”的方法,能更好地识别出驱动计算机成功的特征。这表明,对于预测性任务而言,理解一个复杂模型的内部逻辑,比仅仅寻找原始数据中的统计模式更为有效。然而,当研究人员转向无监督任务(即计算机在没有预定义答案的情况下尝试寻找数据的自然分组)时,故事发生了彻底的变化。在这些情况下,传统的特征选择方法表现得更为出色。由于这些方法不受特定预测目标的偏见影响,它们能更好地保留数据的自然结构和形状,以一种模型导向型方法有时会忽略的方式保持信息的完整性。
这项研究还发现了准确性与速度之间的显著权衡。传统的特征选择方法速度极快,即使在数据量变得巨大时也能高效扩展。相比之下,特征归属方法虽然在预测方面更准确,但在计算上却非常昂贵。为了生成全局的重要性视图,这些方法必须为每一个数据点计算每一个单一特征的影响力,这一过程在处理大型数据集时变得极其缓慢。研究人员发现,这两种方法并不像看起来那样迥异;在许多情况下,由快速的传统方法所选出的特征,与由缓慢的归因方法所识别出的特征几乎完全一致。这种趋同现象表明,尽管这两个领域提出的问题不同,但它们往往会得到相同的答案。
最终,该论文认为,未来的最佳路径不是在两者之间做选择,而是将它们按特定顺序结合使用。研究人员提出了一种混合流水线:首先使用快速的传统方法来迅速过滤掉绝大部分无用数据,将问题缩减到可控的规模。然后,可以将更慢、更精确的特征归属方法应用于这个较小的集合,以识别出模型所依赖的最关键的最终特征。这种方法结合了“旧守卫”的效率与可扩展性,以及“新派”的高保真准确性,为处理定义现代人工智能的海量、复杂数据集提供了一个切实可行的解决方案。这项工作证实了,尽管这些方法背后的哲学理念不同——一个追求简洁,另一个追求问责——但当它们被结合在一起时,其实际应用效果最为强大。
技术摘要:特征选择与特征归因是同一回事吗?一项比较综述
问题陈述
特征选择(Feature Selection, FS)与特征归属(Feature Attribution, FA)是两个截然不同的研究领域,尽管它们在功能上往往表现得非常相似,但其运作逻辑基于不同的哲学范式。FS 植根于简约原则(奥卡姆剃刀),旨在识别一个最小的相关特征子集,以便在模型训练前降低维度并防止维度灾难。FA 则兴起于可解释人工智能(XAI)运动,旨在将模型的特定预测归因于其输入特征,以确保问责制和透明度,它通常追问的是“模型实际上使用了什么?”,而非“什么是客观相关的?”
尽管两者具有技术上的相似性——即都会生成特征重要性得分和排名——但在文献中,关于这两个领域之间进行全面理论与实证比较的研究仍存在显著空白。现有的综述通常将它们孤立对待,要么专注于 FS 的进展,要么专注于 XAI 方法,而没有探讨它们的底层机制、评估标准和性能特性究竟是本质不同的,还是仅仅是应用于不同粒度的同一种过程的变体。
研究方法
作者进行了一项比较综述和实证评估,涉及 12 种基础方法:其中 6 种来自特征选择家族(互信息、LASSO、Fisher 分数、递归特征消除、白盒特征选择、ReliefF),6 种来自特征归属家族(SHAP、LIME、置换法、特征消融、Kernel SHAP、Saabas)。由于限制(需要可微模型以及计算成本高昂),集成梯度(Integrated Gradients)和 Sobol 指数被明确排除在实验评估之外。
实验设置:
- 数据集: 来自 scikit-feature 仓库的 23 个高维基准数据集,涵盖基因组学、蛋白质组学和图像识别,其中特征数量往往超过实例数量。
- 评估框架: 本研究采用统一的评估框架,通过对 FA 方法进行聚合(通过平均绝对值平均化)来生成全局重要性得分,从而使其能够使用标准的 FS 指标进行评估。
- 场景: 定义了两个实验场景:
- 通用特征选择: 选择 5% 到 100% 的特征。
- 极端降维: 选择 0.5% 到 10% 的特征,以测试在高风险缩减任务中的有效性。
- 指标:
- 监督学习: 分类准确率(ACC)、ROC 曲线下面积(AUC)。
- 无监督学习: 聚类准确率(CLSACC)、归一化互信息(NMI)。
- 模型无关/几何指标: 平均角度差异(AAD)。
- 稳定性与相似性: 特征选择相似性(前 k 个特征的交集)、稳定性指标以及计算可扩展性。
- 排名分析: 结果通过标准排名统计和考虑量级差异的排名统计(MARS)进行分析,以解释性能差距。
核心贡献
- 统一分类法与综述: 本文提供了对 FS 和 FA 方法的理论背景和运作机制的详细回顾,并将其置于一个连贯的分类体系中(过滤式、包装式、嵌入式 vs. 代理式、扰动式、路径式)。
- 桥接评估框架: 提出了一种通过将局部归因聚合为全局得分来评估 FA 方法的方法,从而实现使用标准 FS 指标进行直接、公平对比。
- 全面的实证比较: 研究展示了广泛的实验结果,涵盖 23 个数据集,并分析了性能轨迹、相似性热图和可扩展性。
- 理论讨论: 探讨了“简约性”(简化)与“可询问性”(问责)之间的哲学张力,并分析了这些哲学是如何体现在运作机制和评估结果中的。
关键结果
- 监督任务(ACC, AUC): 特征归属方法(特别是 Tree SHAP、Saabas 和 Ablation)一致优于传统的特征选择过滤方法(如 Fisher Score 和互信息)。作者将其归功于 FA 方法捕捉到了预测模型(随机森林)所学习的高阶交互和非线性边界,从而有效地针对特定的下游任务进行了优化。
- 无监督任务(CLSACC, NMI): 传统的特征选择方法(尤其是 Fisher Score 和 ReliefF)表现出更强的韧性。由于 FA 方法与特定的分类目标紧密结合,它们可能会丢弃对于聚类所需的全局流形结构至关重要的特征。相比之下,作为模型无关方法的 FS 过滤器能更好地保留数据的自然分组。
- 几何保持(AAD): 研究观察到一个悖论:在监督任务中表现最好的方法,往往在保留原始数据几何属性(通过 AAD 衡量)方面表现最差。这表明,为了获得高预测准确率,往往需要“打破”原始数据几何结构以寻找可分流形。
- 相似性与收敛性: 在 LASSO(FS)和置换法(FA)之间观察到高度的相似性,这表明对于许多高维问题,构建稀疏模型所需的特征与从复杂模型中移除特征时最具影响力的特征是相同的。
- 可扩展性: 统计学 FS 过滤器(如 Fisher、MI)呈线性扩展且计算效率高。相比之下,FA 方法需要为每个实例计算局部归因以得出全局得分,因此在高维设置下存在显著的计算瓶颈。
- LIME 表现: LIME 在全局评估中的表现始终较差,这归因于其极端的局部视角以及对难以泛化全局重要性的代理模型的依赖。
重要性与主张
本文声称弥合了特征选择与特征归属这两个领域之间的鸿沟,证明了虽然它们拥有共同的运算核心(扰动并观察逻辑),但根据任务上下文的不同,它们服务于不同的目的。
- 任务依赖的优越性: 作者得出结论,不存在单一的“最佳”方法。特征归属在特定任务优化(监督预测)方面更具优势,因为它能审视模型的内部逻辑。特征选择在数据探索和无监督任务方面更具优势,因为它能在不引入模型偏差的情况下保留数据的内在结构。
- 混合流水线建议: 基于可扩展性和性能的发现,本文建议针对高维数据挖掘采用混合流水线:首先使用高效的 FS 过滤器进行降维(去除噪声),然后对缩减后的集合应用 FA 方法,以基于模型问责制来选择最终的子集。
- 认识论的一致性: 研究强调,尽管出发点的哲学不同,这两个领域往往会收敛到相同的关键特征上,从而验证了两者之间见解的可迁移性。
作者对其主张保持了谦逊,指出其评估高度依赖于随机森林作为后端模型,且 FA 方法的其他聚合策略可能会产生不同的结果。他们将这项工作定位为将统计简约性与算法问责制整合进未来高维机器学习流水线的基础性一步。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。