Neural Additive and Basis Models with Feature Selection and Interactions
本文提出将一个可训练的特征选择层集成到神经加性与基函数模型(Neural Additive and Basis Models)中,以克服高维设置下的计算瓶颈,从而在保持可解释性和竞争性能的同时,实现对特征交互的高效建模。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图预测一个复杂事件的结果,比如一名患者是否会康复,或者一笔贷款是否会被批准。为了做出决策,你拥有海量的线索(特征)可以利用。
问题所在:“黑盒”与“过重之盒”
在人工智能领域,有两种主要的方法来解决这些谜题:
- 黑盒(深度神经网络): 它们极其聪明且准确,但运作起来就像变魔术。你输入数据,结果输出答案,但没人知道机器是如何做出这个决定的。在医疗或法律等领域,这是很危险的,因为你需要了解其背后的推理过程。
- 透明盒(广义加性模型): 它们就像是一个专家团队。每个专家只观察一个线索(例如“年龄”或“收入”)并给出一个分数。最终答案就是所有这些分数的总和。这很容易理解,因为你可以清楚地看到每个线索是如何贡献结果的。然而,传统的透明盒往往不够聪明,无法处理线索之间复杂的相互关系。
现有的解决方案:NAM 与 NBM
研究人员创建了“神经加性模型”(NAM)和“神经基模型”(NBM)。可以将它们看作是对“透明盒”的升级。它们不再使用简单的专家,而是使用微型、聪明的 AI 大脑(神经网络)来观察每一个线索。这使得它们既聪明又透明。你仍然可以观察每个线索是如何影响结果的。
瓶颈:“线索过多”的危机
这就是旧方法失效的地方。
- 交互问题: 有时,线索结合在一起的效果更好。例如,“年龄”和“收入”如果放在一起观察,可能比单独观察更能预测结果。为了实现这一点,旧模型尝试为每一对可能的线索都创建一个微型 AI 大脑。
- 数学噩梦: 如果你有 1,000 个线索,就会产生近 50 万个可能的配对。同时训练 50 万个微型 AI 大脑,就像是试图雇佣 50 万名员工在一家小办公室里工作。这会导致计算机崩溃、耗时极长,并且变得无法管理。
- 高维墙: 当数据集变得巨大(拥有数千个线索)时,旧模型根本无法运行。它们会耗尽内存和时间。
新的解决方案:“智能选择器”
该论文的作者提出了一个简单但强大的解决方法:特征选择(Feature Selection)。
想象你是一名带着巨大证据板的侦探。与其试图同时分析每一件证据(这几乎是不可能的),不如雇佣一名智能选择器。
- 运作方式: 模型从所有可能的线索“菜单”开始。在训练过程中,它学习为每个线索分配一个“权重”。
- 过滤器: 它使用一种特殊的数学过滤器(称为 entmax),其作用就像一个筛子。它保留最重要的线索,并有效地“关闭”那些无用的线索。
- 结果: 与其为每一对线索都构建 50 万个 AI 大脑,该模型只为最重要、排名前 50 或 500 的线索及其配对构建大脑。
优势
- 速度: 因为模型忽略了垃圾数据,所以运行速度更快。论文显示,虽然旧模型在处理 1,000 个以上线索的数据集时会崩溃,但新模型(称为 NAM-FS 和 NBM-FS)却能流畅运行。
- 交互: 它允许模型观察成对工作的线索(如“年龄 + 收入”),而不会被复杂的数学运算压垮。
- 透明度: 即便它在进行线索选择,它依然保持着透明性。你仍然可以清楚地看到哪些线索被选中了,以及它们是如何影响最终决策的。
结果
作者在具有数千个线索的六个不同现实世界数据集上进行了测试。
- 性能: 他们的模型与现有的最佳“透明”模型一样准确,甚至更优。
- 效率: 它们的运行速度显著提高,并且能够处理那些旧模型根本无法触及的数据规模。
- 对比: 他们还证明了,让模型在训练期间“学习”如何挑选线索,比在开始前手动挑选线索效果更好。
总结
这篇论文介绍了一种让智能、透明的 AI 模型能够处理海量数据的方法。它通过教 AI 忽略噪声,并专注于最重要的线索及其关系,解决了模型要么因过于笨拙而无法使用,要么因过于沉重而无法运行的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。