Meta-classification of one-class classification models using ranking correlation and nearest neighbor
本文提出了一种元分类框架,该框架将单类分类模型视为待分类的正态性排名,并利用最近邻和排名相关性度量进行分类,从而有效地实现了对模型、数据集和排名的统一分类。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个庞大的不同类型“安保人员”图书馆。每个保安都接受过识别特定类型入侵者的训练,但他们观察世界的方式各不相同。有些保安非常严格,有些则非常宽松,还有些人会通过观察不同的特征来判断一个人是“正常”还是“可疑”。
这篇论文介绍了一个超级组织者(super-organizer),它能够观察这些保安并瞬间说出:“啊,你是受过‘办公室数据’训练的‘严格型保安’,而你是受过‘工厂数据’训练的‘宽松型保安’。”
以下是该论文如何使用简单的类比来拆解这一过程的:
1. 问题所在:“教机器理解机器”
通常,我们使用机器学习(ML)来解决诸如识别照片中的猫或预测天气之类的问题。但这篇论文提出了一个奇怪的问题:如果我们利用机器学习来研究机器学习模型本身呢?
作者决定专注于一种被称为**单类分类(One-Class Classification, OCC)**的特定模型类型。
- 类比: 想象一个俱乐部的保镖,他只知道什么是“VIP”。如果有人走进来,看起来不像 VIP,保镖就会说:“你不是 VIP。”保镖不需要知道“非 VIP”长什么样;他只需要知道他的 VIP 长什么样。
- 论文将每一个机器学习模型都视为这样一个保镖。
2. 解决方案:“品味测试”(排序)
如果你看不见保镖内部的规则手册,你该如何区分两个保镖?你给他们一份随机的人员名单(一个“排序集”),并要求他们对每个人进行评分,看其有多像“VIP”。
- 过程:
- 你拿出一份包含 100 个随机人员的名单。
- 你要求保镖 A 将他们从“最像 VIP”到“最不像 VIP”进行排序。
- 你要求保镖 B 也做同样的操作。
- 你对比他们的名单。
- 发现: 如果保镖 A 和保镖 B 是在相同的类型数据(例如,都接受过办公室人员数据)上训练的,他们的名单看起来会非常相似。如果一个是办公室人员,另一个是工厂工人,那么他们的名单看起来会非常不同。
论文将这种过程称为创建**“正态性排序”(Normality Ranking)**。它将一个复杂的、不可见的计算机大脑变成了一个简单的、可读的排序列表。
3. “媒人”(最近邻算法)
一旦论文得到了这些排序列表,它就会使用一种被称为**“最近邻”(Nearest Neighbor)**的简单技巧。
- 类比: 想象你有一个新的、身份不明的保镖。你给他们同样的名单进行排序。然后,你查看你的已知保镖库,并询问:“谁的名单与这个新人的名单最像?”
- 如果新人的名单看起来和“办公室数据”保镖的名单一模一样,系统就会得出结论:“这个新人很可能是用办公室数据训练出来的。”
4. 他们的实际发现(实验)
作者使用真实数据(特别是著名的 KDD Cup 数据集,这就像是一个巨大的计算机网络流量日志)测试了这个想法。以下是他们的发现:
- 识别训练数据: 他们能以近乎完美的准确率(100%)辨别一个模型是基于“正常”流量还是“异常”(被黑客攻击)流量训练的。这就像超级组织者只需通过观察排序列表,就能瞬间分辨出某个保安是训练来识别扒手还是小偷。
- 识别算法: 他们可以辨别使用了哪种“类型”的算法(例如,是“支持向量机”还是“孤立森林”?)。对于单一算法,这种方法效果很好;但在混合了不同算法(比如由不同算法组成的团队)时,情况变得有些复杂。
- 识别设置(超参数): 他们尝试观察是否可以猜出训练模型时使用的具体设置(例如,“保安应该有多严格?”)。
- 结果: 对于简单的、是非题式的设置(如选择特定的过滤器),效果很好。
- 结果: 对于基于数字的设置(如“将灵敏度设置为 7.5”),该方法表现挣扎。系统无法区分 7.5 和 7.6 的灵敏度差异,就像很难分辨两种非常接近的蓝色色调一样。
5. 他们展示的现实世界案例
论文并未仅仅局限于计算机数据;他们展示了另外两个例子来证明该想法的有效性:
- 呼吸模式: 他们使用这种方法分析呼吸信号。他们可以通过观察“保安”如何对呼吸数据进行排序,来检测一个人何时停止呼吸或改变了身体姿势。
- 睡眠记录: 他们分析了来自 1,000 多人的睡眠数据。他们将每个人的睡眠历史视为一个“数据集”,并使用该方法来寻找“离群值”——即那些相对于群体而言睡眠模式很奇怪的人。
6. 缺陷(局限性)
论文诚实地说明了该方法在何处碰壁:
- 速度: 如果你有成千上万个模型,比较这些列表会耗费很长时间。这就像要对比全校每个学生的笔迹一样,速度会很快变慢。
- 黑盒问题: 要做到这一点,你需要看到模型给出的“分数”(即排序)。如果你只有一个只显示“是/否”而不显示置信分数的模型,这种方法就无法奏效。
- “排序集”至关重要: 你需要一个好的测试名单来进行排序。如果你使用一个糟糕的名单,比较就会失败。
总结
简而言之,这篇论文提出了一种通过观察模型如何“看待”世界来对其进行分类的方法。与其观察模型内部的代码,不如观察它产生的排序列表。这是一个“元分类”(meta-classification)系统,它可以通过比较模型对一份测试项目的排序方式,来告诉你该模型学习了什么数据、使用了哪种算法,甚至是用什么样的设置进行了微调。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。