Unbiased mixed variables distance
本文通过定义用于量化此类偏差的相关概念,并提出一种用于构建无偏距离的通用公式,使各变量的贡献独立于测量类型或单位,从而解决了现有混合变量距离度量中由不同变量类型和尺度引起的偏差问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图测量两个人的差异程度。你有一份特征列表:身高(数字)、最喜欢的颜色(类别)、年龄(数字)和职业头衔(类别)。
在数据科学领域,这被称为一个**“混合变量”(mixed variable)**问题。你正试图将苹果(数字)和橘子(类别)混合成一份关于“差异”的单一果汁沙拉。
Van de Velden及其同事的论文指出,制作这种沙拉的标准食谱是有偏见的(biased)。它们往往会让橘子的味道比苹果强烈得多,或者反之亦然,这仅仅是因为这些成分是如何被测量的,而不是因为其中一个特征实际上更重要。
以下是他们论点和解决方案的简单分解:
1. 问题所在:“音量旋钮”坏了
当我们计算两个人的“距离”有多远时,我们通常会把每个特征的差异累加起来。
- 问题: 如果你用米来测量身高,差异可能是 0.5。如果你用毫米来测量,差异可能是 500。如果你有一个拥有 50 个选项的职业头衔,那么头衔之间的“距离”可能比只有 3 个选项的颜色要大得多。
- 偏差: 论文表明,标准方法(例如著名的 Gower 距离)会无意中调高类别变量(如职业头衔或颜色)的音量,并调低数值变量(如身高或薪水)的音量。这就像是仅仅因为麦克风设置的不同,就在试图比较一声耳语和一声呐喊。结果并不是真实的差异度量;它只是一个关于数据格式化方式的度量。
2. 公平混合的两条规则
为了解决这个问题,作者提出了两条用于“公平”距离计算器的规则:
规则 #1:可加性(部分的总和)
想象你正在用积木搭建一座塔。塔的总高度应该仅仅是单个积木高度的总和。论文坚持认为,两个人之间的总“距离”应该仅仅是每个特定特征差异的总和。不要有任何复杂的平方根或改变积木权重作用的隐藏数学运算。规则 #2:通约性(“苹果对苹果”规则)
这是最重要的部分。“通约”(Commensurable)意味着“在同一尺度上可测量”。- 类比: 想象你在支付账单。你有一堆分币和一堆美元纸钞。如果你只是在不将其转换为美元的情况下计算硬币和纸钞的数量,那么分币看起来会比美元重要得多。
- 解决方法: 你需要将一切都转换为一个标准单位(如“平均差异”)。论文要求,平均而言,每一个变量(无论是数字还是类别)都应该为总距离贡献相同数量的权重。如果一个职业头衔有 50 个选项,我们不能仅仅计算“不同 = 1”。我们需要调整数学逻辑,使得该职业头衔的“权重”与身高差异的权重相匹配。
3. 解决方案:“公平权重”
作者提供了一个修复此问题的通用公式。把它想象成一个智能秤。
- 它是如何工作的: 在累加差异之前,这个秤会观察每一个变量。它会问:“平均而言,这个变量通常会发生多大的变化?”
- 调整: 如果一个变量通常变化很大(例如有 50 个选项的职业头衔),秤会给它一个极小的权重。如果一个变量通常变化很小(例如只有 3 个选项的颜色),秤会给它一个较大的权重。
- 结果: 当你最终把它们全部加起来时,每个变量都获得了平等的发言权。距离现在是“无偏的”。无论数据是数字还是单词,数学都会确保它们对最终得分的贡献是平等的。
4. 测试理论
作者不仅提出了理论;他们还进行了测试。
- 模拟实验: 他们创建了带有隐藏“真实”模式(如秘密形状)的虚假数据。然后,他们尝试使用不同的距离方法来寻找这个形状。
- 旧的、有偏的方法由于过度关注类别变量(职业头衔)而导致找错了形状。
- 新的“无偏”方法由于公平对待所有变量,因此能更准确地找到秘密形状。
- 现实世界测试: 他们使用了 2021 年 FIFA 足球运动员的数据。他们观察了身高、体重和位置等因素。他们展示了标准方法如何让“位置”这一变量主导了结果,而他们的新方法则平衡了位置相对于身高和体重等身体素质的影响。
核心结论
论文得出结论,当我们混合数字和类别时,我们往往会无意中让数据的类型决定结果,而不是由数据本身决定。
他们的解决方案是一种新的距离计算方法,其作用就像是一个水平化的场地。它确保了无论你是在比较一个人的薪水还是他最喜欢的运动,都不会因为测量方式的不同而获得“免费通行证”来主导比较。这为研究人员在进行数据分组或可视化时提供了一个更加诚实的起点。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。