← 最新论文
🤖 machine learning

The Costs of Pretending That There Are Data-Generating Probability Distributions in the Social World

该论文批判了机器学习研究中假设社会世界存在数据生成概率分布的观点,认为这种假设不仅不成立且有害,并主张应转向直接关注相关人群而非抽象分布的替代框架。

原作者: Benedikt Höltgen, Robert C. Williamson

发布于 2026-04-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Benedikt Höltgen, Robert C. Williamson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文的核心观点非常犀利,甚至有点“反直觉”。简单来说,作者认为:在涉及人类社会的机器学习(AI)中,我们一直假装存在一个“上帝视角的真理概率分布”,但这不仅是个谎言,而且非常有害。

为了让你轻松理解,我们可以把这篇论文拆解成几个生动的比喻:

1. 核心比喻:寻找“完美食谱”vs. 烹饪“家常菜”

传统的 AI 观点(Gen-D 框架):
想象一下,机器学习研究者就像一群在寻找“宇宙终极食谱”的厨师。他们假设世界上所有的数据(比如人的行为、犯罪记录、信用评分)都来自一个看不见的、完美的“真理大锅”。

  • 他们认为:只要我们的数据样本足够多,我们就能尝出这锅汤原本的“味道”(概率分布)。
  • 目标:我们的模型越接近这个“真理大锅”的味道,我们就越成功。
  • 潜台词:只要数据够多,算法就能自动发现“客观真理”,就像发现万有引力一样。

作者的观点(本文主张):
作者说:别做梦了,根本没有那个“真理大锅”!

  • 在赌场里(比如掷骰子),确实有一个固定的概率(比如骰子有 1/6 的概率是 6),因为骰子不会思考,也不会改变。
  • 但在人类社会里,每个人都是独特的,情况是流动的。你无法像抓一把骰子那样,抓一把“人”然后说“这些人代表了全人类的真理”。
  • 真相是: 所谓的“概率”不是被发现的,而是被制造出来的。就像厨师决定今天做什么菜(选择什么数据、怎么定义问题),而不是去挖掘地里埋藏的“菜”。

2. 为什么假装存在“真理分布”很危险?

作者列举了三个主要的“代价”:

A. 掩盖了“谁在掌勺”(掩盖了人为选择)

  • 比喻: 如果你告诉食客:“这道菜的味道是‘客观真理’,是大自然决定的”,食客就会觉得你不需要为味道负责。
  • 现实: 在 AI 中,如果我们说“模型预测某人犯罪概率高是因为‘数据真理’",我们就掩盖了背后的选择:是谁定义了“犯罪”?用了哪些数据?忽略了哪些背景?
  • 后果: 这种“客观性”的假象,让算法看起来像是一个自动的、中立的法官,从而逃避了人类决策者应该承担的责任。

B. 把“多样性”误认为是“错误”(模型多重性)

  • 比喻: 想象你要预测明天的天气。如果有 10 个气象学家,用了不同的方法,都预测对了 90% 的天气,但具体到“下午 3 点会不会下雨”时,他们的答案各不相同。
  • 传统观点: 他们会想:“肯定有一个‘真理天气’,这 10 个模型里只有一个是准的,其他 9 个都是错的,我们要努力找到那个唯一的真理。”
  • 作者观点: 在社会问题上,根本没有唯一的真理天气。这 10 个模型可能都是合理的,只是侧重点不同。如果我们执着于寻找“真理分布”,就会把这种合理的多样性视为“噪音”或“错误”,从而试图强行统一,反而可能忽略了某些群体的利益。

C. 把“人”当成了“样本”(参考类问题)

  • 比喻: 假设你要预测“张三”明年会不会得病。
    • 如果你把“张三”归类为"30 岁男性”,他的生病概率是 5%。
    • 如果你把“张三”归类为"30 岁吸烟男性”,概率变成 10%。
    • 如果你把“张三”归类为"30 岁吸烟、住在污染区、有家族史的男性”,概率变成 20%。
  • 问题: 到底哪个概率是“真理”?没有标准答案。这取决于我们选择把张三看作谁。
  • 危害: 传统的 AI 框架假设有一个固定的“真理概率”等着我们去算。但实际上,我们如何定义一个人(选择哪些特征),直接决定了预测结果。假装有一个客观真理,让我们忽略了“我们是如何把人分类的”这个关键问题。

3. 作者的建议:扔掉“上帝视角”,脚踏实地

作者建议我们换一种思维方式:

  • 不要寻找“真理分布”: 承认没有上帝视角的真理概率。
  • 关注“具体的人群”: 不要说“从分布中采样”,而要说“我们关注的是这一群具体的人”。
  • 明确我们的目标: 我们做 AI 不是为了“逼近真理”,而是为了解决具体问题(比如:如何公平地分配工作培训?如何降低信贷风险?)。
  • 承担责任: 既然没有“客观真理”来背锅,那么做模型的人就必须公开承认:“我选择了这样的数据,定义了这样的特征,是为了达到这样的目标。”

总结

这就好比:
以前我们以为 AI 是在挖掘埋在地下的“人类行为水晶球”(真理分布),挖得越深越准。
现在作者告诉我们:水晶球根本不存在。 AI 其实是在搭建一个模型,这个模型是我们根据当下的需求、价值观和选择建造的。

如果不承认这一点,我们就会误以为算法是“客观中立”的,从而盲目信任它,甚至用它来为歧视或不公辩护。 只有承认它是“人造的”,我们才能真正去审视和修正它,让它更好地服务于社会。

一句话总结: 别把 AI 当成发现真理的显微镜,要把它当成我们手中用来解决问题的工具,并且要时刻记得,是谁在握着这个工具,以及他为什么要这么握。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →