← 最新论文
💬 NLP

The Proxy Presumption: From Semantic Embeddings to Valid Social Measures

本文通过引入构念效度协议(CVP)与反事实中和法,针对计算社会科学中的“代理假设”问题,对语义嵌入进行严格验证,确保其测量的是社会构念而非主题或风格等混淆属性。

原作者: Baishi Li, Ta Yu, Kelvin J. L. Koa, Ke-Wei Huang

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Baishi Li, Ta Yu, Kelvin J. L. Koa, Ke-Wei Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你试图衡量一项新发明的“创造力”。你决定使用一把高科技尺子,测量新发明与旧发明之间的距离。如果距离巨大,你就宣布这项发明“极具创造力”。

本文认为,在人工智能(AI)的世界里,研究人员正在这样做,但他们犯了一个危险的错误。他们假设,因为两件事在 AI 的数学模型中“相距甚远”,它们在现实世界中就一定是“不同”的。作者将这种假设称为**“代理预设”**。

以下是他们论点、解决方案和发现的一个简明分解。

1. 问题所在:“困惑的尺子”

作者指出,AI 模型(特别是那些将文本转化为数字的模型,称为“嵌入”)就像一台厨房搅拌机

  • 目标(C): 这是你真正想要衡量的东西,比如“创造力”、“偏见”或“新颖性”。
  • 噪声(Z): 这是混入其中的其他所有内容,比如文本的主题、作者的写作风格、句子的长度或使用的具体词汇。

当你把文本放入 AI 搅拌机时,它会吐出一个单一的数字(向量)。问题在于,这个数字是目标和噪声混合而成的冰沙

类比:
想象你想测量汤有多“辣”。你使用了一支温度计。但这支温度计对汤有多“热”(温度)也很敏感。

  • 如果汤又热又辣,温度计读数很高。
  • 如果汤很热但味道平淡,温度计会显示高读数。

如果你只看高读数就说:“啊哈!这汤非常辣!”那你就错了。温度计实际上测量的是热度,而不是辣度

在 AI 中,研究人员经常查看两篇文本之间的“距离”,然后说:“这篇文本非常有创造力!”但本文认为,AI 可能只是在测量这篇文本关于不同的主题,或者是以不同的风格写成的,而不是它实际上更具创造力。他们把“热度”(噪声)误认为是“辣度”(真正的概念)。

2. 数学证明:为什么你不能仅仅“猜测”

本文运用复杂的数学证明了一个简单的观点:你无法仅通过观察汤来将辣味与热度分离开来。

除非你拥有过滤热量的特殊工具,否则你永远无法确定温度计上的高温读数是因为辣椒,还是仅仅因为炉灶。同样,如果没有采取特殊步骤,AI 就无法知道一篇文本是“有创造力”的,还是仅仅“关于不同的主题”。数学证明,AI 的“尺子”从根本上就是困惑的。

3. 解决方案:“效度协议”(CVP)

为了解决这个问题,作者提出了一套新规则,称为构念效度协议(Construct Validity Protocol, CVP)。你可以将其视为任何试图用 AI 衡量社会概念的人的质量控制清单

研究人员不再仅仅说:“这是创造力的得分”,而是必须证明他们的尺子确实衡量的是创造力,而不仅仅是噪声。该协议包含三个主要步骤:

  • 步骤 1:定义食谱。 清楚地解释“创造力”意味着什么,以及它意味着什么。
  • 步骤 2:清理食材。 在测量之前,使用工具去除“噪声”。例如,如果你想衡量“政治偏见”,你可以使用 AI 重写文本以去除特定主题(如“税收”),这样你衡量的就只是态度,而不是主题
  • 步骤 3:“效度卡”。 这是一份成绩单,必须附在每项研究上。它包括:
    • 稳定性测试: 如果你稍微改变字体或单词顺序,分数会保持不变吗?(如果不变,说明尺子坏了)。
    • “不同主题”测试: 如果你谈论完全不同的主题,分数会改变吗?如果分数仅仅因为主题改变而变化,那么你的尺子衡量的就是主题,而不是概念。
    • “现实世界”测试: 这个分数实际上能预测现实世界的结果吗?

4. “法医”式调查

作者不仅谈论理论,还像侦探一样行动。他们审查了17 篇最近的著名论文,这些论文声称使用 AI 来衡量“偏见”、“意识形态”和“创造力”等事物。

他们的发现:

  • 大多数论文(17 篇中的 10 篇) 对所衡量的内容给出了良好的定义。
  • 几乎所有论文 都展示了一些例子来证明其看起来是正确的。
  • 但是,几乎没有论文 做了艰苦的工作来证明他们的尺子不仅仅是在衡量“噪声”。
    • 只有1 篇论文证明了其衡量标准与其他类似衡量标准不同。
    • 零篇论文证明了其衡量标准不仅仅是在追踪主题或写作风格。
    • 零篇论文使用了将“辣味”与“热度”分离所需的严格数学方法。

结论: 作者称此为**“名称混淆谬误”(Jangle Fallacy)**。这是指两项不同的研究使用相同的名称(例如“偏见”),但实际上衡量的是完全不同的事物,因为他们没有检查他们的尺子是否干净。一项研究可能衡量的是“粗鲁的词汇”,而另一项衡量的是“政治主题”,但它们都称之为“偏见”。

5. 结论

本文得出结论,我们不能仅仅通过查看单词之间的距离就信任 AI 来衡量“创造力”或“偏见”等复杂的人类概念。

如果我们希望 AI 成为社会科学中有用的工具,我们就需要停止将 AI 的数学视为神奇的答案。我们需要使用效度协议来:

  1. 清除数据中的干扰因素(如主题和风格)。
  2. 证明当概念改变时,分数确实会发生变化。
  3. 证明当干扰因素改变时,分数不会发生变化。

在研究人员开始这样做之前,本文认为,我们只是在测量汤的“热度”,却假装知道它有多“辣”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →