← 最新论文
💬 NLP

Correct codes for the wrong reasons? validating LLMs as measurement instruments for theoretical constructs

本文提出了“粒度校准”(grain calibration)方法,该方法通过将理论构念分解为从句层级的组件,并应用显式的、基于理论的规则,来验证大语言模型作为测量仪器的有效性,从而确保模型测量的是预期的构念,而非仅仅与人类标注相关联。

原作者: Manuel Pita

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Manuel Pita

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇使用简单语言和日常类比对该论文进行的解释。

核心问题:由于错误的原因而得到了正确的答案

想象一下你正在参加一场考试。你答对了每一道题,老师给了你 A。但后来你意识到,你其实并不理解数学,你只是记住了某种模式。例如,你注意到每当题目中出现“苹果”这个词时,答案总是“红色”。你并不知晓为什么苹果是红色的,你只是知道了这个规律。

这篇论文认为,大语言模型(LLMs)——即我们用来分析文本的 AI 工具——经常就在做这种事。当 AI 在如何对一段文本进行编码(例如将一条推文标记为“愤怒”或“支持”)方面与人类专家达成一致时,我们会假设 AI 理解了这个概念。但论文指出:仅仅达成一致是不够的。 AI 可能是通过识别捷径(即“表面特征”)而非真正理解该概念背后的深层理论来获得正确标签的。

“洞穴中的机器人”故事

为了解释这一点,作者讲述了一个关于机器人 B9 和一个进入洞穴的男孩的故事。他们发现了一处墙上的铭文:

“三人行于深径。石门在水语之处闭合。最后的呼吸仍带着余温。”

  • 机器人 (B9): 它扫描这些词汇。它看到了“死亡”、“水”、“石头”和“呼吸”。它立即得出结论:“这是一个警告!危险!” 它是在对这些可怕的词汇(表面特征)做出反应。
  • 男孩: 他了解古代仪式的规则。他意识到,虽然这些词汇涉及死亡,但其意图却不同。这段铭文并不是让你回头,而是让你跟随死者前往其源头。这是一个“奉献”(神圣的行为),而不是一个警告。

机器人失败了,因为它只看了词汇,而没有看到词汇之间的关系。它无法区分这是一个警告还是一个祝福,因为它不理解仪式背后的理论。

三个“盲点”(不透明性)

论文指出,目前的 AI 编码工具存在三个隐藏其决策方式的“盲点”:

  1. 盲目的定义: AI 被赋予了一个名称(如“关怀”),但并没有被告知判定什么是“关怀”的具体规则。它只是根据它认为“关怀”通常看起来像什么来进行猜测。
  2. 隐形的证据: AI 给出了一个答案,但它没有展示出是哪部分文本让它做出了决定。这就像一名法官在没有展示证据的情况下就宣布判决。
  3. 秘密配方: AI 使用一种我们看不见的秘密公式,将不同的线索组合成最终答案。我们不知道它是忽略了一个关键线索,还是过度强调了一个微小的线索。

解决方案:“粒度校准” (Grain Calibration)

作者提出了一种名为**“粒度校准”**的新方法。可以把它想象成将一个复杂的食谱分解成细小的、可测试的步骤,这样你就能看清蛋糕是如何烘焙出来的。

与其问 AI,“这段文本是否属于‘关怀’?”,该方法强制要求 AI 根据理论回答一系列特定的、二元的(是非题)问题(即子句):

  1. 检测: “文本是否提到了受苦的生命?”(是/否)
  2. 辨析: “这种痛苦是被视为一个道德问题,还是仅仅是一个悲惨的事实?”(是/否)
  3. 立场: “作者是否对这种痛苦采取了道德立场?”(是/否)

运作方式:

  • 人类参与: 人类研究人员根据理论设定这些问题。
  • 证据: AI 必须指出文本中回答每个问题为“是”或“否”的准确句子。
  • 规则: 一个清晰、简单的数学规则(如加权得分)会将这些答案组合起来。例如:如果(受苦 = 是)且(道德问题 = 是)且(立场 = 是),那么它就是“关怀”。

它是如何工作的:

  • 人类在环: 人类研究人员根据理论设定这些问题。
  • 证据: AI 必须指出文本中回答“是”或“否”的准确句子。
  • 规则: 一个清晰、简单的数学规则(如加权得分)会将这些答案组合起来。例如:如果(受苦 = 是)且(道德问题 = 是)且(立场 = 是),那么它就是“关怀”。

为什么这会改变一切:

如果 AI 使用这种方法得到了正确答案,我们就知道它为什么能得到正确答案。

  • 如果 AI 对“受苦”回答“是”,但对“道德问题”回答“否”,且最终编码为“非关怀”,那么我们知道 AI 实际上是在遵循理论。
  • 如果 AI 得到了正确的最终编码,但对“道德问题”这一问题的回答是错误的,那么我们就知道 AI 在作弊(使用捷径)。

论文称之为**“粒度校准”**,因为该方法调整了分析的“粒度”(即碎片的尺寸),直到迫使 AI 使用理论规则,而非仅仅使用词汇模式。

总结

论文的结论是,我们不能仅仅因为 AI 与人类达成一致就信任它。我们需要建立一个系统,让 AI 能够展示其工作过程,并分步进行。

  • 之前: “AI 说这是‘关怀’,因为它与人类一致。”(我们不知道 AI 是真的聪明还是仅仅运气好)。
  • 之后(粒度校准): “AI 说这是‘关怀’,因为它发现了一个受苦的人,将其识别为一个道德问题,并采取了立场。”(我们知道 AI 确实在测量我们所关注的概念)。

目标不是让 AI 变得更聪明,而是让 AI 的过程透明化,以便我们可以确定它测量的是正确的东西。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →