Validating LLMs in social science: Epistemic threats and emerging norms
本文系统地分析了将大语言模型(LLMs)作为测量工具在社会科学研究中的验证实践,揭示了尽管由大语言模型生成的数据在实证分析中处于核心地位,但目前的验证方法仍存在不一致且局限的问题,并由此促使作者提出旨在实现更稳健验证的新兴规范与策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,社会科学家就像是试图破解人类行为之谜的侦探。多年来,他们不得不雇佣人工团队来阅读成千上万份文件、将它们分类,或者猜测人们会对调查问卷做出怎样的回答。这既缓慢、昂贵又令人疲惫。
大语言模型(LLM)登场了:它是一个超级聪明、数字化的机器人助手,阅读和写作的速度比任何人都快。研究人员现在正请求这些机器人承担繁重的工作,将杂乱无章的文本转化为整齐的数字和图表。这听起来像是一根魔杖,对吧?但 Meera Desai、Dallas Card 和 Abigail Z. Jacobs 的一项新研究表明,虽然这根魔杖看起来很闪亮,但其中的奥秘可能比我们想象的要复杂得多。
重大发现:“黑箱”问题
作者研究了 2023 年至 2025 年间发表在顶级社会科学期刊上的 27 篇论文。他们发现了 50 个特定任务,在这些任务中,研究人员使用这些 AI 机器人来衡量诸如“冒犯性”、“政治意识形态”或“情感倾向”等指标。
转折点在于:在几乎所有这些案例中,机器人的测量结果都是核心事件。它们是用来对社会运作方式做出重大结论的核心证据。然而,当作者揭开幕布,观察研究人员是如何检查机器人是否真的在说实话时,他们发现了一团乱麻。
这就像烤蛋糕。你可以使用一个高级、高科技的烤箱(LLM)来烤蛋糕。但如果你不检查温度,不品尝面糊,也不清楚你具体使用了什么配方,你就无法确定这个蛋糕到底是一个蛋糕,还是一个砖头。研究发现,研究人员经常在使用这些高科技烤箱,却跳过了“品尝测试”。
三大错误
该论文强调了研究人员在处理过程中出错的三个主要方式:
“模糊的配方”(概念化):
想象一下,你告诉机器人:“帮我找一条‘糟糕’的帖子。”但你从未告诉机器人“糟糕”究竟意味着什么。是粗鲁?是悲伤?还是错误?
研究发现,在 13 篇论文(涵盖 29 个任务)中,研究人员完全没有定义他们的概念。他们只是使用了一个单词或一个短语。这就像告诉厨师:“给我做一份‘美味’的餐点”,却没说想要辣的、甜的还是咸的。如果没有明确的定义,机器人测量的可能与研究人员的本意完全不同。“随机的设置”(操作化):
使用 LLM 就像驾驶一辆拥有无数旋钮和拨盘的汽车。你必须选择模型、“温度”(答案的创造性或随机程度),以及如何从机器人冗长、唠叨的回答中提取答案。
作者发现,研究人员调整这些旋钮的方式千差万别,且往往基于直觉或猜测。一些人使用了零样本提示(仅指令,无示例),而另一些人则使用了少样本提示(指令加示例)。有些人要求机器人用数字回答;有些人则要求用句子回答。
可怕之处在于?论文指出,这些设置的微小变化可能会彻底改变结果。这就像稍微转动一下收音机旋钮,突然就听到了不同的频道。然而,许多研究人员并没有解释为什么选择这些特定的设置,导致其他人难以重复实验。“单一维度的检查”(效度验证):
这是最大的问题。当你使用机器人来测量某些事物时,你需要证明它的准确性。衡量标准是将机器人的工作与人类的工作进行对比(即“金标准”)。
研究发现,50 个任务中的 38 个几乎完全依赖于一种类型的检查:聚合效度(convergent validity)。这意味着他们只是在问:“机器人是否与人类一致?”
但论文认为这远远不够。这就像是通过对比一个可能同样坏掉的老温度计来检查一个新的温度计是否工作。作者建议研究人员应该使用一整套工具箱来进行检查:- 表面效度(Face validity): 答案乍看之下是否合理?
- 假设效度(Hypothesis validity): 数据是否有助于回答一个真实且有趣的问题?
- 预测效度(Predictive validity): 数据能否正确预测未来的事件?
- 区分效度(Discriminant validity): 机器人是否只测量了我们要求的特定内容,还是也捕捉到了其他东西?
令人震惊的是,研究中的 8 个任务 甚至完全没有任何验证。他们直接采信了机器人的话。
论文排除了哪些观点
作者非常明确地说明了这项研究不是在说什么。他们并不是说 LLM 是没用的。他们也不是说我们应该停止使用它们。
然而,他们明确反对那种可以“即插即用”这些模型的想法。你不能把 LLM 当作一把标准的尺子或一个每次使用都会给出相同结果的温度计。论文反对认为这些模型是能自动产生有意义测量的“通用仪器”的观点。相反,它们是定制化的工具,需要精心的设计、精确的定义和严格的测试。
他们也排除了目前做法是“足够好”的观点。研究人员跳过定义概念或检查偏差等步骤,这不仅仅是一个小疏忽,更是对整个领域的威胁。如果测量结果是摇摆不定的,那么关于社会的结论也将是摇摆不定的。
我们有多确定?
作者对自己的发现非常有信心,因为他们不仅仅是在猜测;他们做了实实在在的工作。他们从顶级期刊中收集了 2,143 篇论文 的综合列表,并对手工编码了 27 篇论文 中的 50 个特定任务。他们没有进行模拟,而是观察了真实的、已发表的研究。
他们发现,尽管 LLM 正变得对社会科学至关重要,但安全使用它们的“规范”(交通规则)尚未跟上步伐。论文指出,如果没有更好的规则——比如始终定义术语、报告你使用的每一个设置、并使用多种方法检查你的工作——我们就有可能在摇摆不定的基础上建造一座纸牌屋。
总结
论文以一个行动呼吁结束。这不是一个“停止”标志,而是一个“谨慎行事”的标志。社会科学家需要开始像对待人类调查员那样,给予这些 AI 工具同样的尊重和严谨。他们需要写下他们究竟向机器人询问了什么,是如何询问的,以及他们是如何检查答案的。
在此之前,机器人可能是一个强大的助手,但它仍然是一个谜。而在科学领域,谜题很有趣,但它们无法构成坚实的实事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。