Six Fallacies in Substituting Large Language Models for Human Participants
本文认为,由于存在六种关键的解释性谬误,大型语言模型不应取代行为学和心理学研究中的人类参与者,而是主张将其作为实用的模拟工具,以补充而非替代人类证据,从而进行负责任的使用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图理解人类如何思考、感受和做决定的心理学家。传统上,你需要采访真实的人类,这既缓慢、昂贵又令人疲惫。最近,出现了一个新想法:“为什么不直接问一个超级聪明的 AI(大语言模型,或称 LLM)呢?它说话像人一样,所以也许它就是一个人类参与者。”
你分享的论文——《用大语言模型替代人类参与者的六大谬误》——指出这个想法是一个陷阱。作者 Zhicheng Lin 认为,虽然 AI 令人印象深刻,但将它视为人类的替代品,就像试图通过观察一幅高分辨率的油画来研究海洋一样。画看起来很真实,但它没有水,没有波浪,也没有深度。
以下是该论文识别出的六个主要错误(谬误),并用简单的类比进行了说明:
1. “魔术表演”错误(词元预测 vs. 智能)
谬误: 认为仅仅因为 AI 能完美预测句子中的下一个词,它就真的“理解”它所说的话。
类比: 想象一只背诵了莎士比亚全剧每一行台词的鹦鹉。如果你问它:“接下来会发生什么?”它能完美地背诵下一句。但鹦士并不理解什么是“爱”、“背叛”或“死亡”的感觉。它没有身体,没有眼睛,也没有心。它只知道“爱”这个词通常紧跟在“真挚”之后。
论文观点: AI 是一个统计学上的鹦鹉。它基于模式来预测文本,而不是因为它拥有思想或情感。它从未感受过阳光洒在皮肤上的感觉,也从未品尝过苹果的味道。因此,它的“智能”与人类的智能是不同的。
2. “平庸之辈”错误(平均人类谬误)
谬误: 假设 AI 因为接受了人类文本的训练,所以代表了“平均水平”的人类。
类比: 想象你想知道普通人对食物的看法。你问了一个读过所有食谱和美食博客的机器人。机器人会给你一个非常礼貌、平衡且“正确”的答案。但现实中的人是混乱的!有人讨厌蔬菜,有人喜欢奇怪的搭配,还有人会对自己的饮食撒谎。这个机器人就像一个“经过完美策划”的人,从不犯错,也没有任何古怪的癖好。
论文观点: AI 的训练数据具有特定类型(主要是西方、受过教育、互联网密集型),并且经过了“有用”和“安全”的微调。这使得它过于完美和中立。它无法捕捉到真实人类群体中那些混乱、有偏见且多样化的现实。
3. “同结果,异引擎”错误(对齐即解释)
谬误: 认为因为 AI 给出了与人类相同的答案,所以它一定是以相同的方式进行思考的。
类比: 想象一个数字时钟和一个日晷都显示是中午 12:00。它们是“对齐”的。但数字时钟使用电池和电路,而日晷利用太阳和阴影。如果你通过研究日晷来理解电池是如何工作的,你会失败。仅仅因为 AI 和人类给出了相同的答案,并不意味着它们使用了相同的思维过程。
论文观点: AI 可能会因为错误的原因(比如猜测模式)得到正确的答案。我们不能仅仅因为输出结果看起来一致,就假设 AI 的思考方式与人类一致。
4. “对着幽灵说话”错误(拟人化)
谬误: 因为 AI 听起来如此像人,就将其归于情感、信仰或“灵魂”。
类比: 当你对着一个非常逼真的木偶说话时,你可能会觉得它拥有人格。但如果询问木偶:“你相信幽灵吗?”而它回答“相信”,这并不是因为它拥有信仰。这是因为它被设定在那种语境下必须说“相信”。AI 就是那个木偶;它没有内在生活,没有恐惧,也没有欲望。
论文观点: 当研究人员说 AI “相信”或“感受”时,他们犯了错误。AI 只是一个生成文本的工具。它没有意识。
5. “一刀切”错误(身份本质化)
谬误: 认为你只需要输入“扮演一名黑人女性”或“扮演一名中国男性”,就能获得完美的、真实的群体代表。
类比: 想象你要求一位厨师“做一份通用的意大利餐”。他可能会做一份披萨。但“意大利”并不是单一的概念;它包含了一百万种不同的地区、家庭和个人口味。如果你要求 AI 成为一名“黑人女性”,它可能只会给出一种刻板印象(漫画式的形象),而不是一个恰好是黑人女性的、复杂且独特的真实个体。
论文观点: 真实的人类身份是流动且复杂的。将身份简化为一个简单的标签并进行提示,创造的是一个卡通版的角色,而非真实的个体。
6. “时空旅行者”错误(替代谬误)
谬误: 认为 AI 数据可以取代人类数据来研究当前事件。
类比: 想象你试图通过看 2020 年的照片集来了解人们今天穿着什么。照片集是静态的;它不会改变。如果明天出现了一种新的时尚趋势,照片集将无法知晓。AI 就像那本照片集。它是基于截止到某个日期的数据进行训练的。它无法适应新的社会运动或不断变化的观点。
论文观点: AI 被困在过去。如果你使用它来研究当前的人类行为,你研究的是历史的一个快照,而不是鲜活、呼吸着的当下。
核心结论:我们应该怎么做?
论文并不是说 AI 是无用的。它说我们需要改变使用它的方式。
- 不要将 AI 作为人类的替代品。 你不能用机器人替换真实的参与者,并期望得到同样的科学真相。
- 要将 AI 作为一种“模拟工具”。 把 AI 想象成飞行模拟器。飞行员使用模拟器来练习、测试新想法以及观察飞机可能如何反应。但你不会说模拟器就是飞机本身,你也绝不会让真实的乘客去坐模拟器。
- 最佳方法: 使用 AI 来快速生成想法或测试假设(模拟器),但务必通过真实的人类数据(真实的飞行)来验证你的发现,以确保你是正确的。
简而言之:AI 是一个强大的镜子,它反射了人类的语言,但它不是窥探人类心灵的窗口。我们绝不能将倒影误认为是现实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。