← 最新论文
🤖 AI

The threat of analytic flexibility in using large language models to simulate human data

该研究通过两项实证分析表明,在使用大语言模型生成模拟人类数据的“硅基样本”时,模型选择、提示格式等分析决策的灵活性会显著影响模拟结果与真实人类数据的一致性,从而可能改变研究结论,因此呼吁学界重视这一威胁并制定应对策略。

原作者: Jamie Cummins

发布于 2026-04-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Jamie Cummins

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章就像是在给社会科学家敲响一记警钟,提醒他们在使用人工智能(AI)来模拟人类时,可能正不知不觉地走进一个巨大的“迷宫”。

作者 Jamie Cummins 发现,虽然用 AI 生成“硅基样本”(即让 AI 假装成人类受访者)听起来很美好、很高效,但怎么让 AI 扮演人类,结果会天差地别

为了让你更容易理解,我们可以把这项研究比作**“让 AI 厨师模仿人类口味”**。

1. 核心概念:什么是“硅基样本”?

想象一下,你想研究人类对某种新口味的反应。以前,你必须找几千个真人来试吃,这既贵又慢。
现在,有了 AI(大语言模型),你可以让 AI 扮演这几千个“虚拟人”。你告诉 AI:“你是一个 30 岁的男性,住在纽约,喜欢辣味”,然后问它:“你觉得这个新菜好吃吗?”
AI 就会生成回答。这些由 AI 生成的回答集合,就是**“硅基样本”**。

2. 问题出在哪?“菜谱”太灵活了

作者发现,虽然 AI 很聪明,但怎么给 AI 下指令(也就是“菜谱”),对结果的影响大得惊人。这就好比让同一个厨师做菜,但你可以用不同的方式给他下指令:

  • 模型选择:是用“新手厨师”还是“米其林大厨”?
  • 温度设置:是让厨师“严格按菜谱做”(严谨),还是“发挥创意随机发挥”(自由)?
  • 给多少背景信息:是只告诉厨师“你是男的”,还是把“你的年龄、收入、政治倾向、甚至你昨天吃了什么”全告诉厨师?
  • 提问方式:是像“填表格”一样一个个问,还是像“聊天”一样一口气问完?

作者的研究发现:
如果你改变上述任何一个“菜谱”细节,AI 模拟出来的“人类口味”就会完全不同。

  • 有的菜谱能让 AI 模拟得非常像真人。
  • 有的菜谱会让 AI 模拟得完全不像,甚至得出相反的结论。
  • 最可怕的是:有时候,让 AI 在“模拟口味”上很准的菜谱,会让它在“模拟人际关系”上完全翻车。没有一种“万能菜谱”能让 AI 在所有方面都表现得完美。

3. 两个实验故事

故事一:两个尺度的测试(Study 1)

作者找了两个心理学量表(一个是关于“相信世界是公平的”,一个是关于“对种族的直觉感受”),让 AI 扮演 85 个真人来回答。

  • 结果:作者尝试了 252 种不同的“菜谱”组合。
  • 发现
    • 有些组合让 AI 的回答顺序和真人很像。
    • 有些组合让 AI 的回答分布(比如多少人选“同意”)和真人很像。
    • 没有一种组合能同时做到这两点
    • 更有趣的是,有些组合甚至让 AI 算出的“种族偏见”和“公平信念”之间的关系,和真人的数据完全相反。
    • 比喻:就像你让 AI 模仿一个人,它可能模仿出了这个人的“身高”,但完全没模仿出这个人的“体重”;或者模仿出了“体重”,却把“身高”搞错了。

故事二:重做一篇名篇(Study 2)

作者拿了一篇已经发表过的、非常有名的论文(Argyle 等人,2023 年),那篇论文说 AI 模拟人类数据非常成功。作者用同样的数据,但换了 66 种不同的“菜谱”重新跑了一遍。

  • 结果
    • 原来的论文说 AI 和真人的相似度很高(相关性 0.72)。
    • 但在作者的新实验中,根据“菜谱”不同,相似度在 0.23 到 0.84 之间剧烈波动。
    • 比喻:就像你重新做一道名菜,如果换个厨师、换个火候、换个调料,这道菜可能从“米其林三星”变成“黑暗料理”,尽管用的食材(数据)是一样的。

4. 为什么这很危险?(“分叉花园”)

作者用了一个很形象的词:“分叉花园”(Garden of Forking Paths)
想象你走进一个有很多岔路的花园。

  • 如果你不小心选了一条路,你可能走到“花园很美”的结论。
  • 如果你选了另一条路,你可能走到“花园很丑”的结论。
  • 如果研究者没有事先规定好走哪条路,他们可能会无意识地挑选那条能得出“漂亮结论”的路。

在 AI 模拟中,这种“无意识的选择”太容易发生了。因为“菜谱”选项太多(用哪个模型、温度设多少、给多少背景),研究者很容易(哪怕是无心的)挑出一个能得出自己想要的结果的设置。这会导致虚假的结论,让科学变得不可靠。

5. 作者的建议:我们该怎么办?

作者并不是要完全禁止使用 AI 模拟人类,而是呼吁大家更谨慎、更透明

  1. 不要指望“万能钥匙”:不要以为找到一个完美的 AI 设置就能解决所有问题。不同的研究问题可能需要不同的设置。
  2. 像做实验一样“预注册”:在开始用 AI 模拟之前,先写清楚:我要用什么模型?怎么提问?怎么分析?不要等看到结果了,再回头去挑那个“看起来最好”的设置。
  3. 展示“全貌”:不要只报告那个“最好”的结果。要像作者做的那样,展示所有不同设置下的结果(就像展示所有岔路),让读者看到结论的稳定性。
  4. 先校准,再使用:如果你要用 AI 模拟,最好先有一小部分真实的人类数据作为“校准器”。先让 AI 试跑,看看哪种“菜谱”最准,然后再用这个设置去跑大规模数据。
  5. 三思而后行:在决定用 AI 模拟人类之前,先问问自己:“我真的需要 AI 吗?还是直接收集真实数据更靠谱?” 特别是对于弱势群体或难以接触的人群,如果 AI 连普通人的数据都模拟不准,那模拟这些特殊人群的风险就更大了。

总结

这篇论文告诉我们:AI 模拟人类是一项强大的技术,但它不是一个“一键生成”的黑盒子。

就像做菜一样,“怎么做”比“用什么食材”更重要。如果研究者不仔细控制“烹饪过程”(分析设置),他们做出来的“科学菜肴”可能只是由随机选择决定的,而不是真实的科学发现。

作者希望社会科学界能吸取过去的教训,在 AI 模拟这个新领域建立严格的规则,避免重蹈覆辙,让科学结论真正可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →