Synthetic Personalities: How Well Can LLMs Mimic Individual Respondents Using Socio-Economic Microdata?
本研究表明,通过优化信息深度、嵌入方法和推理模式,大语言模型能够有效地从现有的社会经济面板数据中构建详细的个体级“数字孪生”,其准确率高达78.8%,并与真实受访者具有强相关性,从而证明了基于孪生的市场研究目前受限于构建决策而非数据可用性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图预测某个特定的人会对一项调查问卷做出怎样的回答。通常情况下,你必须直接询问他们,这既慢又贵。这篇论文提出了一个大胆的问题:我们能否仅利用公司数据库中现有的数据,就构建出一个真实人物的“数字克隆体”?
把公司的数据库想象成一个巨大的、杂乱的阁楼,里面堆满了多年来关于客户的笔记、收据和旧调查问卷。研究人员想看看,他们是否可以从这个阁楼中提取出一个随机人物零散的笔记,并利用人工智能(AI)创建一个能够像真人一样回答新问题的“数字孪生体”。
以下是他们是如何做的,以及他们的发现,用通俗易懂的方式进行了解释:
1. 原料:构建克隆体
为了构建这些数字孪生体,研究人员使用了**德国社会经济面板(SO же 经济面板,SOEP)**的数据。想象一下,这是一本由超过 28,000 人记录的、长达 40 年的巨型日记。它涵盖了从工作、收入到家庭生活及观点的方方面面。
他们从这份日记中挑选了 500 个人,并尝试为每一个人构建一个数字版本。为此,他们测试了一个包含四种主要原料的“配方”:
- 大脑(AI): 他们使用了三种不同的开源 AI 模型(可以把它们想象成三种不同类型的超级智能计算器)。
- 记忆(喂给它多少信息): 他们测试了是只喂给 AI 基本事实(如年龄和性别),还是喂给它整本日记。他们像通过往桶里注水一样来衡量这种“信息深度”。
- 格式(如何讲述故事): 他们尝试了两种呈现数据的方式:
- 摘要版: 一段简洁、整洁的段落,总结了一个人的生活。
- 原始对话版: 一份冗长、杂乱的转录文本,记录了这个人过去被问过的每一个问题以及他的回答。
- 思考方式: 他们测试了 AI 应该是直接吐出答案,还是在回答之前先“大声思考”(写下其推理过程)。
2. 实验:“味觉测试”
研究人员创建了 210 万个 数字响应。随后,他们向这些数字克隆体提出了 183 个问题,而这些问题是真人过去已经回答过的问题。目标是观察数字克隆体的回答是否与真人的回答相匹配。
他们通过两种方式衡量成功:
- 准确度(Accuracy): 克隆体是否给出了完全相同的答案?(例如:如果真人说“是”,克隆体是否也说“是”?)
- 排序能力(Ranking): 克隆体是否理解了谁更有可能做出某种回答?(例如:如果 A 比 B 通常更乐观,克隆体是否能反映出这种差异?)
3. 重大发现
信息的“金发姑娘区”(适中原则)
你可能会认为“数据越多越好”。研究人员发现,这只在一定程度上是正确的。
- 第一口尝试: 在加入一些额外信息(超越基本的人口统计数据)后,准确度有了很大提升。
- 黄金分割点: 当他们加入前 75% 最有趣的问题时,准确度出现了最大的飞跃。
- 边际收益递减: 加入最后 25% 的数据(即桶里的最后一点水)并没有带来多少帮助。它消耗了大量的计算资源,但对结果几乎没有改善。
- 类比: 这就像是在给汤调味。加盐起初很有帮助,再加一点也有用,但最后把整瓶盐都倒进去,只会让汤变得太咸,而不会让味道变得更好。
原始历史的力量
令人惊讶的是,将 原始对话历史(杂乱的转录文本)喂给 AI,效果比给它一份整洁的摘要更好。
- 类比: 这就像是在猜测朋友晚餐会点什么。摘要会说:“我的朋友喜欢意大利菜。”但对话历史会说:“上周二他们点了披萨,但在疲惫时他们点了沙拉,而且他们讨厌香菜。”杂乱的历史给了 AI 更多能让它做对的线索。
思考有帮助,但对准确度并非如此
当 AI 被要求在回答之前“大声思考”时,它在排序(理解个体间的差异)方面表现得更好,但在精确答案的正确率上并没有必然的提升。
- 类比: 这就像一个在写出数学步骤的学生。他们可能会把最终结果算错,但比起那些只靠猜的学生,他们更理解背后的逻辑。
4. 底线结论
这项研究证明,你不需要进行专门的、昂贵的访谈来构建优秀的数字孪生体。你可以利用公司现有的异质化、杂乱的数据(如会员计划历史或旧调查问卷)来构建它们。
- 最佳结果: 最准确的数字孪生体在 78.8% 的情况下给出了正确答案。
- 核心启示: 使用这些数字孪生体的最大瓶颈不在于你如何设计数据收集,而在于拥有足够的数据量以及选择合适的 AI 模型。
简而言之,如果你有一个装满客户笔记的数字阁楼,你现在可以构建一个相当准确的“数字幽灵”来测试想法,而无需逐一采访你的客户。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。