More Parameters Than Populations: A Systematic Literature Review of Large Language Models within Survey Research
本工作论文呈现了一项系统性文献综述,该综述将大语言模型在调查研究的预数据收集、数据收集及后数据收集阶段的当前应用、潜在用例及陷阱进行了分类,同时强调了该领域为完善大语言模型做出贡献的机遇。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
将调查研究想象成一场规模宏大、高风险的烹饪比赛。几十年来,厨师(研究人员)一直依赖人工试吃员、手写食谱和精细的人工计数来创造完美的佳肴(数据)。但现在,一台功能极其强大的厨房机器人进入了厨房:大语言模型(LLM)。
这篇论文就像是一群美食评论家(作者)走进厨房,观察目前这些机器人在厨房里究竟是如何被使用的。他们并非凭空猜测;他们查阅了近 190 份特定的报告(论文),以绘制出当前的现状图谱。
以下是他们的发现,简单分类如下:
1. 厨房的三个阶段
作者根据制作调查的三个主要步骤对他们的发现进行了分类,将 LLM 视为在不同环节提供帮助的工具:
- 烹饪之前(数据收集前): 这是编写食谱的阶段。论文指出,机器人在这里已经得到了相当广泛的应用。它们可以帮助编写问题、将食谱翻译成不同的语言,甚至扮演“试吃员”,在真实的人尝试之前,看看某个问题是否容易引起混淆。
- 隐患: 有时机器人尝了食物后说味道极佳,但它其实是在产生“幻觉”(编造事实)。它可能认为一个问题很有意义,但对真实人类来说,那个问题其实不知所云。
- 烹饪期间(数据收集中): 这是机器人充当副厨甚至假想顾客的阶段。一些研究人员正在使用 LLM 来生成“合成”人群(虚假受访者),以观察调查可能会如何展开。
- 隐患: 如果你为机器人做了一顿饭,它吃到的味道可能并不像真实人类会吃到的味道。论文警告说,这些虚假响应可能不足以准确代表真实的人群,尤其是在处理复杂的政治观点时。
- 烹饪之后(数据收集后): 这是清理和摆盘阶段。一旦真实的人回答了调查,机器人就会被用来整理凌乱的笔记、总结人们说了什么以及组织数据。
- 隐患: 就像机器人可能会读错手写笔记一样,它有时会误判微妙的人类情感或观点,从而导致对“晚宴”整体感受的错误结论。
2. 厨房中的不平衡
该综述最大的启示是,机器人在准备和清理阶段做了大量工作,但在实际烹饪(现场采访和招募真实受访者)方面却几乎没有触及。
作者指出,这很奇怪,因为这些机器人本应是擅长交谈和理解多种语言的专家。然而,我们并没有看到它们被广泛用于与人交流或招募人员。这就像拥有一台能说 50 种语言的机器人,但我们只用它来写菜单和数盘子,从不让它去端菜。
3. 机器人也需要厨师
论文也反转了视角。这不仅仅是关于机器人如何帮助厨师,还关于厨师如何帮助机器人。
- 训练机器人: 调查研究人员是发现错误和确保质量的专家。论文建议,调查研究人员所使用的严谨方法可以帮助训练这些机器人,使它们变得更聪明,且不易编造事实。
- 理解机器人: 调查也被用于询问人们:“你们对这些机器人有什么看法?”这有助于我们了解公众如何看待这项技术。
4. 未来何方
作者承认这是一个“进行中的工作”。他们目前正在反复核对他们的 189 篇论文清单,以确保没有遗漏任何内容。他们计划进行更深入的研究,以观察机器人对某些人群是否比对其他人群表现得更好,或者在话题变得过于复杂时是否会失效。
简而言之: 大语言模型正在出现在调查研究中,主要用于辅助编写问题和清理数据。它们是充满前景的工具,但也可能编造答案或误解细微差别。论文认为,我们需要保持谨慎,对其进行彻底测试,并利用我们人类的专业知识,以确保这些数字助手不会毁掉整道菜的配方。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。