Generation of Synthetic Data in Health Surveys Using Large Language Models
本研究表明,在以用户画像为条件的情况下,大语言模型能够为秘鲁健康调查生成具有心理测量学合理性且人口统计学一致性的合成数据,尽管特定偏差的存在使得此类数据在用于政策制定之前必须经过严格的验证。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你是一位正试图完善一道新的国民级大汤品配方的厨师。通常情况下,为了测试汤的味道是否正确,你必须召集成千上万个真实的人来进行品尝,这既费时、费钱,又费力。而且,你还必须非常小心,不要泄露谁吃了什么,以保护他们的隐私。
这篇论文介绍了一种测试这道汤的新方法:使用“数字品尝者”来代替真人。
以下是研究人员所做工作的简单拆解:
核心理念:“数字孪生”
研究人员想看看一个聪明的计算机程序(称为“大语言模型”,简称 LLM)能否通过扮演真实的人来回答健康调查问卷。他们不仅仅是随机向计算机提问;他们还给了它一个**“用户画像”(User Persona)**。
把“用户画像”想象成游戏中的详细角色卡。计算机被告知:“你现在是一名来自利马的 4 5 岁女性,患有高血压,并且感到有些情绪低落。” 随后,计算机必须假装自己就是那个人,并据此回答调查问卷的问题。
实验过程:“虚构”调查
研究人员使用了来自秘鲁的一份真实 2016 年健康调查(称为 ENSUSALUD)的数据。他们利用这些真实数据构建了这些“角色卡”。然后,他们要求计算机为 1,000 个这样的角色生成答案。
他们在三个主要方面对计算机进行了测试:
- 它是否保持了角色设定? 如果角色是男性,计算机是否像男性一样回答?如果角色患有糖尿病,它是否记得这一点?
- “情绪”是否合理? 他们要求计算机填写抑郁和焦虑量表(如 PHQ-9 和 GAD-7)。他们检查了计算机的回答是否符合真实人类的情绪模式。
- 数据看起来是否真实? 他们检查了答案的分布情况(有多少人说“是”对比多少人说“否”)是否与现实世界相符。
结果:一次近乎完美的表演
计算机的表现非常出色,简直就像一个从不脱离角色的戏精:
- 保持角色设定: 当研究人员检查计算机是否记得其设定的年龄、性别和慢性病时,它的准确率高达 99% 到 100%。它很少忘记自己正在扮演谁。
- “情绪”测试: 计算机生成的抑郁和焦虑评分看起来非常真实。它们具有与真实调查相同的内部结构和可靠性。事实上,计算机关于抑郁程度的回答与其它研究中的真实抑郁得分高度相关。
- “虚构”调查的“成本”: 它的运行极其廉价且快速。计算机回答一个问题大约只需 5 秒钟,且每个问题的成本不到一美分。如果他们要针对全国进行这样的测试,大约需要 20 小时,花费不到 100 美元。
瑕疵:这位“演员”失手的地方
尽管表现优异,但研究人员还是发现了几个破绽:
- “肥胖症”混淆: 计算机倾向于高估肥胖人口的数量。它似乎认为,如果某人患有糖尿病,那么他们一定也肥胖,但这在现实生活中并不总是成立。
- “身高”小故障: 计算机很擅长记住赋予它的事实(如年龄),但当被要求发明新事实(如身高)时,这些数字并不符合自然的正态分布(钟形曲线)。它们看起来有点“不对劲”。
- “自杀”问题: 关于自杀念头的特定问题存在大量缺失答案的情况。计算机在面对这个敏感话题时,似乎比真实人类更容易犹豫或跳过。
总结
研究人员得出结论,人工智能可以成为设计和测试健康调查时非常实用的“替身”。它可以帮助研究人员在进入现实世界之前,先检查他们的调查问题是否合理,从而节省时间和金钱,并保护隐私。
然而,他们也警告说,你不能盲目信任人工智能。 因为计算机会出现小错误(比如高估肥胖率或跳过敏感问题),所以你目前还不能利用这些“虚构”的答案来做出关于公共卫生政策的最终决策。它是一个强大的练习和规划工具,但在用于现实世界的决策之前,仍需要人类监督员来检查工作。
简而言之: 计算机是一个出色的演员,可以在排练时模仿人群,但它还没有准备好在正式演出时取代真实的观众。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。