LLMs for Survey Text Analysis – A Performance Comparison Between Humans and GPT-5 on Inductive Content Analysis
本研究表明,GPT-5.4 在调查数据的归纳性内容分析方面可以接近人类水平,其编码和主题生成的符合度达到了与人类内部一致性相当的水平,从而验证了其作为定性研究可扩展支持工具的潜力。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
定性研究是一门理解文字意义的艺术。当科学家、社会学家或政策制定者需要理解人们的思想、感受和经历时,他们通常会提出开放式问题。人们不再仅仅是勾选一个选项,而是写下一段关于自己的生活、挣扎或希望的文字。为了将成千上万个这样的段落转化为有用的知识,研究人员必须阅读每一个段落,寻找重复出现的观点,并将它们归类。这个被称为内容分析的过程是理解人类行为的核心,但它极其缓慢且耗费精力。几十年来,实现这一目标的唯一方法是依靠人类大脑进行逐行阅读。现在,一种新型工具进入了视野:大语言模型。这些是经过海量文本训练的人工智能系统,能够阅读、理解并总结语言。科学界面临的大问题不仅是这些机器能否阅读,而是当任务要求在没有预设规则手册的情况下寻找隐藏模式时,它们是否能像人类研究员一样思考。
来自欧洲各大学的研究团队通过直接对比来试图回答这个问题。他们采用了来自一项针对全欧洲 2,800 名博士生调查的真实数据集,其中随机抽取了 10% 的响应作为研究的数据基础。从这个样本中,研究人员对六个特定开放式问题的共计 903 份回答进行了深入分析。在实验的一侧,五名人类研究人员阅读了这些答案,并进行了所谓的归纳式内容分析。这意味着他们并没有预先准备好一份强制分类的列表;相反,他们阅读文本,识别核心观点,为这些观点创建自己的标签,然后将这些标签归入更广泛的主题中。这是一个创造性和解释性的过程,依赖于人类的判断力来决定什么才是重要的。在另一侧,研究人员使用了一个先进的语言模型,对相同的文本执行完全相同的任务。机器收到了同样的指令:阅读答案,寻找主要观点,并将它们归类为主题,且事先并未被告知要寻找什么。
研究人员随后比较了两组结果,以观察机器与人类的匹配程度。他们并没有寻求完美的契合,因为即使是不同的专家在如何标注特定句子时也经常存在分歧。相反,他们衡量了各组之间的整体一致性。结果显示出中度的吻合度。当观察研究人员和机器为文本创建的具体标签时,它们的重合率约为 61%。当观察由这些标签构建出的更广泛的主题时,一致性略低,为 54%。为了提供参考背景,研究人员还检查了五名人类专家彼此之间的意见一致程度。人类在标签和主题上的意见一致率约为 68%。这意味着机器与人类之间的差距并不大;机器的表现几乎与人类专家之间的人际一致性相当。
然而,情况并非在所有主题下都完全一致。人类与机器之间的协议程度因学生写作的内容不同而显著变化。对于涉及财务状况的问题,机器表现得更为吃力,与人类研究人员的一致性较低。对于个人经历或一般性反馈的问题,一致性则要强得多。研究表明,机器的可靠性在很大程度上取决于数据的性质和文本的清晰度。当文本具有歧义,或者机器自身分组的内部逻辑不稳固时,它与人类的一致性就会下降。研究人员发现,每当机器自身出现前后矛盾时,它也会与人类产生分歧,人类团队也是如此。这表明,特定课题的难度在很大程度上影响着该工具的效果。
参与研究的人类编码员也被询问了他们对机器工作的印象。他们表示,机器的分类反映了他们自己的思维方式,并且他们愿意信任该工具来辅助未来的数据分析。研究人员得出结论:这些人工智能系统尚未准备好完全取代人类的判断,尤其是在构建理论这种复杂的高级工作中。然而,研究结果表明,这些工具在处理文本分类的早期、高强度劳动阶段非常有效。它们可以承担阅读数千份响应并寻找初步模式的繁重工作,从而让研究人员能够专注于对这些模式进行更深层次的解读与验证。这项研究并非声称机器是完美的,或已经解决了文本分析的问题,但它确实表明,对于那些需要理解大量人类故事的研究者来说,机器是一个强大且可扩展的合作伙伴。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。