So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis
本研究对比了大语言模型(LLMs)与传统机器学习在分析开放式调查问卷响应方面的表现,发现虽然大语言模型在理解复杂主题和情感方面实现了更优越的分类准确度,但在其推理过程的连贯性与可解释性方面存在显著的权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个巨大的箱子,里面装着成千上万封学生写的信,字迹潦草且充满情感。有些是开心的,有些是愤怒的,有些是讽刺的,还有些只是单纯的困惑。你的任务是什么?阅读每一封信,并将它们分类到六个情感桶中:喜悦(Joy)、惊讶(Surprise)、爱(Love)、愤怒(Anger)、悲伤(Sadness)和恐惧(Fear)。
在很长一段时间里,研究人员一直尝试用“老派”的计算机程序来完成这项工作。你可以把这些程序想象成一位非常刻板的图书管理员,他只知道通过计数特定的词汇来工作。如果图书管理员看到“太棒了(great)”这个词,他就会给这封信贴上“喜悦”的标签。如果看到“坏(bad)”,他就会贴上“悲伤”的标签。这种方法很快,而且你能清楚地看到图书管理员为什么做出这样的选择。但问题在于,这些图书管理员很容易被愚弄。他们会错过讽刺,错过隐藏在感谢背后的疲惫,也会错过那些即便使用了礼貌用语、实则内心愤怒的微妙暗示。
在这项研究中,研究人员决定测试一组新的助手:大语言模型(LLMs)。你可以把这些模型想象成超级聪明、博学多才的机器人,它们几乎读过了互联网上的所有内容。与那些刻板的图书管理员不同,这些机器人试图理解句子的“氛围”和“语境”,而不仅仅是单个词汇。
巅峰对决
研究人员利用 2019 年和 2021 年真实的调查数据(2021 年有 293 封信,2019 年有 142 封信),让这两组团队展开了对决。他们并没有教这些机器人任何新知识,只是要求它们使用一种简单的指令进行分类,这种方法被称为“零样本(zero-shot)”提示。
老派图书管理员的表现
传统的计算机模型(如支持向量分类器和随机森林)在经过特定示例训练时表现尚可。在练习测试中,它们的准确率达到了约 90%。但当它们面对真实的、杂乱的学生信件时,就开始表现得有些失常。
- 在 2019 年的那批数据中,其中一个模型判定 99.3% 的信件都是“喜悦”。它基本上忽略了所有其他情感!
- 在 2021 年的数据集中,这些模型之间的分歧巨大。一个认为一封信属于“爱”,而另一个却认为属于“悲伤”。
- 研究人员发现,这些旧模型对特定词汇(如“很棒”或“好”)过于敏感,无法处理语言中复杂的人性化一面。它们非常脆弱,这意味着如果数据发生微小的变化,它们的分类就会崩溃。
新一代机器人的表现
由 LLM 组成的团队(包括 GPT-4-Turbo、Claude 3.5、Meta 的 LLaMA 3 和 Perplexity Sonar Pro)采取了不同的策略。它们不只是计数,而是试图理解其中的“感觉”。
- 它们彼此达成共识: 当四台不同的机器人观察同一堆信件时,它们的分类结果基本一致。例如,在 2021 年的数据中,四台机器人对于“愤怒”这一类别的数量(46 封)达成了完全一致的看法。
- 它们能处理细微差别: 它们更擅长捕捉复杂的情感,比如当一名学生在进行讽刺,或者当他们的“谢谢”中其实夹杂着精疲力竭的情绪时。
- 数据表现: 虽然论文没有给出机器人的单一“准确率得分”(因为没有人类的标准答案可以对比),但它们的连贯性表明,对于这种杂乱、真实的现实数据,它们比旧模型要可靠得多。
潜在的问题
这些机器人并不是完美的魔法师。研究人员指出了一些需要注意的地方:
- “爱”的偏差: 所有四台机器人将更多的信件归类为“爱”而非“喜悦”。研究人员怀疑这是因为机器人在社交媒体上学习过,在社交媒体上,人们说“我爱这个课!”通常是指“我很喜欢这门课”,而不是指深沉的浪漫情感。
- 黑箱效应: 与那些旧的图书管理员不同,你无法总是看清机器人为什么做出某种选择。审计它们的工作变得更加困难。
- 成本与更新: 运行这些机器人成本很高,而且制造它们的厂商经常会对它们进行更新。如果你明年运行相同的提示词,机器人可能会给出略有不同的答案,因为它已经变成了“新版本”。
结论
这项研究表明,如果你想要分析成千上万份开放式的学生反馈,新的 AI 机器人是更好的工具。它们更擅长理解语言中复杂的人性面,并且在面对不同学生群体时表现得更加一致。
然而,研究人员并未表示这是一个“已解决”的问题。他们建议,对于高风险的决策(例如改变学校政策),最好的方法是团队协作:让机器人承担繁重的分类工作,但要由人类进行检查,以确保机器人不会被讽刺或偏见所误导。这是一种强大的倾听学生的新方式,但它仍然需要人类掌握方向盘。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。