A Multi-Model, Multi-Domain Benchmark of Large Language Model Agreement with Humans and with Each Other in Sentiment Classification
本文提出了一个评估五种大语言模型、一个基于规则的词典以及一个监督式 Transformer 相对于人类标注表现的多领域基准测试,结果显示,尽管像 Claude Opus 4.7 和 GPT-5.5 这样的顶级模型实现了与人类的高度一致性,但在不同模型之间以及模型与人类标签之间仍存在显著的分歧——尤其是在非正式文本方面——这表明模型选择会对情感分类结果产生实质性影响。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在能够阅读并理解语言的计算机世界中,存在着一项如同互联网本身一样古老的任务:判断一段文本是快乐的、悲伤的,还是仅仅在陈述事实。这被称为情感分析。多年来,人们一直使用这些工具来猜测新闻报告会对股市产生何种反应,观察客户是否对某款产品感到愤怒,或者追踪健康危机期间的公众情绪。最近,新一代这类计算机程序——即大型语言模型——已经到来。这些系统同样可以写故事、回答问题并进行对话。由于它们非常擅长理解人类语言,许多人开始利用它们来完成按情绪对文本进行分类的工作,希望用一条简单的计算机指令来取代缓慢且昂贵的人工审核工作。
但这种新方法存在一个问题。正如不同的人对于一部影评是讽刺还是真诚可能会持有异议一样,这些不同的计算机程序之间也可能无法达成一致。一个程序可能将某个句子判定为“积极”,而另一个程序却可能将完全相同的句子判定为“消极”。如果一家银行或医院依赖这些工具来做出重大决策,那么选择哪一个程序就显得至关重要。直到现在,还没有人系统地检查过这些不同的程序之间在多大程度上能达成一致,或者在面对同一段文本时,它们与人类裁判的一致性有多高。
一位名叫 Aneesh K Sajan 的研究人员决定通过进行一项大规模的受控实验来解决这个问题。他收集了来自四家不同技术公司的五种最先进的现有语言模型,以及两个作为基准的旧型简单工具。他向它们输入了总计 8,872 个句子,这些句子取自五个不同的数据集。这些句子来源广泛:包括正式的财务报告、随意的社交媒体帖子、电影评论和业绩说明会。其目标是观察计算机能否根据人类标注的情绪正确识别文本中的情感,更重要的是,观察它们彼此之间达成一致的频率。
结果显示出明显的性能分化。来自 Anthropic 公司和 OpenAI 公司的两个模型脱颖而出,表现最为准确。当这两个模型观察正式的财务文本时,它们几乎完美地匹配了人类的判断。它们在分析的近 90% 的句子中也彼此达成了一致。OpenAI 的第三个模型紧随其后,形成了一个高性能工具的紧密群体,这些工具通常以相同的方式看待世界。然而,来自 Google 的一个旨在通过“思考”来解决问题的模型,其表现却令人震惊地糟糕。它出错的频率如此之高,以至于其结果几乎仅比随机猜测好一点。研究人员测试了一个特定的理论,以确定这种失败是否是因为 Google 模型在处理简单问题时花费了过多的思考时间(即一种被称为“过度思考”的现象)。他强制要求该模型以更短的思考时间进行回答,但表现依然不佳。这排除了该模型仅仅是在过度分析任务的可能性;这种失败是该特定模型在该设置下固有行为的一部分。
另一个可以在研究人员自己的电脑上运行而非依赖云服务器的开源模型,表现尚可。它虽然不如顶尖的商业模型准确,但明显优于多年来一直使用的旧型基于规则的工具。研究还发现,文本的类型也起到了很大作用。所有的模型在理解正式、专业的写作方面都比理解像推文或短信这类随意、非正式的语言要好得多。对于非正式文本,即使是最优秀的模型,其一致性也仅处于“中等”水平,这意味着它们与人类以及彼此之间仍存在大量分歧。
或许最令人震惊的发现是,这些模型之间的实际一致性是多么低。当研究人员观察这六个工具的整体情况时,它们仅在约 14% 到 24% 的句子中给出了完全相同的答案。在剩余的句子中,并没有明显的多数意见。这意味着,对于人们每天分析的大量文本而言,最终的结果完全取决于你正在使用哪一个计算机程序。如果一名金融分析师使用一种模型来阅读报告,而另一名分析师使用另一种模型,他们可能会对同一条新闻得出截然相反的结论。
研究结论指出,尽管这些新工具功能强大,但它们并非可以互换的。选择模型不仅仅是一个微小的技术细节,它是一个会改变数据本身的决策。对于涉及正式财务文档的任务,顶尖模型是可靠且一致的。但对于非正式文本,或者对于那些正负倾向差异细微的任务,模型之间的分歧是真实不确定性的体现。在这些情况下,研究人员建议,仅仅依赖单一的计算机是有风险的。相反,最好的方法是结合使用多个模型,或者在计算机产生分歧时由人工进行审核,以确保最终的决策不仅仅是由于选择了哪种软件而产生的产物。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。