Challenges in annotations by humans and LLMs: A case study of evaluative language
本文通过评价理论,对比了人类与大语言模型(LLM)对 TED 演讲文本中评价性语言的标注情况,发现大语言模型在复杂标注任务中的表现优于受过训练的语言学家和受训人员,从而展示了其支持数字人文研究的潜力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:人类与大语言模型在标注中的挑战:以评价性语言为例的研究
问题陈述
本文探讨了数字人文和计算社会科学中日益复杂的标注任务,特别关注评价性语言(evaluative language)的识别与分类。尽管大语言模型(LLMs)在无监督自然语言处理(NLP)任务中展现出潜力,但其在高度主观且复杂的理论框架下是否能达到或超越人类表现,目前仍未得到验证。本研究聚焦于评价理论(Appraisal theory,Martin & White, 2005),特别是其态度子系统(Attitude subsystem,包括情感 Affect、判断 Judgement 和鉴赏 Appreciation)。作者强调,对这些类别进行人工标注既耗时,又容易出现低标注者间一致性(IAA),并受到语境依赖性、隐性含义以及区分细微类别之难度的影响。核心研究问题在于:大语言模型是否在这些复杂任务中遇到了与人类标注者相同的挑战,以及它们是否可以作为解决此类标注难题的有效工具。
研究方法
本研究采用混合方法案例研究,使用包含 11 个领域(如科学、政治、医学)共 190 篇英文 TED 演讲转录文本的语料库(EmotionalizTED 语料库)。研究方法分为三个阶段:
人工标注:
- 标注者: 24 名在读语言学学生(非英语母语者,主要为德国籍)和一名资深研究员(作为金标准/专家标准)。
- 任务: 句子层级的评价性内容分类。标注者首先判定一个句子是否具有评价性(二元分类),然后将其归入态度类别:情感(Affect)、判断(Judgement)、鉴赏(Appreciation)、模糊(Ambiguous)或不确定(Uncertain)。允许多标签标注。
- 评估: 使用 Cohen's Kappa(针对二元评价性判定)和 Krippendorff's alpha(针对多类子分类)来衡量标注者间一致性(IAA)。同时进行了定性错误分析,以识别分歧的来源。
自动标注(LLM):
- 提示词工程(Prompt Engineering): 设计了三种不同的提示词变体,并使用 qwen3-30b-a3b-instruct-25075 模型进行比较。这些变体包括少样本(few-shot)和零样本(zero-shot)方法,并在上下文、角色设定、约束条件以及引入思维链(CoT)推理方面进行了差异化设计。
- 模型选择与微调: 将表现最佳的提示词应用于三种不同的 LLM。随后使用 QLoRA 对表现最出色的模型进行微调,以优化性能。
- 流程: LLM 遵循两步走过程:(1) 评价性的二元分类;(2) 对具有评价性的句子进行态度类别的多类分类。
对比分析:
- 将微调后的 LLM 的表现与金标准(资深研究员)及学生标注者进行对比。
- 研究专门调查了 LLM 是否在与人类导致低一致性的特定语言现象(如隐性含义、目标识别)方面遇到了同样的困难。
关键结果
- 人类表现: 语言学学生之间的标注者间一致性表现各异,且通常较低。在“评价性 vs 非评价性”这一二元判定上的共识程度在不同领域间存在差异(在娱乐和政治领域 Kappa 0.51,但在历史和心理学领域显著下降)。在具体的态度子类别(情感、判断、鉴赏)上的共识度更低,Krippendorff's alpha 经常低于 0.50,有时甚至出现负值。
- 人类错误来源: 定性分析显示,人类的分歧源于:
- 难以区分显性含义与隐性含义。
- 对“评价对象”(例如,某种情绪是属于说话人还是提到的第三方)的混淆。
- 处理包含嵌套评价含义的长难句时的挑战。
- 英语水平和领域知识的差异。
- LLM 表现: 微调后的 LLM 相对于金标准达到了 0.77 的 F1 分数。
- 对比: LLM 的表现优于学生标注者,并且值得注意的是,它与资深研究员(金标准)的一致性高于学生。
- 挑战对齐: 研究发现,LLM 并不一定在与人类相同的方面以相同的方式面临困难;相反,它们展示了比受训但缺乏经验的人类群体更稳定地解决复杂分类任务的能力。
主要贡献
- 标注方案: 本文提出了一个针对评价理论中态度类别、并适配于口语科普话语句子级分析的特定标注方案。
- 实证对比: 提供了人类标注者(包括受训者和专家)与 LLM 在复杂、主观语言任务中的直接实证对比。
- 提示词优化: 本研究展示了提示词设计(包括思维链 CoT 和少样本策略)对 LLM 在语用标注中性能的影响。
意义与主张
作者主张,LLM 可以有效地辅助解决复杂的标注任务,在一致性和与专家标准的契合度方面,其表现甚至可能超越处于培训阶段的语言学家。本文指出,如果 LLM 能够通过提示词工程和微调成功标注如“评价理论”这类复杂的语言理论,这将为数字人文研究开辟新路径。具体而言,这意味着只要对 LLM 进行适当引导,大规模的人工标注语料库对于分类大量语音数据并非总是严格必要的。研究结论认为,LLM 为跨学科领域的标注规模化提供了一种可行的策略,尽管作者也承认需要针对具体任务进行模型性能的验证。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。