Large Language Models as Automatic Annotators and Annotation Adjudicators for Fine-Grained Opinion Analysis
本文探讨了将大语言模型用作细粒度观点分析自动标注工具的应用,发现尽管它们在识别观点片段方面表现出色,但由于无法可靠地复现连接这些片段的关联结构,其作用仅限于高保真标注助手,而非人类标注者的完全替代者。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个包含笔记本电脑和餐厅客户评论的巨型图书馆。你希望教会计算机不仅理解某人是否喜欢某物,还要确切地理解他们喜欢或不喜欢什么,以及原因。
例如,如果一条评论写道:“电池续航很糟糕,但屏幕很棒”,简单的计算机可能只会说“感觉复杂”。但“细粒度”分析希望将其分解为具体部分:
- 什么:电池续航(差)
- 什么:屏幕(好)
问题在于,教会计算机做到这一点通常需要雇佣大量人类来阅读每一条评论,并手动标注这些细微细节。这既缓慢、昂贵,又枯燥。
本文提出了一个重大问题:我们能否用大语言模型(LLM)——即那种能写文章、与你聊天的同类型人工智能——来取代那些人类大军?
以下是研究人员发现的内容,通过几个简单的故事进行解释:
1. “声明式”流程:提供指令,而不仅仅是提示
与其试图猜测向人工智能提问的完美方式(这就像通过大喊随机词汇来教狗做把戏),研究人员构建了一份结构化指令手册。
这就像一条工厂装配线。
- 输入:一条原始评论进入。
- 工人(LLM):他们不是雇佣一名工人,而是雇佣了一支由三名不同规模的人工智能工人组成的团队(一名“迷你”工人、一名“小型”工人和一名“中型”工人)。
- 规则手册:他们使用一种称为“声明式标注”的系统。这意味着他们不只是说“找出观点”,而是给人工智能一个严格的模式(模板)来填写,确保每个人都在寻找相同的特定部分(目标、观点词和情感)。
2. “仲裁者”:裁判
由于他们拥有三名不同的人工智能工人,他们有时会意见不一。一名工人可能说电池“差”,而另一名则说“还行”。
在人类研究中,你会让一位资深专家查看冲突的笔记并做出最终裁决。研究人员对人工智能也做了同样的事情。他们挑选了最聪明的人工智能工人(“中型”那个)来担任裁判。
- 裁判查看其他两名工人的笔记。
- 它权衡证据。
- 它产出一个最终的、经过“仲裁”的答案。
3. 重大发现:擅长 spotting,不擅长连接
这是本文最重要的部分。结果显示人工智能具有分裂的人格:
- “ spotting 者”(擅长发现词语):人工智能在发现实际词语方面表现出色。如果评论说“电池”,人工智能几乎总能找到“电池”。如果它说“糟糕”,人工智能就能找到“糟糕”。这就像一位目光敏锐的图书管理员,能立即指出书架上正确的书籍。
- “连接者”(在关系上挣扎):当人工智能必须正确地将这些词语联系起来时,它会感到困惑。它可能找到了“电池”和“糟糕”,但未能意识到它们属于同一个投诉,或者它可能忽略了“电池”是主体而“糟糕”是观点。
类比:
想象一个侦探团队。
- 人工智能侦探在寻找线索(词语)方面非常出色。他们能瞬间发现指纹或泥泞的鞋印。
- 然而,他们在侦破案件方面存在困难。他们可能发现了指纹和鞋印,但未能将它们与同一个嫌疑人联系起来。他们在“关系结构”中迷失了方向——即弄清楚线索如何组合在一起以讲述完整的故事。
4. 裁决:助手,而非替代者
研究人员试图看看这些人工智能侦探是否能完全取代人类侦探。答案是不,目前还不行。
- 小型人工智能模型经常在细节中迷失方向。
- 中型人工智能模型表现更好,尤其是在“裁判”(仲裁者)提供帮助时。
- “黄金标准”(人类标注者) 在理解词语背后的复杂故事方面仍然更胜一筹。
结论:
本文建议我们不应试图解雇人类标注者并用人工智能取而代之。相反,我们应该将这些人工智能模型用作超级助手。
将它们视为高保真数据增强工具。它们可以阅读数千条评论,找出关键词,并起草初始标签。然后,人类可以介入,只需双重检查这些连接。这将极大地加快流程,同时不损失人类理解的質量。
一句话总结
研究人员构建了一个系统,其中人工智能充当一组词语查找者和一名裁判来标注客户评论;他们发现,虽然人工智能在 spotting 单个词语方面表现出色,但在理解这些词语如何连接以讲述完整故事方面仍然存在困难,使其成为人类完美的助手,而非完全的替代品。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。