← 最新论文
💬 NLP

Quantifying the Sources of Instability in LLM-Based Stance Analysis of Public Discourse

本研究表明,尽管在基于大语言模型的公共话语立场分析中,聚合情感比例在不同的预处理流水线中保持稳定,但关于情感效价与认识模态之间耦合关系的具体结论,对于低样本量说话者的流水线变化高度敏感,并且更显著地,对于大语言模型与关键词词典测量方法之间的系统性分歧高度敏感。

原作者: Bo Chen

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Bo Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名侦探,试图弄清楚一位名人的真实感受,以及他们对自己的言论有多大的把握。你面前有一大堆视频采访。但在你开始调查之前,你必须先用一台机器处理这些原始视频,这台机器要做三件事:听取音频、识别谁在说话(嘉宾还是主持人),并将语音切割成句子。

这篇论文提出了一个简单但棘手的问题:你设置机器的方式是否会改变最终的判决?

由 Bo Chen 领导的研究人员设计了一个大规模实验,涵盖了 256 场 YouTube 采访,涉及 41 位来自金融、政治和媒体领域的名人。他们将这些视频通过两种不同的“机器”(预处理流水线)运行,然后使用两种不同的“侦探”(测量方法)来分析文本。

两种机器:“剪切粘贴”型 vs. “听觉耳朵”型

把第一种机器想象成一个仅限文本的侦探。它抓取 YouTube 自动生成的字幕,对其进行清理,并尝试根据文字来猜测谁在说话。它很快,但有时会被 YouTube 字幕那种混乱的写法搞糊涂。

第二种机器是仅限音频的侦探。它倾听实际的声音波形,识别声音,并写下说了什么。这是一种更昂贵、更高科技的方法。

研究人员想看看,从“仅限文本的侦探”切换到“仅限音频的侦探”,是否会改变他们讲述的关于演讲者的故事。

两种侦探:“AI 大脑” vs. “词汇表”

一旦文本准备就绪,他们需要测量两件事:

  1. 效价(Valence): 说话者是开心的(积极)还是悲伤/愤怒的(消极)?
  2. 模态(Modality): 说话者是在表现得超级自信(强调)还是犹豫不决(对冲)?

为了测量这些,他们使用了两种不同的工具:

  • AI 大脑 (LLM): 一个强大的人工智能,它阅读文本并撰写关于说话者情感和自信程度的报告。
  • 词汇表 (Keyword Lexicon): 一个死板的规则手册,仅仅统计特定“愤怒”或“自信”词汇出现的次数。

大惊喜:机器的影响比你想象的要小(对某些人而言)

这是第一个转折。研究人员发现,如何切割视频确实很重要,但前提是你最初拥有的视频量不够多。

如果一位名人的视频非常少(5 个或更少),结果就会一团糟。从“仅限文本的侦探”切换到“仅限音频的侦探”,可能会彻底翻转结果,将一个“自信”的演讲者变成一个“犹豫”的演讲者。这就像试图通过观察一朵云来预测天气;噪声实在太大了。

然而,如果一位演讲者有大量的视频(16 个或更多),那么机器的选择几乎无关紧要。对于研究中样本量最好的四位明星来说,更换机器只会让结果产生微小的变化(平均偏移仅为 0.13)。无论你使用哪种机器,讲述的故事始终如一。

真正的反派:侦探的选择

剧情在这里变得更加曲折。虽然对于样本充足的明星来说,“机器”(预处理)并没有改变故事,但“侦探”(测量方法)却完全改变了结果。

研究人员发现,AI 大脑词汇表经常会对同一个人的同一段文本得出截然相反的结论。

  • 在近 49% 的案例中,两位侦探对于演讲者是在表现自信还是犹豫产生了分歧。
  • 对于一些非常有名的、样本充足的演讲者(例如拥有 17 个视频的经济学家 Ken Rogoff),AI 说了一套,而词汇表说的却是完全相反的内容。

这表明,最大的不稳定来源并不是你如何清洗数据,而是你选择了哪种工具进行分析。一种工具可能认为演讲者是“愤怒且确定”的,而另一种工具却认为他们是“冷静且犹豫”的。

安全的错觉

你可能会想:“好吧,也许如果我们看所有人的平均值,一切都会相互抵消?”研究人员检查了这一点,答案是:绝非如此。

他们发现,如果你只看所有视频中负面词汇的总百分比,数据看起来非常稳定。无论你使用哪种机器或哪种侦探,负面词汇的总数几乎不动(变化量小于 6 个百分点)。

但这种稳定性是一个陷阱。它掩盖了对于个体演讲者而言,结论是完全不同的事实。这就像说一个班级“表现平平”,因为天才学生和不及格的学生互相抵消了。你忽略了其中一个学生正在挣扎,而另一个正在茁壮成长这一事实。

总结

论文最后向任何研究公共话语的人发出了警告:不要只信任一种设置。

  1. 检查你的样本量: 如果你只有很少的视频,无论你做什么,你的结果都是不可靠的。
  2. 不要只依赖一种侦探: 如果你的 AI 工具和你的词汇计数工具意见不一,说明你还没有找到真相。你需要看到它们达成一致后,再发布你的发现。
  3. 区分噪声: 你必须弄清楚你的结果发生变化,是因为你改变了机器(预处理),还是因为你改变了工具(测量)。

简而言之,你准备数据的方式很重要,但你用来测量数据的方法更为重要。而且,如果你只看宏观的平均值,你可能会错过整个故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →