← 最新论文
💬 NLP

Zero-Shot Stance Detection in the Wild: Dynamic Target Generation and Multi-Target Adaptation

本文提出了一种名为 DGTA 的新型零样本立场检测任务,该任务能够在无先验知识的情况下识别多个动态目标及其立场,并证明了经过微调的大语言模型(特别是通过两阶段策略和集成策略)在新建的中文社交媒体数据集上取得了卓越的性能。

原作者: Aohua Li, Yuanshuo Zhang, Ge Gao, Bo Chen, Xiaobing Zhao

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Aohua Li, Yuanshuo Zhang, Ge Gao, Bo Chen, Xiaobing Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正走在一个喧闹、混乱的集市中(就像社交媒体的信息流)。在这个集市里,人们对各种事物发表意见:政治家、新手机、运动队,以及像“自由”或“企业贪婪”这样的抽象概念。

问题:“盲眼”侦探
传统的旨在理解这些观点的计算机程序(称为“立场检测”)就像是只能在拿到特定“通缉令”时才工作的侦探。如果你告诉他们,“找出人们对 特斯拉 (Tesla) 的看法”,他们能做得很好。但如果有人走过来说:“特斯拉很棒,但 比亚迪 (BYD) 更好,而 蔚来 (NIO) 则显得有些尴尬。”传统的侦探就会陷入僵局。他们不知道要去寻找 BYD 或 NIO,因为这些不在最初的名单上。他们被困在等待一个预定义目标的循环中。

解决方案:“野外”侦探
该论文的作者提出了一种新型侦探:DGTA(动态目标生成与多目标自适应)模型。这个侦探不需要“通缉令”,它被训练为走进野外的集市,倾听闲聊并说出:

  1. “嘿,我听到有人在谈论 特斯拉。”
  2. “噢,他们也在提到 比亚迪。”
  3. “还有 蔚来。”
  4. “现在,让我弄清楚他们对每一个目标的看法是好是坏。”

这被称为 “野外”零样本立场检测 (Zero-Shot Stance Detection in the Wild)。计算机必须在运行过程中即时发明目标列表,并同时搞清楚对每个目标的观点。

他们如何搭建训练场
为了训练这种新型侦探,研究人员不能只使用旧教科书。他们必须利用真实的中国社交媒体帖子(微博)构建一个庞大的、全新的训练场。

  • 人群: 他们收集了来自 240 个不同用户的超过 125,000 条帖子。
  • 清理: 他们剔除了表情符号、链接和用户名,只留下纯文本。
  • 老师: 他们并没有只雇佣一名人类来标注数据。他们使用了一个由三个不同 AI 模型组成的“委员会”来标注帖子。如果其中两个模型对目标和观点达成一致,他们就会保留该数据。如果出现分歧,他们就会将其丢弃。随后,人类专家又进行了双重检查。
  • 结果: 一个包含约 71,000 条高质量帖子的数据集,涵盖了从针对单一目标的吐槽到涉及三四个不同话题的复杂论辩。

训练方法:一步法 vs 两步法
研究人员尝试了两种不同的方式来训练他们的“大语言模型”(超级聪明的 AI 大脑)来完成这项工作:

  1. “全能”大厨(集成策略): 这个模型被告知:“阅读这段文本,找到所有目标,并告诉我每个目标的观点,一次性完成。”这就像一位大厨同时进行切菜、烹饪和摆盘。
  2. 流水线(两阶段策略): 这将工作拆分。
    • 第一站: 一个模型阅读文本并仅仅列出目标(就像扫描仪读取条形码一样)。
    • 第二站: 另一个模型拿着这个列表和原始文本,来判断观点是积极、消极还是中立。这就像是一个人负责找食材,另一个人负责烹饪。

结果:谁赢了?
他们将这些模型与旧的、更简单的程序以及仅靠指令(提示词)而未经过专门训练的模型(提示模型)进行了对比测试。

  • 获胜者: 经过专门训练(微调)的 AI 模型彻底击败了竞争对手。
  • “全能型”冠军: 一个名为 DeepSeek-R1(经过训练会在回答前进行“思考”)的模型在理清观点方面表现最佳,其准确率达到了 79.26%
  • “两步法”冠军: 一个名为 Qwen2.5 的模型在单纯寻找目标方面表现最好,得分 66.99%
  • 教训: 针对这种杂乱的现实工作进行专门训练,使 AI 变得更强,而不仅仅是给它一个通用的指令。此外,那些被教会进行“推理”(循序渐进思考)的模型比那些只会凭直觉猜测的模型表现得更好。

挑战(侦探失手之处)
即使是最优秀的模型,在特定情况下也会遇到困难:

  • 目标过多: 当一个句子包含三个或四个不同的主题时,模型会感到困惑并开始混淆它们。
  • 隐藏含义: 如果有人使用讽刺或隐喻(例如用“苹果嫁给织女”来暗示糟糕的合作),模型有时会错过负面语调,误以为是中立的。
  • 模糊目标: 如果目标不是一个清晰的名字(如“特朗普”),而是一个抽象的概念(如“制度的不公”),模型在精确锁定目标方面会感到吃力,尽管它们擅长发现“正在讨论某些事情”。

总结
这篇论文介绍了一种无需预设话题列表即可教计算机理解社交媒体争论的新方法。通过构建一个庞大的、经过仔细检查的数据集,并训练 AI 模型进行“全面思考”或通过“流水线作业”,他们创造了一个能够自动识别人们在谈论谁以及他们对这些人的看法,甚至是在充满混沌、不可预测的互联网“野外”环境下的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →