← 最新论文
💬 NLP

Expectation, Backlash, Recovery, and Excitement: How Model Releases Shape Reddit Perceptions of Conversational AI Systems

本文通过分析 Reddit 上的长期讨论,旨在证明对话式人工智能模型的发布是动态的、面向用户的干预措施,它们显著地重塑了公众情绪与话语,并在 Anthropic、OpenAI、Grok 和 DeepSeek 等供应商之间观察到了截然不同的预期、抵制与恢复模式。

原作者: Vahid Rahimzadeh, Yury Zhauniarovich, Savvas Zannettou

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Vahid Rahimzadeh, Yury Zhauniarovich, Savvas Zannettou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:预期、反弹、恢复与兴奋

问题陈述

对话式人工智能系统(CAISes)并非静态产品;它们通过模型发布、功能更新、安全干预和访问策略转变进行持续演进。以往的研究广泛通过静态快照(调查、跨时段社交媒体分析)来绘制用户对 AI 的感知,但这些方法无法捕捉用户情绪响应特定系统干预的动态特性。现有文献通常将模型变化视为纯粹的技术更新,忽视了其对用户的社会和关系影响。本研究旨在填补理解在多个供应商背景下,用户对 CAISes 的感知如何随特定模型发布事件而动态变化的空白。

研究方法

作者对 2022 年 10 月至 2025 年 12 月期间的 Reddit 讨论进行了长期、大规模分析,涵盖 20 个子版块和 668,063 条帖子。该方法围绕“以发布为中心的设计”构建,将模型发布视为干预点。

1. 数据构建与归一化:

  • 语料库: 从 20 个相关的子版块(如 r/ChatGPT, r/ClaudeAI, r/grok)中筛选提交内容,重点关注六大主要供应商:OpenAI、Anthropic、Google、xAI、Meta 和 DeepSeek。
  • 提及提取: 开发了一个基于分类法引导的 LLM 流水线,用于识别并将模型提及归一化为四级层级结构:<供应商, 系列, 代际, 层级>。该分类法源自 LLM Arena 排行榜,映射了 9 个供应商的 189 个条目。提取器在将原始文本映射到此模式方面实现了高精度(F1 > 0.95)。
  • 过滤: 分析侧重于“单次提及”的帖子,以确保归因清晰,最终得到包含 505,250 次模型提及的 363,546 条帖子数据集。

2. 感知测量:

  • 情感分类: 基于明确的文本证据,经人工验证的 LLM 分类器将帖子分配为正面、中性或负面类别。该分类器相对于人工多数标签实现了 0.82 的加权 F1 值。
  • 主题概念归纳: 通过改编 LLooM 框架,作者从语料库中归纳出 236 个可解释的“规范概念”(例如“编程生产力”、“预期差距”、“强制升级挫败感”)。这些概念根据纳入标准对帖子进行评分,从而实现对主题流行度的追踪,而不依赖于预定义的分类法。

3. 干预分析:

  • 窗口设计: 为每个模型发布定义了对称的发布前和发布后窗口,窗口长度基于供应商特定的发布间隔统计数据(从 DeepSeek 的 25 天到 Google 的 104 天不等)。
  • 增量计算: 研究计算了发布前和发布后窗口之间情感增量(正面/负面帖子份额的变化)和概念增量(概念流行度的变化)。使用卡方检验和带 Benjamini-Hochberg FDR 校正的两比例 z 检验来评估统计显著性。

核心结果

1. 长期情感趋势:

  • OpenAI 和 Google: 两者都表现出从中性向负面情感的长期转变。对于 OpenAI,中性情感下降了约 19 个百分点 (pp),而负面情感在观察期内上升了约 19 pp。
  • Anthropic: 脱颖而出,是唯一显示出积极趋势的供应商,其正面情感从约 20% 上升至 35%,负面情感显著下降。
  • Meta: 显示出从中性向正面的转变,而 xAI 和 DeepSeek 由于观察窗口较短或波动性较高,未显示出明确的长期方向性趋势。

2. 特定发布的动态:

  • Anthropic (Claude 4): 展示了最清晰的正向干预特征(正面 +5.3 pp,负面 -10.5 pp)。这由 “Claude Code” 的公开发布驱动,它使模型能力与用户工作流(编程/自动化)相匹配,将讨论从通用生产力转向了特定的编程生产力。
  • OpenAI (GPT-5): 引发了最强的负面转变(正面 -3.5 pp,负面 +10.3 pp)。这种反弹的特征是“强制升级挫败感”和“功能移除挫败感”,用户感到失去了“个人伴侣”,并经历了工作流的中断。
  • OpenAI (GPT-5.1): 显示出部分恢复,减少了反弹概念的量,但未能完全恢复热情,表明讨论已从平台层面的抗议转变为更窄的产品投诉。
  • DeepSeek R1: 造成了“需求冲击”,帖子量增加了 19 倍。情感评价褒贬不一:对工程能力的极高赞誉(“模型比较与评估”)与对访问、可靠性和审查问题的严重挫败感(“可靠性可用性挫败感”)并存。
  • xAI (Grok 3): 产生了分化的反应,正面和负面情感同时增加。讨论具有高度政治化特征,将模型性能与提供者的身份(Elon Musk)及政治议程联系起来,同时也存在标准的可靠性担忧。
  • OpenAI (GPT-4o): 以巨大的“预期差距”为特征(+19.4 pp)。用户对“全能 (omni)”演示能力(实时语音、视频)与发布时有限功能之间的差异做出了反应,由于访问限制而非模型质量本身,导致了混合的情感反应。

重要性与主张

本文主张,模型发布不仅是技术更新,更是“面向用户的干预措施”,它们重塑了公众讨论、情感和预期。研究表明:

  1. 感知是动态的: 静态快照是不够的;用户信任和情感对特定的干预类型(如强制升级 vs. 新功能可用性)高度敏感。
  2. 提供者身份至关重要: 发布的接受度深受提供者的品牌、政治立场以及与用户关系的影响(例如,对 GPT-4o 的“关系依恋” vs. 对 DeepSeek 的“工程崇拜”)。
  3. 产品-模型适配度是关键: 成功的发布(如 Claude 4)将技术能力与明确的用户工作流对齐,而失败往往源于预期失调(GPT-4o)或破坏了既有用户习惯的强制性改变(GPT-5)。

作者得出结论,提供者必须将发布视为重要的社会技术事件,将能力公告与实际访问权限对齐,在过渡期间保持模型的连续性,并随着时间的推移监测用户反应,而不是将接收情况视为一次性事件。

局限性

研究承认存在以下几点局限性:

  • 数据来源: 分析仅限于基于文本的 Reddit 帖子,排除了多媒体内容,并可能过度代表了技术参与度高的早期采用者。
  • AI 生成内容: 数据集可能包含 AI 生成或 AI 辅助的帖子,难以过滤。
  • 方法论约束: 使用 LLM 进行提取和分类可能会引入误差,且基于批次的语义归纳可能会引入冗余。
  • 窗口敏感性: 虽然鲁棒性检查显示了稳定性,但对称窗口的选择可能会平滑掉即时的、短暂的反应。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →