想象一下,美国报业就像一间拥有 1500 家不同餐厅的庞大、繁忙的厨房,从微小的家庭经营小馆到巨大的知名五星级连锁餐厅,无所不包。最近,一个研究团队决定对这家厨房里供应的“食物”进行品尝测试,看看其中有多少是由厨师(人类)烹制的,又有多少是由高科技机器人(人工智能)准备的。
以下是他们发现的简要说明:
1. “机器人厨师”已进驻厨房
研究人员查看了 2025 年夏季发布的 186,000 篇文章。他们使用了一种名为Pangram的极其敏锐的“品尝测试”工具(将其想象为一位超级聪明的食品检查员),来检查文章是由人类还是机器撰写的。
- 结果: 大约每 100 篇文章中就有 9 篇得到了机器人的协助。有些文章完全由机器人“烹制”,而另一些则是“混合”菜肴,即人类厨师在机器人的基础食谱上添加了最后的调味。
- 令人惊讶的是: 机器人不仅仅存在于高档餐厅。事实上,它在小型本地小馆(地方报纸)中的普及程度远高于大型知名连锁餐厅(全国性报纸)。此外,它更多地出现在天气预报、科学和技术等特定的“菜单项目”中,而在战争或犯罪等严肃话题中则较少出现。
2. “观点专栏”是机器人的热点区域
研究人员还审视了美国三大报纸——《纽约时报》、《华盛顿邮报》和《华尔街日报》——的“观点”版面。
- 结果: 观点文章获得机器人协助的可能性是普通新闻报道的6.4 倍。
- 谁在使用它? 不仅仅是专职撰稿人在使用。许多这些由机器人协助撰写的观点文章出自客座明星之手——包括诺贝尔奖得主、参议员、州长和首席执行官等名人。
- 趋势: 在 2022 年人工智能大爆发之前,几乎没有人将其用于观点写作。到了 2025 年,这一数字显著上升。
3. “无标签”问题
这里存在最大的问题:没有人告诉你。
- 秘密: 研究人员人工检查了 200 篇被机器人检查员标记为人工智能撰写的文章。
- 96.5% 的作者只字未提使用了人工智能。
- 94% 的报纸没有张贴任何告示说明“嘿,这篇文章有机器人协助撰写”。
- 类比: 想象你去一家餐厅点了一份牛排,厨师端给你一盘菜。你不知道这是真正的牛排还是高科技肉类替代品。餐厅没有告诉你。你就这样吃下去了。这些新闻文章的情况正是如此。
4. “虚假食材”的风险
当研究人员仔细查看机器人撰写的文章时,他们发现了大量的幻觉。在人工智能领域,“幻觉”是指机器人自信地谈论一些根本不存在的事情。
- 统计数据: 与人类撰写的新闻相比,被标记为人工智能生成的文章包含虚假事实(如错误的日期、杜撰的引语或不正确的统计数据)的可能性高出8.2 倍。
- 危险: 由于这些文章通常不说明是由机器人撰写的,且包含更多错误,读者可能会在不知情的情况下相信虚假信息。
5. 为什么机器人在小城镇无处不在
研究发现,机器人在小城镇以及非英语语言中最为流行。
- 小城镇: 小报纸通常员工极少。由于时间和资金短缺,它们可能利用机器人来协助撰写天气预报或本地体育比分。
- 其他语言: 西班牙语、葡萄牙语和越南语的文章中,机器人协助的比例(31%)远高于英语文章(8%)。这表明翻译工具或自动化写作正被大量用于服务这些社区。
核心结论
该研究报告得出结论:人工智能已经成为美国新闻业的重要组成部分,但其使用分布不均且隐秘。
- 并非全是坏事: 使用机器人检查语法或撰写简单的天气预报,就像使用计算器一样,可以有所帮助。
- 问题所在: 当机器人撰写复杂的故事或观点文章,而无人告知读者时,这就破坏了报纸与读者之间的信任。这就像魔术师隐藏了他们的戏法;一旦观众发现戏法是由机器完成的却未被告知,他们就会停止信任这场表演。
研究人员呼吁报纸开始在它们的“菜单”上张贴“机器人协助”的标识,以便读者确切知道自己消费的是什么。
以下是论文《美国报纸中人工智能的使用广泛、不均衡且鲜少披露》的详细技术摘要。
1. 问题陈述
大型语言模型(LLMs)迅速融入新闻业,造成了显著的透明度缺口。虽然人工智能工具在起草、编辑和内容生成方面的使用日益增加,但其在已发布新闻中的采用程度仍不明确。这种缺乏披露的情况对以下方面构成风险:
- 公众信任:读者往往不知道内容是人工撰写还是人工智能辅助。
- 事实准确性:人工智能模型容易产生“幻觉”(捏造事实),若未经严格核查,可能传播错误信息。
- 道德标准:新闻编辑室缺乏关于人工智能署名的明确政策,使得问责变得复杂。
本文旨在量化美国报纸中人工智能生成内容的普遍程度,分析其在不同媒体类型(地方与国家、新闻与观点)中的分布情况,并评估披露率及事实可靠性。
2. 方法论
数据集
作者构建了两个主要数据集,共计 231,310 篇文章:
recent_news(186,507 篇文章):来自 1,528 家美国地方和全国性报纸的广泛样本,发表于 2025 年 6 月至 9 月。该数据集涵盖了不同的所有权集团、发行规模和主题。
opinions(44,803 篇文章):针对三大全国性媒体(《纽约时报》、《华盛顿邮报》和《华尔街日报》)的意见专栏文章进行的定向样本,发表于 2022 年 8 月至 2025 年 9 月。
ai_reporters(20,132 篇文章):一个纵向数据集,追踪了 10 位资深记者,他们在 ChatGPT 发布前后(2022 年 11 月)均有发表文章,用于分析随时间推移的采用趋势。
检测工具
本研究使用了 Pangram(v2.0),这是由 Pangram Labs 开发的尖端人工智能文本检测器。
- 标签:文章被分类为三类:
HUMAN-WRITTEN(人工撰写)、MIXED(部分人工智能)和 AI-GENERATED(人工智能生成)。
- 准确性:Pangram 在新闻文本上的假阳性率(FPR)约为 0.001%。作者通过与 GPTZero 交叉验证进行了核实,观察到 88.2% 的一致率(Cohen's κ = 0.764)。
- 免责声明:作者明确指出,这些是检测器的输出结果,并非署名的确凿证据,也不归咎于特定记者的意图或不当行为。
分析流程
- 主题分类:文章使用 IPTC Media Topics 分类法标记了 19 个主题,通过 QWEN3-8B 模型(零样本提示)分配。
- 元数据链接:将报纸与发行量数据(来自美国新闻荒漠数据库)和所有权信息(来自 Medill 地方新闻倡议)进行链接。
- 人工审计:
- 披露审计:人工审查 200 篇被标记为人工智能的文章,以检查是否披露了人工智能使用情况。
- 事实性审计:人工审查 100 篇被标记为人工智能的文章与 100 篇被标记为人工的文章,以识别幻觉(如捏造的引语、错误的统计数据等)。
- 机器翻译(MT)分析:将 300 篇英文文章翻译成 12 种语言,以确定非英文文本中较高的人工智能检测率是否是机器翻译的产物。
3. 主要结果
人工智能使用的普遍性
- 总体比率:在
recent_news 数据集中,约 9.1% 的文章被标记为 MIXED(3.98%)或 AI-GENERATED(5.24%)。
- 观点与新闻:在主要全国性报纸中,意见专栏文章包含人工智能内容的可能性是标准新闻文章的 6.4 倍(4.56% 对比 0.71%)。
- 时间趋势:意见专栏中的人工智能使用量从 2022 年(0.1%)到 2025 年(3.4%)激增了 25 倍。在
ai_reporters 队列中,人工智能使用量从 2023 年之前的约 0% 跃升至 2025 年的 40.4%。
分布不均
人工智能的采用在多个维度上表现出高度异质性:
- 发行规模:小型地方媒体(发行量<10 万)的人工智能使用率(9.3%)显著高于大型全国性报纸(>10 万,1.7%)。
- 所有权:采用率因媒体集团而异。Boone Newsmedia 和 Advance Publications 显示出高采用率(>15%),而 Nash Holdings 和 Hearst 的采用率则低于 1%。
- 主题:
- 高使用率:天气(27.7% 的人工智能可能性)、科学/技术(16.1%)和健康(11.7%)。
- 低使用率:冲突/战争(4.3%)、犯罪/法律(5.2%)和宗教(5.3%)。
- 语言:非英文文章的人工智能使用率为 31.0%,而英文文章为 8.0%。然而,实验表明机器翻译会抑制人工智能检测分数,这意味着非英文文章的高比率是一种真实的采用趋势(可能由翻译/自动化工具驱动),而非检测伪影。
透明度与披露
- 缺乏披露:在对 200 篇被标记为人工智能的文章进行人工审计中,96.5% 的作者和 94.0% 的出版商未披露人工智能的使用情况。
- 政策缺口:在 200 个抽样媒体中,仅有 12 家拥有任何关于人工智能使用的公开政策;186 家没有任何公开政策。
事实可靠性
- 幻觉:被标记为人工智能生成的文章包含幻觉的可能性是人工撰写文章的 8.2 倍。
- 比率:41% 的人工智能标记文章包含至少一项幻觉声明(例如捏造的引语、错误的统计数据、错误的日期),而人工标记文章中这一比例仅为 5%。
典型案例
- 完全人工智能生成的媒体:一家名为 Argonaut 的媒体被识别为完全由人工智能生成的报纸,没有人类员工。
- 建议专栏:检测到人工智能在热门建议专栏(如 Dear Annie)中生成回复,这可能背叛了读者的信任。
- 客座贡献者:知名人物(参议员、首席执行官、诺贝尔奖得主)是人工智能标记意见专栏的频繁作者,通常未进行披露。
4. 主要贡献
- 首次大规模审计:这是第一项全面审计约 25 万篇美国报纸文章以检测人工智能内容的研究,为行业提供了基准。
- 细致入微的洞察:按所有权、发行量、主题和语言对人工智能使用情况进行详细细分,揭示出人工智能并非单一趋势,而是因经济和编辑约束而异。
- 事实性分析:提供了经验证据,将人工智能标记内容与显著更高的事实错误率(幻觉)联系起来。
- 披露缺口:量化了行业透明度近乎完全缺失的情况(96.5% 未披露)。
- 开放资源:发布数据集(仅元数据)、分析代码以及用于未来监测的交互式仪表板(
ainewsaudit.github.io)。
5. 意义与影响
该论文突显了新闻诚信面临的紧迫危机。新闻中广泛且未披露的人工智能使用——特别是在意见专栏和地方报道中——威胁着公众信任和信息的准确性。
- 对于读者:无法区分人工与人工智能内容,削弱了评估可信度的能力。
- 对于新闻编辑室:人工智能内容中高发的幻觉表明,当前的编辑工作流程不足以验证人工智能生成的文本。
- 政策建议:作者提出:
- 明确的编辑标准:界定可接受的人工智能使用(如语法检查)与禁止的使用(完全生成)。
- 强制披露:要求对混合或人工智能生成的内容添加明确标签。
- 客座贡献者声明:要求外部作者在提交时披露人工智能的使用情况。
研究结论指出,如果没有更新的编辑标准和透明度,随着人工智能采用的加速,第四权力的可信度将面临风险。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。