想象一下,你请四位非常聪明、见多识广的图书管理员(ChatGPT、Copilot、Gemini 和 Perplexity)回答一个关于政治、健康或环境的问题。他们并没有直接给你答案,而是说:“这是答案,这是我们要写这个答案所阅读的 10 本书。”
本文是对这些“书籍”(即它们引用的网站)进行的一项审计,旨在查明其中是否有任何一本实际上是由伪装成人类的机器人撰写的。
以下是研究人员发现的详细情况,使用了简单的类比:
1. 背景设定:互联网的“图书馆”
研究人员将这些 AI 搜索引擎视为一种新型图书馆。他们向四个不同的 AI 引擎提出了 712 个真实问题(涉及诸如“这种饮食安全吗?”或“最新的政治丑闻是什么?”之类的内容)。
这些引擎在给出答案的同时,提供了一份链接列表(引用),以证明其信息来源。随后,研究人员访问了这些链接,阅读了内容,并将其送入“测谎仪”(一款名为 Pangram 的 AI 检测工具),以判断文本是由人类撰写还是由另一款 AI 生成的。
2. 重大发现:图书馆里的“机器人幽灵”
主要发现是,这些图书管理员所引用的“书籍”中,约有 16% 实际上是由机器人撰写的。
- 比喻:想象你去图书馆找一本历史书。你从书架上取下一本,翻开一看,发现作者是一台机器,它在几秒钟内写完了整本书。当你拿起它时,你并不知道这一点。
- 现实:在这项研究中,AI 引擎引用的来源中,大约每 6 个就有 1 个是 AI 生成的内容。
- 最严重的违规者:AI 引擎 Copilot 最有可能引用这些由机器人撰写的来源(其近 30% 的引用是 AI 生成的)。ChatGPT 最为谨慎,但仍有约 7% 的引用属于此类。
3. “长尾”问题:大众与 VIP
研究人员注意到 AI 引擎喜欢引用哪些网站存在一种奇怪的模式。
- VIP(头部):一小群著名且可信的网站(如维基百科、像
whitehouse.gov 这样的政府网站以及主要新闻媒体)被反复引用。它们是图书馆里的"VIP"。
- 长尾:然而,绝大多数引用来自“长尾”——成千上万个鲜为人知、极少被访问的网站。这些鲜为人知的网站中,大多数仅被引用了一两次。
- 发现:“机器人撰写”的内容主要隐藏在这个长尾中。那些著名的 VIP 网站大多是人类撰写的,而那些鲜为人知、昙花一现的网站则充斥着 AI 生成的文本。
- 类比:这就像在一个聚会上,主人(AI)不停地把你介绍给同样的 5 位名人(维基百科、政府网站),但却花了 80% 的时间把你介绍给房间后部的 1000 个陌生人,其中许多实际上是假装成人的模特(AI 内容)。
4. 主题细分
研究人员检查了三个特定领域:
- 环境:该主题被引用的 AI 生成来源数量最多。
- 健康:相当一部分健康建议来源也是 AI 生成的。
- 政治:也包含 AI 来源,但略少于前两个领域。
5. 为何这很重要(根据论文观点)
论文认为这很危险,原因如下:
- “信任”陷阱:当 AI 给你一个答案并展示一系列链接时,你会假设这些链接是真实的、经人类核实的事实。如果这些链接实际上是 AI 生成的,那么 AI 本质上是在引用它自己的“幻觉”或低质量的机器人文本,以此作为其答案的证明。
- 质量差距:虽然并非所有 AI 文本都是坏的,但论文指出,AI 文本可能包含错误、偏见或捏造的事实。如果 AI 搜索引擎使用 AI 撰写的来源来构建其答案,就会形成一个“纸牌屋”,其基础是不稳固的。
- “黑箱”:这些引擎不会告诉你:“嘿,这个来源是由机器人撰写的。”它们只是向你展示链接。
总结
该论文得出结论,这些新的“生成式搜索引擎”目前的表现就像是一些图书管理员,他们有时会无意中引用由机器人撰写的书籍,却未告知读者。它们严重依赖少数几个著名网站,但同时也从“长尾”中的无数鲜为人知的网站中提取了大量信息,其中许多网站充斥着 AI 生成的内容。
研究人员表示,这是一个警告信号:如果我们不解决这些引擎选择和核查来源的方式,用户可能会在不知情的情况下信任完全由合成生成的信息。
技术摘要:审计生成式搜索引擎引用中的 AI 生成来源证据
问题陈述
生成式搜索引擎(GSEs)——如 ChatGPT、Copilot、Gemini 和 Perplexity 等能够综合网络信息以回答用户查询的对话式界面——的普及已彻底改变了信息检索方式。然而,这些系统在其来源机制方面的不透明性引发了严重关切。具体而言,存在 GSEs 可能将 AI 生成内容引用为权威来源的风险。鉴于 AI 生成内容可能存在幻觉、偏见和错误,且网络正日益被此类内容(常被称为"AI 垃圾”)所充斥,用户可能在不知情的情况下消费低质量或误导性信息,尤其是在政治、健康和环境等高利害领域。本研究解决的核心问题是:缺乏关于主要 GSEs 引用池中 AI 生成来源普遍性的实证证据,以及这些引擎在过滤此类来源方面的可靠性。
方法论
本研究采用社会技术审计方法,评估了四种主流的 GSEs:ChatGPT(启用网络搜索功能)、Copilot、Gemini 和 Perplexity。
1. 数据整理与查询选择:
- 源数据集: 研究人员整理了一个包含 712 个真实世界、单轮、英语查询的样本。
- 政治与健康: 432 个查询源自Search Arena数据集(Miroyan 等人,2025),经筛选后仅保留信息性意图且与美国语境相关的查询。
- 环境: 280 个查询取自Climate Q&A数据集(De La Calzada 等人,2024),经筛选后仅保留英语且与美国相关的查询。
- 主题: 查询涵盖三个具有公共重要性的领域:政治、健康和环境。
2. 数据收集(网络爬虫):
- 使用基于 Playwright 的自定义 Python 爬虫模拟用户交互,向 GSEs 提交查询。
- 系统捕获生成的回复并提取所有文内引用(URL)。
- 研究在四种引擎中共收集了 26,266 个唯一来源 URL。
- 从 19,154 个 URL(占 72.9%)中抓取了内容;其余因非文本格式(PDF、图像)或无法访问而被排除。
3. AI 内容检测:
- 评估工具: 将两种检测工具(Pangram 和 GPTZero)与一组经过整理的人类撰写文本(来自 RAID 基准)和已知 AI 生成文本进行基准测试。
- 工具选择: 选择 Pangram 作为主要分析工具。虽然两种工具在基准测试中均显示出高准确率,但 Pangram 因其在假阴性方面采取保守态度而被选中,这符合本研究旨在确立 AI 生成内容普遍性下限的目标。
- 分类标准: 如果工具预测文本为“极可能是 AI"或“可能是 AI",则将其分类为"AI 生成”。模糊类别(“混合”或“可能是 AI")被排除以避免夸大估计,但若“混合”实例的综合得分超过人类置信度阈值,则对其进行重新评估。
4. 分析:
- 本研究分析了被引用来源域名的分布、引用的集中度(使用基尼指数),以及跨提供商和主题的 AI 生成内容比例。
主要结果
1. AI 生成来源的普遍性:
- 约16%(在成功抓取的 19,154 个来源中,有 3,056 个)的唯一被引用来源被识别为 AI 生成。
- 这一普遍性因提供商而异:
- Copilot: 27.8% 的被引用来源为 AI 生成。
- Gemini: 14.7%。
- Perplexity: 9.4%。
- ChatGPT: 7.3%。
- 主题差异: AI 生成来源在与环境相关的查询回复中最为普遍(占总引用的 13.3%),其次是健康(该类别引用中的 16.3%)和政治(11.1%)。
2. 引用模式与集中度:
- 长尾分布: 引用分布不均(基尼指数 = 0.68)。少数域名被反复引用(即“头部”),而绝大多数(59.1%)仅被引用一次。
- 顶级域名: 引用次数最多的前 25 个域名占所有引用的 23.8%。维基百科是单一被引用最多的域名(占前 25 名的 15.2%)。政府网站 collectively 占前 25 名的 33.0%,而社交媒体(Reddit、YouTube)占 8.8%。
- AI 生成来源分布: 16% 的 AI 生成来源主要分布在分布的“长尾”中。前 25 个域名仅占 AI 生成来源的 2.9%,而 97.1% 的 AI 生成来源来自其余较少被引用的域名。
- 特定域名: 研究识别出一些 AI 生成内容高度集中的特定域名,包括利基环境和健康网站(例如 sustainability-directory.com 的变体、factually.co),以及政府和政府间网站(例如 pmc.ncbi.nlm.nih.gov、earth.gov)。
3. 引用缺口:
- 约 8.8% 的回复完全没有引用。这在健康相关查询中最为常见(11.6%),表明在这些情况下,系统更依赖大语言模型的内部知识而非外部网络来源。
主要贡献
- AI 生成引用的实证证据: 这项工作提供了首次系统性审计,证明主要 GSEs 频繁将 AI 生成内容作为来源引用,其普遍性约为每六个被引用来源中就有一个。
- 绘制来源生态系统图谱: 本研究绘制了 GSEs 的引用景观,揭示了其对少数高频域名(政府、维基百科)的严重依赖,同时也存在大量极少被引用的长尾域名,其中许多包含 AI 生成内容。
- 提供商差异: 审计突显了各提供商在来源实践方面的显著差异,其中 Copilot 在所有主题中引用 AI 生成来源的比例最高。
- 方法论框架: 本文建立了一个利用网络爬虫和 AI 检测工具审计 GSEs 引用的流程,为未来的信息质量研究提供了可复制的方法。
意义与主张
本文将此项工作定位为理解生成式搜索引擎所构成风险的初步步骤。作者声称其发现:
- 揭示可靠性局限: 证明 GSEs 目前无法可靠地排除合成来源,特别是在健康和政治等高利害领域。
- 为治理提供信息: 识别特定网络域名和 AI 生成内容的普遍性,可为开发人员和风险评估人员提供信息,以改进来源管理策略,例如过滤或标记 AI 生成引用。
- 提高意识: 结果强调了公众需要了解这些系统的局限性,以及虚假信息可能以权威引用的名义传播的潜在风险。
- 建立基准: 研究结果为未来追踪 AI 生成内容在线普及及其整合进信息检索系统提供了基准。
作者保持谦逊的语气,承认了局限性,例如依赖单一检测工具(Pangram)、排除非文本模态(视频、图像),以及专注于以美国为中心的查询。他们强调,报告的 16% 这一数字应被视为下限,且官方政府网站上出现 AI 生成内容的现象,需要进一步调查这些实例究竟反映的是高质量还是低质量的合成内容。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。