← 最新论文
💻 computer science

Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web

这项研究揭示了网络把关机制中日益增长的不对称现象,即声誉良好的新闻网站正越来越多地通过 robots.txt 和主动措施拦截 AI 爬虫,而虚假信息网站则在很大程度上保持开放,这可能会使可用作大型语言模型训练的数据产生偏差。

原作者: Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicolas Steinacker-Olsztyn, Devashish Gosain, Ha Dao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一座巨大且繁忙的图书馆,每一本书、每一篇文章和每一篇博客都是等待被阅读的信息碎片。多年来,“机器人”(特殊的计算机程序)一直是这个数字世界的图书管理员,静静地在书架间穿行,复制书籍,以便搜索引擎能帮助我们找到它们。但最近,一种新型的图书管理员来到了:人工智能(AI)机器人。这些机器人不仅仅是在寻找一本书,它们正试图同时阅读“一切”,以学习如何写作、回答问题以及与我们聊天。为了管理这一切,网站所有者可以在门口挂一个简单的、自愿性的标志,叫做 robots.txt。你可以把它想象成一个“禁止进入”或“请进”的告示牌。如果网站所有者在告示牌上写着“禁止 AI 进入”,礼貌的 AI 机器人理应听从并远离。但这里有一个大问题:所有的网站都会挂起这些告示牌吗?如果他们挂了,他们挂牌的原因是否相同?随着 AI 变得越来越聪明、功能越来越强大,了解谁在开门、谁在锁门变得至关重要,因为这决定了 AI 会从什么样的信息中学习。

这篇题为《误导性信息是否更加开放?》(Is Misinformation More Open?)的论文就像是一个数字侦探故事,调查了两类截然不同的网站如何处理这些针对 AI 的“禁止进入”告示。研究人员观察了两组对象:“声誉良好”的新闻网站(那些严肃、进行事实核查的记者)和“误导性信息”网站(那些传播虚假或误导性故事的地方)。他们想看看严肃的新闻机构是否比假新闻网站更擅长告诉 AI 机器人远离。

研究结果揭示了一个令人惊讶且鲜明的对比。研究人员发现,声誉良好的新闻网站更有可能为 AI 机器人挂起“禁止进入”的告示。事实上,60.0% 的这类值得信赖的网站在其 robots.txt 文件中明确告知至少一个 AI 爬虫不得进入。与之形成鲜明对比的是,只有 9.1% 的误导性信息网站也做了同样的操作。这就像是严肃的图书馆正在向新的 AI 学生锁上大门,而假新闻的小册子分发者却敞开着大门。平均而言,一家声誉良好的新闻网站列出了 15.5 个它不想让其访问的不同 AI 机器人,而误导性信息网站列出的数量甚至不足一个。

该研究还观察了这些网站是仅仅“写下”了规则,还是真正“执行”了这些规则。他们发现,声誉良好的新闻网站不仅写下了规则,还积极阻止试图潜入的 AI 机器人,使他们的行动与书面规则保持一致。误导性信息网站的表现则不太一致;虽然有些网站确实进行了拦截,但许多网站根本没有费心去写下这些规则。研究人员还观察了随时间变化的趋势,查看了从 2023 年 9 月2025 年 5 月 的时间片段。他们看到,声誉良好的新闻网站正在迅速学会如何锁好大门,在短短几年内,屏蔽 AI 的网站比例从 23% 跳升至接近 60%。然而,误导性信息网站则保持着很大程度上的被动,很少更新它们的告示。

作者指出,这种日益扩大的差距创造了一种奇特的局面:随着“优质”来源开始通过锁门来保护其内容,AI 机器人可能会转而花更多时间阅读那些仍然敞开着的“糟糕”来源。这意味着 AI 可能会从误导性信息中学习到比从准确新闻中更多的东西,仅仅是因为误导性信息网站更容易获取。这篇论文并非声称这已经毁掉了 AI,但它强调了一个真实的风险:如果我们不关注谁在开门,AI 的未来可能会建立在虚假的基础之上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →