想象一下,互联网就像一座巨大且繁忙的图书馆,每一本书、每一篇文章和每一篇博客都是等待被阅读的信息碎片。多年来,“机器人”(特殊的计算机程序)一直是这个数字世界的图书管理员,静静地在书架间穿行,复制书籍,以便搜索引擎能帮助我们找到它们。但最近,一种新型的图书管理员来到了:人工智能(AI)机器人。这些机器人不仅仅是在寻找一本书,它们正试图同时阅读“一切”,以学习如何写作、回答问题以及与我们聊天。为了管理这一切,网站所有者可以在门口挂一个简单的、自愿性的标志,叫做 robots.txt。你可以把它想象成一个“禁止进入”或“请进”的告示牌。如果网站所有者在告示牌上写着“禁止 AI 进入”,礼貌的 AI 机器人理应听从并远离。但这里有一个大问题:所有的网站都会挂起这些告示牌吗?如果他们挂了,他们挂牌的原因是否相同?随着 AI 变得越来越聪明、功能越来越强大,了解谁在开门、谁在锁门变得至关重要,因为这决定了 AI 会从什么样的信息中学习。
这篇题为《误导性信息是否更加开放?》(Is Misinformation More Open?)的论文就像是一个数字侦探故事,调查了两类截然不同的网站如何处理这些针对 AI 的“禁止进入”告示。研究人员观察了两组对象:“声誉良好”的新闻网站(那些严肃、进行事实核查的记者)和“误导性信息”网站(那些传播虚假或误导性故事的地方)。他们想看看严肃的新闻机构是否比假新闻网站更擅长告诉 AI 机器人远离。
研究结果揭示了一个令人惊讶且鲜明的对比。研究人员发现,声誉良好的新闻网站更有可能为 AI 机器人挂起“禁止进入”的告示。事实上,60.0% 的这类值得信赖的网站在其 robots.txt 文件中明确告知至少一个 AI 爬虫不得进入。与之形成鲜明对比的是,只有 9.1% 的误导性信息网站也做了同样的操作。这就像是严肃的图书馆正在向新的 AI 学生锁上大门,而假新闻的小册子分发者却敞开着大门。平均而言,一家声誉良好的新闻网站列出了 15.5 个它不想让其访问的不同 AI 机器人,而误导性信息网站列出的数量甚至不足一个。
该研究还观察了这些网站是仅仅“写下”了规则,还是真正“执行”了这些规则。他们发现,声誉良好的新闻网站不仅写下了规则,还积极阻止试图潜入的 AI 机器人,使他们的行动与书面规则保持一致。误导性信息网站的表现则不太一致;虽然有些网站确实进行了拦截,但许多网站根本没有费心去写下这些规则。研究人员还观察了随时间变化的趋势,查看了从 2023 年 9 月 到 2025 年 5 月 的时间片段。他们看到,声誉良好的新闻网站正在迅速学会如何锁好大门,在短短几年内,屏蔽 AI 的网站比例从 23% 跳升至接近 60%。然而,误导性信息网站则保持着很大程度上的被动,很少更新它们的告示。
作者指出,这种日益扩大的差距创造了一种奇特的局面:随着“优质”来源开始通过锁门来保护其内容,AI 机器人可能会转而花更多时间阅读那些仍然敞开着的“糟糕”来源。这意味着 AI 可能会从误导性信息中学习到比从准确新闻中更多的东西,仅仅是因为误导性信息网站更容易获取。这篇论文并非声称这已经毁掉了 AI,但它强调了一个真实的风险:如果我们不关注谁在开门,AI 的未来可能会建立在虚假的基础之上。
技术摘要:误导性信息是否更加开放?关于互联网 robots.txt 门槛机制的研究
问题陈述
大语言模型(LLMs)日益依赖网络爬虫来更新其训练语料库,这一实践加剧了人们对数据质量和误导性信息摄入的担忧。虽然机器人排除协议(Robots Exclusion Protocol, REP)是网站所有者向自动化代理传达访问偏好的自愿机制,但目前尚不清楚不同类别的内容提供者——特别是声誉良好的新闻机构与误导性网站——如何利用 robots.txt 来管理 AI 爬虫。本研究旨在解决的核心问题是:这两类群体在配置访问控制方面是否存在差异,即是否存在一种不对称性,使得误导性内容比声誉良好的内容更容易被纳入 AI 训练数据。