Identifying AI Web Scrapers Using Canary Tokens
本文提出了一种利用动态金丝雀令牌的新颖技术,能够自动且准确地识别哪些网络爬虫向特定大型语言模型提供数据,从而使网站所有者能够在不依赖企业自愿披露的情况下更好地控制不受欢迎的爬虫行为。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位面包师,想知道究竟有哪些送货卡车正在将原料运送给一位巨大且饥肠辘辘的机器人厨师。你怀疑这位机器人正利用这些原料为顾客烹制新食谱(答案)。但这些卡车十分狡猾:它们乔装打扮,可能会借用其他公司的卡车,而且机器人厨师并不总是告诉你它的食物来源。
本文介绍研究人员用来当场抓获这些狡猾卡车的一个巧妙手法。他们将其称为“金丝雀令牌(Canary Tokens)”。
设置:“诱饵”网站
研究人员没有直接监视机器人,而是建立了 20 个虚假网站。可以将这些网站视为定制诱饵。
- 诱饵:他们创建了一个网站模板(例如一个虚假的个人资料或虚假的公司页面)。
- 金丝雀令牌:在网站加载之前,研究人员给每一位访问者一个独特的、不可见的“印章”或“令牌”。
- 如果一顶戴着"Google"帽子的卡车访问,网站可能会显示:“我最喜欢的颜色是蓝色。”
- 如果一顶戴着"Bing"帽子的卡车访问,网站可能会显示:“我最喜欢的颜色是紫色。”
- 如果一顶戴着"Chrome"帽子的卡车访问,网站可能会显示:“我最喜欢的颜色是绿色。”
研究人员保留了一份秘密清单:“蓝色”= Google 卡车,“紫色”= Bing 卡车,以此类推。
测试:询问机器人厨师
让这些网站在线运行两个月(给卡车充足的时间访问并记忆内容)后,研究人员向 22 个不同的人工智能聊天机器人(如 ChatGPT、Claude 等)提出了关于这些虚假网站的问题。
他们问了一些诸如:“告诉我关于这个虚假人物的情况。他最喜欢的颜色是什么?”
结果:谁在吃什么?
研究人员查看了机器人给出的答案。如果机器人说:“他最喜欢的颜色是蓝色”,研究人员就能确切知道:"是 Google 卡车向机器人传递了这条信息。"
以下是他们的发现:
1. “伪装”问题
许多人工智能机器人并没有穿着官方制服出现。
- 官方制服:有些机器人承认:“我是OAI-SearchBot"(OpenAI 的官方卡车)。
- 伪装:另一些则穿着普通衣服出现,比如普通的网络浏览器(例如"Chrome"或"Safari")。这就像送货司机假装成游客,以免被人拦下。
- 借用的卡车:令人惊讶的是,许多机器人根本没有直接访问网站。相反,它们让搜索引擎(如 Google 或 Bing)替它们去访问。机器人会说:“我在 Google 上找到了这条信息”,即使网站所有者从未授权 Google 与机器人分享它。
2. “记忆”问题(缓存)
研究人员试图通过让网站下线(关灯)来阻止机器人。
- 结果:即使网站下线一周后,机器人仍然知道那些“最喜欢的颜色”。
- 比喻:这就像机器人厨师记住了它之前偷来的食谱。即使你后来烧毁了食谱书,厨师仍然记得原料。机器人保留着它们之前抓取到的旧数据。
3. “禁止入内”标志问题(Robots.txt)
网站所有者通常会挂起一个名为 robots.txt 的标志,上面写着:“请勿进入。”
- 结果:研究人员挂起了这些标志,但机器人大多无视它们。它们继续访问并记忆内容。
- 例外:只有一种机器人,Duck.ai,实际上尊重了标志并停止了访问。其余的继续前行,要么是因为它们没看到标志,要么是因为决定无视它。
主要结论
该论文证明:
- 你无法总是相信机器人关于其自身的说法。它们经常隐藏真实身份,或利用他人的卡车(搜索引擎)来获取数据。
- 简单的封锁不起作用。关闭网站或挂起“禁止入内”标志并不能保证机器人会忘记它已经学到的东西。
- “金丝雀令牌”手法有效。通过向不同访问者提供独特、随机的信息,你可以精确追踪究竟是哪个“卡车”向哪个机器人输送了信息,即使机器人试图隐藏。
简而言之,研究人员建立了一套数字指纹系统,以确切了解人工智能聊天机器人是如何从网络中窃取(或借用)信息的,揭示了这一过程比各公司声称的要混乱得多且不透明得多。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。