← 最新论文
🤖 AI

Whose Agent Are You? Multi-Layer Fingerprinting and Attribution of Autonomous Web Agents

本文通过引入一种结合网络与浏览器交互特征的多层指纹识别框架,提出了一种针对无差别 AI 网络智能体抓取的鲁棒且具备抗规避能力的防御机制,从而在区分自主智能体、人类及传统爬虫方面达到了 97% 的准确率。

原作者: Dayeon Kang, Hyejun Jeong, Jade Sheffey, Pubali Datta, Amir Houmansadr

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Dayeon Kang, Hyejun Jeong, Jade Sheffey, Pubali Datta, Amir Houmansadr

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大且繁忙的图书馆。多年来,图书管理员(网站所有者)一直依赖一个简单的“禁止入内”标志(称为 robots.txt)来告诉自动化机器人远离某些书籍。此外,他们还配备了保安,通过查看身份证件来识别机器人。

但最近,一种新型访客来到了这里:AI 网络智能体(AI Web Agents)。这些不仅仅是扫描文本的简单机器人,它们更像是聪明的、自主的购物者,能够点击按钮、填写表单、滚动页面,并像人类一样做出决策。问题在于,它们非常擅长伪装成人类,并且正在无视那些“禁止入内”的标志,抓取它们不该看到的内容。

你提供的论文 《你是谁的智能体?》("Whose Agent Are You?") 介绍了一种捕捉这些聪明购物者的新方法。作者构建了一个名为 MARK(多层智能体指纹框架)的系统,它就像一个超级侦探。MARK 不仅仅是检查身份证,它还会观察访客如何移动、如何与图书馆交流,以及如何与书架进行交互。

以下是该系统的运作方式,通过简单的类比进行拆解:

1. 设置:“陷阱”图书馆

研究人员构建了一个特殊的、受控的网站(他们的“测试平台”),其中设计了五个特定的谜题,旨在让这些 AI 智能体出错或暴露身份。

  • 假按钮: 一些按钮看起来是真的,但点击后没有任何反应。
  • 隐藏按钮: 只有当鼠标悬停在特定位置时才会出现的按钮。
  • 延迟反应: 一个需要几秒钟才能做出响应的按钮。
  • 混乱标签: 一个按钮的文字写着“是”,但底层的计算机代码却是“否”。

他们邀请了六种不同类型的 AI 智能体(如 AutoGen、Skyvern、Claude、Gemini 和 OpenAI 的 Operator)来参观这个图书馆并解决这些谜题。他们还邀请了真实的人类和旧式的、低级的机器人(传统爬虫)来观察它们的行为差异。

2. 侦探工作:四层线索

MARK 系统并不只观察单一维度;它从四个不同的角度观察访客,就像一个拥有四个摄像头的侦探:

  • 第一层:时机(“节奏”摄像头)

    • 观察内容: 访客在点击一个页面与下一个页面之间等待了多久?
    • 线索: 人类和某些 AI 智能体会进行“思考时间”。而另一些则非常机械化,点击速度极快。有些智能体非常一致(像节拍器一样),而另一些则显得杂乱无章。
    • 类比: 想象一场比赛。有些跑步者以完美的间隔冲刺;而另一些则慢跑、停下来系鞋带,然后再冲刺。步行的节奏揭示了他们的身份。
  • 第二层:握手(“TLS”摄像头)

    • 观察内容: 当访客连接到网站时,他们会进行“握手”(一个被称为 TLS 握手的技术过程)以商定安全规则。
    • 线索: 每个浏览器和机器人都有略微不同的握手方式。这就像是一种独特的握手风格。
    • 类比: 如果你在派对上遇到某人,你可能会进行正常的握手。但机器人可能会用特定的力度握手,或者不同的浏览器可能会使用“击掌”代替。研究人员发现,一个智能体(Skyvern)拥有 17 条特定规则的独特“握手”方式,而其他智能体使用了 16 条。另一个智能体(Operator)是唯一使用“Firefox”握手风格的,而其他所有人使用的都是“Chrome”。
  • 第三层:对话(“HTTP”摄像头)

    • 观察内容: 访客随请求发送的标签和注释(例如“我正在寻找图像”或“我在这个页面上”)。
    • 线索: 真实的人类在与网站交流时遵循严格的语法规则。AI 智能体经常犯错或使用奇怪、不一致的语法,因为它们是自动拼凑信息的。
    • 类比: 想象点咖啡。人类会说:“我想喝一杯拿铁。”而 AI 智能体可能会说:“我想喝一杯拿铁……但同时,我是一个机器人,我的订单是为了脚本准备的。”一个智能体(Browser Use)被 100% 抓获,因为它发送了一个对于真人来说逻辑上不可能实现的请求(比如一边说“我正在查看一张图片”,一边又说“我不在一个网站上”)。
  • 第四层:行为(“鼠标与键盘”摄像头)

    • 观察内容: 访客如何移动鼠标、打字或滚动。
    • 线索: 人类的鼠标移动是平滑的曲线。一些 AI 智能体只是从 A 点跳到 B 点。另一些则试图模仿人类,结果却产生了奇怪的、过长的循环移动。
    • 类比: 如果你观察某人画圆,人类画的是平滑的曲线。机器人可能会画一个锯齿状的正方形,然后试图将其平滑化。另一个智能体(Skyvern)被抓获是因为它的鼠标移动路径极其漫长且蜿蜒,试图表现得太像人类;而另一个智能体(AutoGen)几乎不动鼠标,只是瞬间完成点击。

3. 判决:整合线索

研究人员将所有这些线索输入到一个“决策树”(一个通过一系列是/否问题进行判断的简单计算机程序)中。

  • 结果: 通过结合所有四个层级的线索,该系统能够精确识别出访问者是哪种 AI 智能体,或者是人类或旧式机器人,准确率达到了 97%
  • 缺陷: 如果他们只观察一个层面(例如仅看时机),有时会被搞混。例如,两个不同的 AI 智能体(Claude 和 Gemini)在握手(第二层)和对话(第三层)时看起来几乎完全一样。但当系统观察它们的鼠标移动方式(第四层)时,就能将它们区分开来!

为什么这很重要

论文得出结论,我们不能再仅仅依赖“禁止入内”的标志或简单的身份检查了。AI 智能体太聪明,也太擅长伪装了。然而,由于它们是基于不同的软件“大脑”和“身体”构建的,它们会留下独特的数字足迹。

通过观察它们如何移动、如何连接、说什么以及何时行动,网站所有者终于可以分辨出访客是人类、有益的机器人,还是可能正在窃取内容的 AI 智能体。这就像是通过一个人走路的特定姿态、脚步声的独特节奏以及拿钥匙时古怪的方式,来识别一名小偷,而不仅仅是看他的脸。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →