想象互联网是一座巨大而繁忙的城市。多年来,警察(网站所有者)一直在试图识别四处游荡的“机器人”(bots)。通常,机器人很容易被抓到,因为它们行动僵硬,如同机械士兵:它们不眨眼,走直线,穿着千篇一律的制服。
但现在,一种新型机器人出现了:AI 浏览代理。它们就像被赋予了人类大脑的机器人。它们能在真实的浏览器中运行,点击按钮,填写表单,甚至“思考”下一步该做什么。它们的外观和行为如此像人类,以至于旧有的警察手段已无法将它们区分开来。
这篇题为**"FP-Agent"**的论文,就像一种新的侦查技术。研究人员问道:“如果这些 AI 代理如此擅长伪装成人类,我们是否还能通过观察它们移动和输入的微小、不可见的细节来识破它们?”
以下是他们发现的简单解释:
1. “制服”问题(浏览器指纹)
想象每台电脑都拥有一张独特的身份证,称为“浏览器指纹”。它列出了屏幕尺寸、操作系统和字体等信息。
- 发现:研究人员试图仅通过查看这些“身份证”来识别 AI 代理。效果并不理想。
- 类比:这就像试图通过检查护照来抓捕一群间谍。如果五名不同的间谍都使用云端服务器中同一台“间谍机构”的电脑,那么他们手中的护照完全相同。你无法区分他们,甚至无法将他们与恰好使用同类型电脑的人类区分开来。单靠“身份证”是不够的。
2. “动作”线索(行为指纹)
既然“身份证”无用,研究人员开始观察代理们如何移动。正是在这里,他们找到了确凿证据。尽管 AI 代理很聪明,但它们的移动方式与人类不同。
输入:
- 人类:我们打字有节奏。我们会停顿、犹豫,有时会按退格键修正错误,手指的移动速度也各不相同。
- AI 代理:它们要么完美得诡异,要么机械得怪异。有些直接“粘贴”整块文本,瞬间完成(就像魔术师从帽子里变出兔子)。另一些则以机械且不变的节奏打字。其中一个代理(Skyvern)甚至有个奇怪的习惯:打出一句话,全部删除,然后再重新输入,仿佛它在尝试不同选项后才做决定。
- 比喻:人类打字就像爵士乐手即兴演奏——充满停顿、速度变化和细微失误。而 AI 打字则像节拍器或打印机——要么完美稳定,要么瞬间从开始跳到结束。
滚动:
- 人类:我们滚动页面很流畅。我们平滑地向下浏览,可能会停下来查看某些内容,然后继续滑动。
- AI 代理:它们不会“滑动”。它们会“瞬移”。它们确切知道下一个按钮的位置,因此屏幕会瞬间跳转到那个位置。这就像视频游戏角色使用“快速旅行”作弊码,而不是步行前往。
鼠标移动:
- 人类:当我们移动鼠标时,会画出一条曲线。我们的手以平滑的弧线移动。
- AI 代理:它们根本不移动鼠标。它们只是将光标直接“ snap(弹跳)”到想要点击的按钮上。这就像鸟儿瞬间落在树枝上,而不是人类一步步走近它。
3. 新的侦探工具:FP-Agent
研究人员开发了一种名为FP-Agent的新工具。把它想象成一位超级聪明的保安,它不仅检查你的“身份证”,还会观察你的步态、打字风格和手部动作。
- 结果:当他们对 7 种不同的 AI 代理和真实人类进行测试时,该工具的准确率极高。它不仅能区分人类和 AI,甚至能区分不同的 AI 代理(例如区分"Claude"机器人和"ChatGPT"机器人)。
- 对比:他们将这款新工具与一家著名的安全公司Cloudflare进行了对比。
- Cloudflare 的保安:仅抓获了 7 个 AI 代理中的1 个。
- FP-Agent:抓获了全部 7 个AI 代理。
4. 为什么这很重要
该论文得出结论:虽然 AI 代理在“看起来”像人类方面越来越强,但它们尚未掌握“表现得”像人类。它们的“数字肢体语言”暴露了它们。
- 核心启示:要阻止这些 AI 代理进行窃取数据或抢购所有演唱会门票等行为,网站需要停止仅仅检查“你声称你是谁”(如自报的身份),转而开始观察“你如何行动”。
- 警告:研究人员指出,这是一场“军备竞赛”。随着 AI 变得更聪明,它们可能会学会带有停顿地打字,或以曲线移动鼠标。但目前,这种观察其“行为指纹”的新方法仍是识别它们的最有效手段。
简而言之:如果你无法隐藏自己的习惯,就无法隐藏自己的身份。 即使 AI 戴着人类的面孔,它的“数字步态”依然看起来像个机器人。
技术摘要:FP-Agent:AI 浏览代理的指纹识别
1. 问题陈述
AI 浏览代理代表了一类新兴的机器人,它们利用大语言模型(LLMs)通过真实浏览器自主导航网站并执行复杂任务(例如预订机票、购物)。与传统网络机器人不同,这些代理模仿人类的工作流程,使得利用 IP 地址或 User-Agent 字符串等传统信号难以将其与合法的人类流量区分开来。
当前的防御机制严重依赖自愿性自我标识(例如 robots.txt、Web Bot 认证)或静态规则。然而,这些方法是不够的,因为恶意操作者可以简单地避免标识,甚至良性代理也可能无法一致地采用这些标准。本文解决的核心问题是:在受控环境中,现有的 AI 浏览代理是否拥有独特的浏览器和行为指纹,从而能够可靠地将它们与人类区分开来,并相互区分,目前缺乏实证理解。
2. 方法论
作者提出了FP-Agent,这是一个旨在表征和分类浏览代理的测量框架。该方法包含以下组件:
- 受试者: 研究评估了七种不同的浏览代理(五种专有:Atlas Agent、ChatGPT Agent、Claude for Chrome、Comet、Manus;两种开源:Browser Use、Skyvern),以及由 56 名人类参与者组成的对照组。
- 仪器部署: 部署了一个受控的“蜜罐网站”,并配备了客户端 JavaScript 仪器。该网站为每位访问者生成独特的子页面,以隔离流量并收集数据。
- 浏览器指纹: 使用 FingerprintJS 库捕获,收集系统和浏览器属性(例如屏幕分辨率、字体、插件)。
- 行为指纹: 自定义事件监听器记录了交互原语,包括打字(键间/按键保持延迟、粘贴与击键事件)、滚动(距离、持续时间、突发模式)和鼠标移动(曲率、连续性)。
- 任务: 设计了三个代表性任务,以测试常见的网络交互原语:
- 机票预订: 多步骤表单、日期选择器和切换开关。
- 在线购物: 搜索、筛选和购物车交互。
- 论坛互动: 导航、阅读和撰写长文本。
- 数据收集: 针对每种浏览代理在三个任务上进行了 1,000 次试验。人类参与者在自己的设备上对每个任务执行了三次重复操作。
- 分析: 收集的数据被特征化为 418 个浏览器特征和 50 个行为特征。作者训练了XGBoost多类分类器,以评估这些特征的区分能力。他们利用 SHAP(SHapley Additive exPlanations)和特征重要性指标来解释模型决策,并使用统计检验(Mann-Whitney U、Brown-Forsythe)来验证类别之间的差异。
3. 主要发现与结果
3.1 浏览器指纹提供的区分能力有限
- 共享指纹: 多种浏览代理(特别是 Atlas Agent、Browser Use 和 Claude)在运行于相同的底层操作系统(例如 macOS 或 Windows)时,通常共享相同的浏览器指纹。
- 与环境的相关性: 本地代理的浏览器指纹与测试环境(例如屏幕分辨率、系统类型)高度相关,而非活跃的变化。基于云的代理(例如 Manus)也显示出反映其特定远程执行环境的稳定指纹。
- 分类性能: 仅使用浏览器指纹的分类器实现的 F1 分数约为0.80。当代理共享相同指纹时,误分类频繁发生,因为分类器会默认选择训练集中与该指纹关联最频繁的类别。
3.2 行为指纹具有高度独特性
行为特征提供了近乎完美的区分度,分类器实现的 F1 分数分别为0.9993(仅行为)和1.0000(组合)。关键的区分行为包括:
- 打字行为:
- 粘贴与击键: ChatGPT Agent、Atlas Agent 和 Comet 等代理主要使用粘贴事件(Ctrl+V 或程序化粘贴),而不是逐字符打字。
- 延迟模式: 使用击键的代理(例如 Manus、Skyvern、Browser Use)表现出毫秒级的键间和按键保持延迟,且方差通常非常低。相比之下,人类表现出显著更高的延迟和更大的方差。
- 程序化特征: Skyvern 表现出一种独特的模式:先通过击键输入 20 个字符,然后切换到程序化输入。由于特定的文本字段清除逻辑,Browser Use 生成的“变更事件”数量是其他代理的两倍。
- 滚动行为:
- 非连续滚动: 代理不会平滑滚动。它们要么执行瞬时跳转(基于 DOM 的代理如 Skyvern 和 Manus),要么进行离散的、多突发的探索(基于视觉的代理如 ChatGPT Agent)。
- 人类区分: 与大多数代理相比,人类表现出更长、更多变且连续的滚动持续时间和距离。
- 鼠标行为:
- 瞬移: 浏览代理通常生成单个鼠标移动事件,紧接着在目标位置点击,实际上将光标“瞬移”过去。
- 连续移动: 人类生成连续的鼠标移动事件流,具有可测量的曲率和方向,这一特征将它们与代理强烈地区分开来。
3.3 与现有防御措施的比较
在评估 Cloudflare 免费机器人管理的案例研究中:
- FP-Agent: 成功检测并分类了所有七种研究的浏览代理。
- Cloudflare: 仅检测并阻止了Manus(这是 Cloudflare 目录中已验证的机器人)。其他六种代理成功完成了任务。Cloudflare 阻止了来自提供商(例如 ClaudeBot、Perplexity-User)的一些服务器端请求,但未能阻止代理本身的本地或基于云的执行。
4. 贡献
- 首次受控测量: 这是第一项系统测量并比较七种不同 AI 浏览代理与人类用户的浏览器和行为指纹的研究。
- FP-Agent 框架: 作者提供了一个可扩展的测量框架和数据集(公开可用),用于表征浏览代理流量。
- 行为区分实证: 研究表明,虽然浏览器指纹通常是共享的或依赖于环境的,但行为指纹(打字、滚动、鼠标移动)包含稳健的、特定于代理的签名,能够可靠地将 AI 代理与人类区分开来,并相互区分。
- 当前防御的局限性: 论文强调,当前的行业防御措施(如 Cloudflare 的)对于不自我标识的现代浏览代理基本无效,而行为指纹识别提供了一种可行的检测机制。
5. 意义与局限性
论文认为,行为指纹识别是可靠检测和管控 AI 浏览代理的关键组成部分。它表明,随着 AI 自动化的普及,仅依赖自愿性自我标识或静态浏览器属性是不够的。
适度主张与局限性:
- 可推广性: 发现基于特定的一组七个代理和三个任务。作者承认,未来的代理可能会采用更类似人类的行为,从而可能缩小行为指纹方面的差距。
- 任务依赖性: 虽然行为分类器在已见任务上表现良好,但在未见任务上其性能有所下降(例如,仅行为分类器的 F1 从约 0.99 降至约 0.73),尽管组合分类器仍然稳健。
- 人群范围: 人类数据是从本科生中收集的,这可能无法捕捉全球人类浏览行为的全部多样性。
- 军备竞赛: 作者指出,检测是一场持续的军备竞赛;虽然当前的代理是可区分的,但未来的迭代可能会更紧密地主动模仿人类行为模式。
论文得出结论,FP-Agent 为针对这种新兴网络流量的细粒度控制和检测机制的未来研究奠定了基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。