想象你走进一个拥挤的房间。即使你戴着口罩、改变了声音,你的走路姿态、敲击手指的速度以及动作特有的节奏,仍可能暴露你的身份。你拥有独特的“步态”。
本文探讨的是:人工智能(AI)代理(即为你浏览网页的计算机程序)同样拥有类似的“步态”。
以下是这项研究的通俗解读:
核心理念:数字步态
当人类浏览互联网时,他们会以自己的速度点击、滚动和输入。当 AI 代理执行相同操作时,它也会点击和滚动。但论文指出,不同的 AI 模型(如 GPT-5、Claude 或 Qwen)在“动作方式”上具有独特的“个性”。
某个模型可能在点击链接前长时间停顿,而另一个模型则可能滚动极快,并以特定模式点击。研究人员发现,通过观察这些细微的动作和时序,他们能够以96% 的准确率精准识别屏幕背后究竟是哪个 AI 模型。
研究方法:隐形秒表
研究人员无需破解 AI 或查看其内部代码。他们采用了一种简单、被动的技巧:
- 实验设置:他们创建了一个网站(如同测试跑道),派遣 14 个不同的 AI 代理执行任务,例如在维基百科查找答案或在亚马逊购物。
- 追踪器:他们在页面中注入了一小段代码(一个"JavaScript 追踪器”)。这段代码如同一个无声的秒表和运动传感器。它并不询问 AI 在想什么,而是仅记录:
- 代理点击了什么;
- 在屏幕的何处点击;
- 动作之间等待了多久。
- 侦探程序:他们将这些数据输入到一个计算机程序(分类器)中,让其猜测是哪一个 AI 执行了这些操作。
研究结果:你无法隐藏节奏
结果令人震惊:
- 高准确率:该系统几乎每次都能正确识别 AI 模型,即使 AI 正在执行不同的任务。
- 速度:系统无需观察整个会话。它往往只需几次点击即可猜出 AI 的身份(就像看到朋友走路的几秒钟后就能认出对方)。
- 时序是关键:最重要的线索并非 AI点击了什么,而是它何时点击。动作之间的时间间隔是最强的指纹。
无效的“防御”
研究人员思考:“如果我们给 AI 的动作添加随机延迟来混淆追踪器,会怎样?”
- 他们尝试添加随机停顿(例如让 AI 在点击前等待 5 秒)。
- 结果:这仅略微拖慢了追踪器的速度,但追踪器非常聪明。如果研究人员用这些“延迟”后的轨迹重新训练系统,系统便能学会忽略随机停顿,再次聚焦于底层节奏。防御失败。
为何重要(“我为什么要关心?”)
论文将此定位为一种安全风险。
- 问题:目前,网站主要担心“这是人类还是机器人?”这项研究表明,一旦你确认它是机器人,你就可以进一步追问:“具体是哪一个机器人?”
- 风险:如果恶意行为者确切知道访问其网站的是哪个 AI 模型,他们就可以针对该模型量身定制攻击。这就像一套只适用于特定品牌锁的开锁工具。如果他们知道你的锁的品牌,就能更快地将其撬开。
- 现实:每次 AI 访问网站时,都会留下揭示其身份的“数字足迹”,即使它试图隐藏。
结论
正如你无法在人群中轻易隐藏走路风格一样,AI 模型在浏览网页时也无法轻易隐藏其“交互风格”。它们的点击和停顿是一张独特的身份证,揭示着它们的身份,而这张身份证对任何控制其所访问网站的人都是可见的。
本文并未声称:
- 它并未表示此方法可用于识别人类用户(它假设用户本身已是 AI);
- 它并未声称此方法适用于全球所有网站(它仅在特定的购物和搜索任务上进行了测试);
- 它并未提供解决此问题的方案;它仅仅揭示了这一漏洞。
技术摘要:行胜于言:通过 UI 轨迹对 LLM 浏览器代理进行指纹识别
1. 问题定义
随着大语言模型(LLM)代理从研究原型转变为代表用户浏览网页的生产系统,一个关键的安全问题随之产生:网站能否被动地识别驱动代理的具体底层模型?当前的机器人检测通常将问题框架化为二元分类(人类与自动化)。然而,随着脚本自动化被 LLM 代理所取代,威胁格局发生了转变。在经典的安全框架中,目标识别是利用的前提。如果攻击者能够确定访问页面的模型,他们就可以根据已知的特定模型漏洞定制攻击——例如从已知语料库中选择特定的越狱方法,或缩小白盒对抗攻击的搜索空间。
本文研究了浏览器代理的底层基础模型是否可以仅通过被动的、页面内的用户界面(UI)轨迹进行推断。作者认为,代理的行为(点击、滚动、按键)和交互时间编码了独特的行为指纹,该指纹对模型具有特异性,且独立于可被伪造的浏览器头部或网络层元数据。
2. 方法论
实验设置
本研究评估了 14 种前沿多模态 LLM,包括专有模型(GPT-5.4、Claude Opus 4.6、Gemini-3.1/Flash)和开源模型(Qwen3/3.5-VL 系列、GLM-4.6V、Gemma-4、UI-TARS-1.5、Seed-2.0-Lite)。
- 环境:代理在标准化的浏览器框架(Midscene.js)中运行,该框架将模型决策转换为 Playwright 命令。这确保了行为差异源于模型本身,而非执行环境。
- 任务:代理在四个实时网络环境中执行任务:两个信息检索基准(2WikiMultiHop、FRAMES,基于维基百科)和两个购物基准(Webshop、Deepshop,基于亚马逊)。
- 数据收集:一个轻量级 JavaScript 跟踪器被注入到目标页面中。它以毫秒级分辨率被动记录客户端交互事件,捕获:
- 动作类型(点击、滚动、按键、导航)。
- 空间坐标(点击 X/Y 坐标、滚动深度)。
- 时间动态(事件间间隔、首次动作时间)。
- 结构模式(链接点击率、按键类型)。
- 轨迹格式:一个会话生成一条轨迹 τ={(st,ut,Δtt)}t=1T,其中 st 是观测值,ut 是动作,Δtt 是距离上一次动作经过的时间。
分类方法
该问题被形式化为监督分类任务,以预测源模型 m^=f(τ)。
- 特征提取:提取了 41 个标量特征,分为时间动态(如事件间间隔统计)、滚动行为、点击空间分布和导航量。
- 模型:训练了五类分类器:Lasso 回归、逻辑回归、随机森林、XGBoost 和 LSTM 网络。XGBoost 被强调为主要表现者。
- 评估协议:
- 闭集指纹识别:分类器在固定的 14 个已知代理集合上进行训练和测试。
- 开集指纹识别:使用“留一代理法”(LOO)协议,测试区分已知代理与未知代理的能力(将轨迹标记为未知)。
3. 关键结果
闭集识别的高准确率
研究表明,代理可以通过其动作轨迹被高度识别。
- 性能:XGBoost 分类器在 14 个模型上的宏观 F1 分数高达 96%。
- 一致性:在所有四个数据集(2WikiMultiHop、FRAMES、Webshop、Deepshop)上均观察到高性能。例如,Seed-2-lite 在 2WikiMultiHop 上达到 96.1% 的 F1 分数,UI-TARS-1.5 在 Webshop 上达到 92.1%。
- 效率:强大的分类器可以使用少于三分之一可用训练轨迹进行训练。此外,模型身份可以在事件早期被推断;宏观 F1 分数在前 40% 的观测动作内急剧上升,并在接近全轨迹性能时趋于平稳。
开集检测
虽然开集识别(区分已知与未知)更具挑战性,但仍然是可行的。
- 大多数代理在区分已知与未知轨迹时实现了 AUROC > 0.60。
- 值得注意的是,闭集与开集性能之间存在脱节:在已知身份时最容易识别的代理(例如 Seed-2-lite),在开集设置中并不一定是最容易与未知代理区分开的。
特征重要性与鲁棒性
- 时间主导:在正常条件下,时间特征(事件间间隔、首次动作时间)是分类准确率的主要驱动因素。
- 对扰动的鲁棒性:作者通过在动作之间注入随机延迟(长达 5 秒)来测试这些指纹的弹性。
- 在干净轨迹上训练的分类器在评估延迟轨迹时,性能急剧下降。
- 然而,在延迟轨迹上重新训练的分类器在很大程度上恢复了性能。它们将依赖关系从纯粹的时间转向稳健的结构特征,如点击坐标分散度、结构按键比例和链接点击比例。这表明虽然时间是最强的信号,但行为“指纹”并不完全依赖于它。
泛化能力
- 任务迁移:单任务迁移(在一个任务上训练,在同一网站的另一个任务上测试)表现较弱。然而,池化站点训练(结合同一网站上多个任务的轨迹)恢复了强大的归因性能。
- 跨站点迁移:不同网站之间的迁移(例如从维基百科到亚马逊)仍然较弱,表明指纹取决于模型、任务分布和网站界面之间的特定交互。
4. 意义与影响
该论文声称,这项工作为 LLM 代理建立了一个新的攻击面:通过 UI 轨迹进行被动模型归因。
- 威胁模型:该攻击是被动的且共置的(攻击者控制页面)。它不需要网络可见性或主动探测。
- 利用向量:一旦代理被识别,攻击者可以:
- 部署针对性提示注入:选择已知对特定识别模型有效的越狱方法。
- 增加成本(海绵攻击):提供旨在最大化高成本前沿模型(如 Claude Opus、GPT-5.4)令牌消耗的内容,从而有效地对用户的推理预算实施拒绝服务攻击。
- 条件访问控制:实施特定模型的白名单或黑名单,或提供仅对特定模型可见的投毒内容,而对其他模型则看似无害。
- 防御局限性:标准的浏览器规范化(如随机化时间延迟)不足以防御此类攻击,如果攻击者愿意在扰动数据上重新训练其分类器。
5. 结论
作者得出结论,LLM 代理的页面内行为作为一种持久的识别信号,其重要性可与模型本身相媲美。从“人类与机器人”检测到“哪个模型”归因的转变,代表了已部署代理威胁格局的根本性变化。该论文发布了带有标签的代理轨迹语料库和浏览器框架,以促进对行为归因的研究及对抗措施的开发。
注:论文明确指出,其当前范围仅限于单个代理框架(Midscene.js)、14 个模型的闭集以及尚不完善的开集检测。未来的工作需要对框架无关的信号进行表征,并评估针对自适应攻击者的混淆防御措施。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。