← 最新论文
🤖 AI

Broken Gates: Re-evaluating Web Bot Defenses in the Age of LLM Agents

本文系统地评估了网络机器人防御机制在面对商业求解器和新兴的基于大语言模型(LLM)的浏览器代理时的韧性,揭示了虽然基于挑战的防御机制极易被绕过,但非交互式防御机制更多地依赖于执行环境的真实性而非行为分析,从而使其在面对运行于受信任环境中的复杂代理时显得十分脆弱。

原作者: Behzad Ousat, Nikita Turkmen, Lalchandra Rampersaud, Dillan Bailey, Amin Kharraz

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Behzad Ousat, Nikita Turkmen, Lalchandra Rampersaud, Dillan Bailey, Amin Kharraz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下互联网是一座巨大且繁忙的城市。在这座城市里,有两种主要的旅行者:真实的人类和“机器人”(Bots)。机器人就像是经过编程、能够快速执行任务的自动化机器人——有时是乐于助人的,比如像邮递员一样分拣信件;但通常也是调皮捣蛋的,比如像小偷一样试图同时撬开成千上万扇门的锁,以窃取密码或向商店发送垃圾信息。为了保持城市的安全,网站所有者在门口设置了“门禁”。很长一段时间里,这些门禁就像是询问一个简单问题的保安:“你是人类吗?”他们会展示一张交通灯的照片,并要求你点击它。如果你点中了正确的图片,你就能进去。如果你是一个看不见图片的机器人,你就会被挡在外面。

但最近,一种新型的旅行者来到了这座城市:“AI 智能体”(AI Agent)。把它们想象成不是笨拙的机器人,而是超级聪明的数字实习生。它们可以阅读网页、理解内容、点击按钮,甚至还能根据自然语言给出的指令解决谜题。城市安全守卫面临的大问题是:“这些聪明的实习生能骗过保安吗?”如果答案是肯定的,那么旧有的门禁可能不再足以阻止那些小偷了。这正是佛罗里达国际大学的一个研究小组致力于研究的问题。他们想要看看这些新的 AI 智能体是否能溜进现代网站使用的安全门禁,如果可以,它们是如何做到的。

伟大的门禁劫案:研究人员的发现

研究人员决定扮演“坏人”的角色来测试防御系统。他们不仅仅是在猜测;他们构建了一个真实的测试城市,其中包含七种不同类型的安全门禁,范围从经典的“点击交通灯”谜题到在后台运行的隐形安全检查。然后,他们派出了两支攻击者队伍,看看谁能成功闯入。

第一队:“雇佣人类”服务
第一支队伍使用了商业化服务,这些服务充当了中间人的角色。当机器人遇到谜题时,它不会自己解决,而是将图片发送给一名真实的工人,由工人用几秒钟时间解决后将答案传回。研究人员发现,这种方法极其有效。针对经典谜题(如 hCaptcha 和 reCaptcha v2),这些服务的成功率达到了 100%。这就像是雇佣一个真人为你开锁;它几乎每次都奏效,而且非常便宜——有时每 1,000 次尝试仅需 0.10 美元。即使是那些不显示谜题的“隐形”门禁,也大多通过这种方式被绕过了。然而,面对最先进的隐形门禁(reCaptcha v3)——它不提问,而是观察你的行为模式——这些服务的成功率仅为 23% 左右。事实证明,你可以雇人解开一个谜题,但你很难雇人去伪造你整个数字历史。

第二队:“聪明的 AI 实习生”
第二支队伍使用了基于大语言模型(LLM)的浏览器智能体——即那些可以自主阅读和点击的“聪明实习生”。研究人员测试了六个不同版本的智能体,有些在云端运行,有些在个人电脑上运行,还有些作为浏览器扩展程序运行。

结果既有失败也有惊喜。面对经典谜题时,大多数 AI 实习生表现得一败涂地。它们能看到谜题,能理解指令,但却无法实际完成图像识别任务。这就像拥有一个能看懂地图但却不会系鞋带的天才。它们需要一个专门的“求解器”模块来帮助它们,否则就会被困住。

但故事在这里变得非常有趣。当研究人员测试这些智能体应对隐形门禁(如 reCaptcha v3)时,智能体失败并不是因为它们“笨”。它们失败是因为它们看起来很“假”。

研究人员发现,安全系统检查的并不是智能体是否聪明,而是检查它们的“环境”看起来是否真实。他们对比了两个行为几乎完全相同的智能体:Browser-UseNanoBrowser。两者点击按钮、移动鼠标以及填写表单的方式几乎一模一样。然而,NanoBrowser 成功通过了门禁,而 Browser-Use 则被拦截了。

为什么?区别不在于它们的行为,而在于它们的“背包”。NanoBrowser 是在一个真实的浏览器环境中运行的,这个环境拥有长期的 Cookie、保存的登录信息和稳定的数字指纹——就像一个已经在城里生活了多年的居民。相比之下,Browser-Use 是在一个干净、全新的浏览器环境中运行的,看起来非常人工化且可疑——就像一个刚到访的游客,甚至还没买一张当地的 SIM 卡。安全系统闻到了这种“干净”的环境气息,便判定:“不,你是机器人,”尽管该智能体的行为表现得非常完美。

核心启示

论文指出,仅仅通过“让谜题变得更难”这一旧观念正在失去效力。如果你只是让谜题变得更复杂,攻击者只需花几分钱就能雇到人来解决它。即使是最聪明的 AI 智能体,在没有特殊工具的情况下也无法解决这些问题。

真正的安全边界已经发生了转移。它不再关乎你是否能解开一个谜语,而在于你是否能证明你属于这个社区。研究人员发现,像 reCaptcha v3 这样的防御措施之所以强大,是因为它们能够分辨出“干净”的机器人环境与“充满生活气息”的人类环境之间的区别。但这并不是一个完美的盾牌。研究表明,随着 AI 智能体越来越擅长模仿真实的浏览器环境(通过保留 Cookie、历史记录和指纹信息),它们最终可能会欺骗这些隐形门禁。

简而言之,“聪明的实习生”正在变得越来越聪明,但目前为止,它们仍然会被抓获,因为它们还没有合适的“身份证”(浏览器历史记录和 Cookie)来证明自己是真实的人类。论文暗示,网络安全的未来将不再取决于谜题有多难,而取决于我们能在多大程度上识别出“真实的数字生活”与“虚假的数字生活”之间的差异。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →