Weblica: Scalable and Reproducible Training Environments for Visual Web Agents
本文介绍了 Weblica,这是一个利用 HTTP 级缓存和基于大语言模型的合成技术来构建可扩展、可复现的 Web 环境的框架,该框架支持训练 Weblica-8B 模型,使其在视觉网页导航任务中超越了现有的开源权重基线模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想教一个机器人如何浏览互联网,以完成诸如预订航班、购买鞋子或填写表格等任务。互联网是一个混乱且瞬息万变的地方。这就像试图在暴风雨中把某人扔进大海来教他游泳,而与此同时,潮汐每时每刻都在变化,新的海浪不断拍打着。
这就是论文WEBLICA试图解决的问题。来自苹果公司的作者们意识到,在“实时”网络上训练 AI 智能体过于混乱、缓慢且不可预测。相反,他们构建了一个名为WEBLICA的巨大、完美且离线的模拟器。
以下是他们是如何做到的,分为两个简单的部分:
1. “时间旅行相机”(HTTP 级缓存)
想象一下你拍摄了一张网页的照片,但不仅仅是图片,而是捕捉了你电脑与网站之间的整个对话。
- 问题:如果你试图稍后重放这段对话,网站可能会说:“等等,你的会话令牌不同了!”或者“时间戳错了!”并阻止你访问。这就像试图用一把旧钥匙去开一扇已经重新上锁的门。
- 解决方案:团队构建了一个智能系统,充当“时间旅行相机”。它记录每一个请求和响应。然后,它使用一套规则书来忽略那些每次都会变化的部分(如时间戳或随机会话编号),只保留稳定的部分。
- 结果:他们可以完美地、一遍又一遍地重放这些记录下来的网站,而无需连接到真实的互联网。这就像拥有一张完美冻结的网站快照,你仍然可以点击按钮、在框中输入内容,就像在真实环境中一样。
2. “无限乐高工厂”(基于大语言模型的合成)
有时候,你无法仅仅录制一个网站,因为它太复杂或者根本还不存在。
- 问题:真实的网站是有限的。你很难找到 10,000 个不同的“购物车”或“航班预订”页面版本来练习。
- 解决方案:他们使用了一个超级聪明的 AI 程序员(一个大语言模型)来充当工厂。他们告诉工厂:“为我构建一个可以预订课程的瑜伽工作室网站”,或者“构建一个可以比较车型的汽车销售网站”。
- 魔法:AI 程序员使用代码从头构建这些网站,创建虚假图片,甚至发明你需要在网站上执行的任务。这就像一个乐高工厂,可以瞬间建造出城堡、宇宙飞船或房屋的百万种不同版本,所有这些都拥有可正常开合的门和窗,以便机器人可以练习打开它们。
为什么这很重要:“训练健身房”
通过结合这两种方法,作者们为他们的 AI 创造了一个巨大且安全的训练健身房。
- 不再有风暴:他们不必担心真实的互联网会崩溃、变化或阻止他们的机器人。
- 速度:因为一切都是离线和本地的,AI 的练习速度比等待真实网站加载要快数千倍。
- 规模:他们在数千个这种多样化、虚假但逼真的环境中训练了他们的 AI。
结果:"Weblica-8B"冠军
他们在这个健身房中训练了一个名为Weblica-8B的模型。以下是发生的情况:
- 更快更聪明:在真实网站上进行测试时,该模型解决问题的表现优于其他同等规模的开源模型。
- 使用更少的步骤:与竞争对手相比,它可以用更少的点击和尝试次数解决问题。
- 可扩展性:如果你给它更多的思考时间(更多的“测试时计算”),它的表现会变得更好,几乎可以匹敌那些需要付费使用的昂贵专有 AI 模型(如来自 OpenAI 或 Google 的模型)。
简而言之:这篇论文指出,“不要把你的机器人扔进混乱的真实互联网海洋中去学习。相反,构建一个完美、无限且离线的模拟器,让它可以在那里练习数百万次而不会弄湿身体。”事实证明这很有效:机器人学会了极其出色的游泳技巧。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。