Skim: Speculative Execution for Fast and Efficient Web Agents
Skim 是一种推测执行框架,它利用可预测的网站结构,在大多数查询中绕过重型推理组件,从而显著降低网络代理的成本和延迟,同时使用轻量级验证器确保准确性,并将罕见的失败无缝级联至完整代理。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在像亚马逊这样庞大而复杂的网站上寻找特定商品,比如“绿色无线 Xbox 手柄”。
旧方法(“重型”代理)
目前,标准的 AI 网络代理就像一个非常 thorough(详尽),但缓慢且昂贵的私人购物助手。
- 浏览器:它打开完整的网页浏览器,加载页面,并等待所有广告、图片和脚本加载完毕。
- 大脑:它使用一个超级智能(且昂贵)的“前沿”AI 大脑来查看屏幕,确定点击位置,输入搜索,等待结果,点击商品,并读取价格。
- 循环:它一遍又一遍地重复这个“查看、思考、点击”的循环,直到找到答案。
这个过程就像雇佣一位侦探大师,走遍巨型仓库的每一个过道,阅读每一块标牌,尽管答案通常就在一个特定的货架上。这需要很长时间(30–120 秒),并且花费高昂(每项任务 0.20–0.50 美元),因为 AI 在每一步都在进行繁重的劳动。
问题所在
该论文认为,这种做法是大材小用。大多数网站实际上非常可预测。
- 可预测的路径:如果你想在亚马逊上购买商品,你总是会前往搜索栏,输入内容,然后点击第一个结果。你不需要天才来推断这一点;你只需要一张地图。
- 可预测的答案:商品的价格总是出现在页面的同一位置。你不需要超级计算机来寻找它;一个简单的工具就能发现它。
新解决方案:"Skim"
作者构建了一个名为 Skim 的系统。可以将 Skim 想象为一个智能捷径系统,它位于你和重型 AI 代理之间。
以下是 Skim 的工作原理,使用一个简单的类比:
1. “地图绘制者”(离线分析)
在任何人提出问题之前,Skim 会派遣一个微小、廉价的机器人访问该网站一次。这个机器人不试图解决具体问题;它只是研究建筑的布局。
- 它学习到:“哦,搜索栏总是在顶部。”
- 它学习到:“如果你想要一个产品,URL 总是看起来像
amazon.com/s?k=..." - 它学习到:“价格总是在一个特定颜色的框中。”
它将这些规则保存为该特定网站的配置文件(作弊表)。
2. “推测冲刺”(运行时)
现在,当你问“帮我找一个绿色 Xbox 手柄”时,Skim 会查阅它的作弊表。
- 猜测:Skim 不会唤醒重型 AI 并打开完整的浏览器,而是说:“我确切地知道它在哪里!”它立即构建直接的 URL(搜索结果页面的地址),并使用简单的、廉价的互联网请求获取页面(无需重型浏览器)。
- 快速扫描:它使用一个小型、廉价的 AI(像初级助手)来扫描页面的相关部分,以查找价格和产品名称。它忽略所有广告和干扰项。
3. “守门员”(验证)
这是安全网。在 Skim 给你答案之前,“守门员”会进行检查。
- 答案看起来像价格吗?
- 格式正确吗?
- 它是否符合你的要求?
如果“守门员”说:“是的,这看起来正确”,Skim 会立即将答案交给你。你节省了 90% 的时间和金钱。
4. “安全网”(回退)
如果网站发生了变化,或者猜测错误怎么办?
- 如果“守门员”说:“不,这看起来不对”,Skim 不会放弃。
- 它会说:“好吧,我的捷径失败了,但我把我们带到了正确的街区(搜索结果页面)。”
- 然后,它唤醒重型、昂贵的 AI 代理,并将它刚刚找到的页面交给它。
- 热启动:因为重型代理不必从主页开始,它只需要完成工作。这就像将重型代理传送到正确的过道,而不是从正门走进去。
结果
该论文在现实世界的网站(如 Amazon、GitHub、ArXiv)上测试了这种方法,发现:
- 速度:它将时间缩短了一半(中位延迟降低了 33%)。
- 成本:它使任务成本几乎降低了一半(成本降低了 1.9 倍)。
- 准确性:它没有增加错误。如果捷径失败,重型代理会修正它,因此最终答案与以前一样好。
总结
Skim 就像意识到:对于大多数去杂货店的行程,你不需要 GPS、一辆完整的汽车和一名司机。你只需要知道地址并走进去。如果你迷路了,那时再叫司机。Skim 利用网站的可预测结构为你完成“步行”,仅在绝对必要时才呼叫昂贵的“司机”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。