← 最新论文
💬 NLP

LiveWeb-IE: A Benchmark For Online Web Information Extraction

本文提出了首个面向在线网页信息提取的基准 LiveWeb-IE,通过引入基于真实动态网站的评估范式及模仿人类视觉定位的多阶段智能体框架 VGS,有效解决了传统静态基准无法评估动态场景下系统性能的问题。

原作者: Seungbin Yang, Jihwan Kim, Jaemin Choi, Dongjin Kim, Soyoung Yang, ChaeHun Park, Jaegul Choo

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Seungbin Yang, Jihwan Kim, Jaemin Choi, Dongjin Kim, Soyoung Yang, ChaeHun Park, Jaegul Choo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 LIVEWEB-IE 的新基准测试,以及一种名为 VGS 的新方法,旨在解决网络信息提取(从网页抓取数据)中的一个核心难题:网页是活的,但我们的工具太“死”了。

为了让你轻松理解,我们可以把整个故事想象成**“在变形的迷宫里找宝藏”**。

1. 旧方法的困境:拿着旧地图找新迷宫

背景:
想象一下,你以前经常去一个公园(网页)找特定的花(数据)。以前,公园管理员给你一张静态的照片(HTML 快照),照片上清楚地画着花在哪里。你只需要照着照片走,就能找到花。这就是过去几十年里,研究人员测试“网页爬虫”的方法。

问题:
但是,现实中的公园(互联网)是活的

  • 今天,管理员可能把长椅挪了位置。
  • 明天,可能把花坛重新修剪了。
  • 后天,甚至可能把整条路都改了方向。

如果你还拿着几年前的旧照片(静态快照)去现在的公园找花,你会发现照片上的路根本不存在,或者花被挡住了。这就是论文指出的问题:现有的测试都在用“旧照片”考学生,导致那些在旧照片上考满分的学生,一到了真实的、不断变化的互联网上就“挂科”了。

2. 新基准:LIVEWEB-IE(“实时迷宫”挑战)

为了解决这个问题,作者们建立了一个新的考试系统,叫 LIVEWEB-IE

  • 它是什么? 它不再给你旧照片,而是直接把你带到此时此刻的公园现场。
  • 怎么考? 它给你一张任务卡(自然语言查询),比如:“帮我找到这张比赛海报的缩略图”或者“列出所有参赛队伍的链接”。
  • 特点:
    • 真·实时: 必须访问真实的、正在运行的网站。
    • 多模态: 不仅找文字,还要找图片、链接(就像不仅要找路,还要找路标和风景照)。
    • 难度分级: 任务有简单(找一朵花)到复杂(找整个花坛的所有花及其位置)。

核心目的: 看看现在的 AI 到底能不能在不断变化的现实世界中,准确地抓取信息,而不是只会背死书。

3. 新武器:VGS(“视觉导航员”)

面对这个“实时迷宫”,传统的 AI 方法(像以前的爬虫)通常只读网页的源代码(HTML)。这就像是一个盲人摸象,只摸到了大象的骨架(代码结构),却看不见大象长什么样。一旦大象换了衣服(网页布局变了),盲人就懵了。

作者提出了一种新方法,叫 VGS (Visual Grounding Scraper),我们可以把它想象成一个**“拥有超级眼睛的寻宝向导”**。

VGS 是如何工作的?(模仿人类思维的四步走):

  1. 听指令 (Attribute Identification):

    • 向导听你说:“我要找那个红色的足球海报。”
    • 他先理解你的需求,确定目标是什么。
  2. 扫视全场 (Visual Grounding):

    • 他不像以前那样去读几千行枯燥的代码。相反,他直接看网页的截图(就像人看网页一样)。
    • 他一眼就能看出:“哦,足球海报肯定在页面的上半部分,或者在侧边栏。”他迅速把搜索范围缩小到那个区域。
    • 比喻: 就像你在图书馆找书,你不会去读每一本书的目录代码,而是直接看书架的标签,找到“体育区”。
  3. **精准定位 (Element Pinpointing):

    • 在缩小后的区域里,他给每一个可能的目标贴上标签(就像在图片上画框)。
    • 他再次确认:“这个框里是海报,那个框里是广告。我要的是海报。”
    • 他精准地指出了目标的具体位置。
  4. 绘制地图 (XPath Synthesis):

    • 最后,他根据刚才看到的视觉线索和周围的代码结构,画出一张通用的寻宝地图(XPath)。
    • 这张地图不仅适用于这一页,还能适应这个网站其他类似的页面。即使网站下次稍微变了一下,因为向导是“看着图”画的地图,所以依然能找得到。

4. 实验结果:谁更厉害?

作者让各种 AI 模型(包括强大的 GPT-4o 等)参加了这个“实时迷宫”挑战:

  • 旧方法(只看代码): 就像拿着旧地图的盲人,一旦网页布局变了,它们就找不到北了,错误率很高。
  • VGS(视觉导航员): 表现最好。因为它学会了“看图说话”,即使网页结构变了,只要视觉上看起来还像那么回事,它就能找到目标。
  • 人类专家: 即使是 VGS,目前还比不上人类专家(人类能灵活应对各种突发状况),但 VGS 已经比所有现有的 AI 方法都要强得多了。

总结

这篇论文的核心思想是:互联网是动态的,我们的工具也必须学会“看”而不是只“读”。

  • LIVEWEB-IE 是一个新的考场,专门测试 AI 在真实、变化的互联网上的能力。
  • VGS 是一个聪明的新策略,它模仿人类,先网页长什么样,再目标,最后代码。

这就好比以前我们教机器人下棋只看棋盘坐标(代码),现在我们要教机器人棋盘上的棋子长什么样(视觉),这样即使棋盘被重新摆放了,机器人依然能赢。这为未来开发更实用、更 robust(鲁棒)的网络数据抓取系统打下了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →