WCXB: A Multi-Type Web Content Extraction Benchmark
本文介绍了WCXB,这是一个包含2,008个网页、涵盖七种不同类型的高质量标注综合基准数据集,旨在克服现有仅针对文章的基准数据集的局限性,并揭示当前网页内容提取系统中存在的显著性能差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
将互联网想象成一座庞大而混乱的图书馆,其中每一本书都是一张网页。有些页面是干净、文笔优美的小说(新闻文章);另一些则是贴满便签的杂乱公告板(论坛)、带有价格标签和规格参数的目录(商品),或是包含侧边栏和代码块的说明书(文档)。
多年来,试图阅读这些页面的计算机存在一个重大盲点。它们被训练得擅长阅读“小说”,却极不擅长理解杂乱的目录或公告板。它们常常误将价格标签、“加入购物车”按钮或用户评论当作主要内容来读取。
问题所在:“仅限新闻”的测试
作者穆罗·福伊(Murrough Foley)指出,以往用于衡量计算机阅读网页能力的测试,就像只在空旷笔直的公路上进行驾驶考试。
- 旧测试:它们使用了小型数据集(100–800 页),其中几乎全是新闻文章。
- 结果:计算机看起来像超级天才,得分接近完美。但这具有误导性。它无法告诉我们它们将如何应对互联网的其他部分,而互联网充满了像商品列表或论坛这样结构复杂的页面。
解决方案:WCXB(“全地形”驾驶考试)
福伊引入了一项名为 WCXB(网页内容提取基准)的新基准测试。可以将其想象为一项更严苛的新驾驶考试,不仅包含高速公路,还包括泥泞的越野小径、拥挤的城市街道和施工区域。
- 数据集:它包含来自 1,600 多个不同网站的 2,008 张网页。
- 多样性:它不仅仅涵盖新闻,还覆盖了 7 种截然不同的页面类型:
- 文章(轻松的高速公路驾驶)。
- 论坛(贴满用户评论的杂乱公告板)。
- 商品(带有隐藏规格和价格的目录)。
- 合集(带有筛选功能的物品网格)。
- 列表(重复的摘要卡片)。
- 文档(包含代码的技术手册)。
- 服务页面(各部分分散在各处的营销页面)。
制作过程(“黄金标准”配方)
为了确保答案正确,他们并非只请一人批改试卷,而是采用了 五阶段流水线:
- AI 起草:一个智能 AI 撰写“主要内容”应为何物的初稿。
- 自动检查:脚本检查明显的错误。
- AI 审查:四位不同的 AI 专家审查工作,寻找不同类型的错误。
- 片段检查:运行脚本以确保包含特定的必需短语,并排除特定的“垃圾”短语(如广告)。
- 人类决赛:一位人类专家审查最终产品,以解决任何争议并确保质量。
结果:“新闻”已解决,其余部分仍存问题
福伊针对这项新测试,对 13 种不同的计算机程序(11 种使用传统规则,2 种使用现代 AI)进行了测试。以下是他们的发现:
- 新闻文章:所有人都以优异成绩通过。顶级程序的准确率达到 93%。作者得出结论,阅读新闻文章本质上是一个“已解决的问题”。
- 互联网的其他部分:得分急剧下降。
- 在 论坛 上,最佳程序与最差程序之间的差距巨大(相差 27 分)。
- 在 商品页面 上,最佳程序仅正确识别了约 67% 的内容,而其他程序在处理隐藏数据时则显得吃力。
- 在 合集 页面上,最高分仅为 71%,而最低分仅为 41%。
最大的惊喜:更大的 AI 并非灵丹妙药
许多人认为,更新、更大的人工智能模型(神经网络系统)会自动在所有方面表现更好。
- 现实情况:大型 AI 模型 并未 解决问题。事实上,在非新闻页面上,它们的表现往往 不如 更简单的基于规则的程序。
- 原因:AI 模型主要是在新闻文章上训练的,因此继承了同样的偏见。它们擅长处理小说,但在面对杂乱的公告板和商品目录时仍然会感到困惑。
速度与智能
该论文还考察了速度。
- 基于规则的程序:快如闪电(每页仅需几毫秒)。
- AI 程序:慢如蜗牛(每页需要数千毫秒),且需要昂贵的图形显卡才能运行。
结论
互联网不仅仅是新闻故事的集合。它是多种不同结构的混合体。旧测试仅针对新闻进行测试,从而对我们撒谎。这项新基准(WCXB)揭示出,虽然计算机擅长阅读新闻,但在理解互联网复杂、结构化且杂乱的部分方面仍面临困难。为了向前发展,我们需要停止将所有网页都视为新闻文章。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。