← 最新论文
💬 NLP

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

本文介绍了 ScrapeGraphAI-100k,这是一个源自从业者遥测数据的大规模真实世界数据集,包含 93,695 个符合模式约束的提取事件,它使得大型语言模型能够在结构化生成任务上进行训练和基准测试,而此类任务以往因合成语料库或纯文本语料库的不足而难以开展。

原作者: William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、但有时过于话痨的机器人助手(大型语言模型)。你让它阅读一个杂乱的网页,并提取特定细节,比如鞋子的价格或文章的作者。你希望答案被装在一个完美、整洁的盒子里(JSON 模式),而不是一段啰嗦的段落。

问题在于,虽然我们拥有大量关于这些机器人如何“说话”的数据,但关于它们在严格规则下如何从真实网站“提取”信息的数据却远远不够。大多数现有数据集就像在实验室里编造的练习 drills——它们看起来并不像人们实际使用的、杂乱无章的真实网站。

“ScrapeGraphAI-100k"登场了。

可以将这篇论文视为为这些机器人引入的一份庞大的真实世界训练手册。以下是用通俗语言进行的分解说明:

1. “真实世界健身房”

作者们并没有编造虚假网站。他们收集了 93,695 个真实案例,记录了人们使用其软件从互联网抓取数据的过程。

  • 来源:他们询问了其开源工具的 900 万用户,是否愿意匿名分享他们正在做的事情。在清理了重复项和噪声后,保留了约 93,000 次交互。
  • “四元组”:数据集中的每个案例都是一个完整的故事:
    1. 内容:网页文本(转换为 Markdown,就像一份整洁的文档)。
    2. 请求:人类的提示(例如,“获取价格和尺寸”)。
    3. 规则:机器人必须填写的严格“盒子”(JSON 模式)。
    4. 结果:机器人实际回复的内容。

2. “复杂性陷阱”

研究人员分析了这些案例,发现了一个有趣的模式,就像给机器人设定的限速标志。

  • 简单任务:如果规则(模式)很简单(例如只要求获取姓名和价格),机器人非常擅长遵守它们。
  • 悬崖:随着规则变得更加复杂(更多的嵌套文件夹、更多的字段、更多的“如果/那么”逻辑),机器人开始崩溃。
  • 发现:存在一个尖锐的“失败阈值”。一旦规则集变得太深或包含太多键,成功率就会像石头一样直线下降。这就像要求人类填写一个包含 500 个字段的表格;最终,他们要么放弃,要么犯错。

3. “学生与老师”实验

为了证明该数据集的实用性,作者进行了一项小实验,就像科学博览会上的项目:

  • 老师:一个非常聪明、昂贵的模型(GPT-5-nano),它为数据集生成了完美的答案。
  • 学生:一个微小、廉价的模型(17 亿参数),利用这个新数据集进行了“教学”。
  • 结果:这个小学生在真实世界案例中学习得如此出色,以至于在遵守严格规则方面,它的表现几乎与更大、更昂贵的模型(300 亿参数)一样好。
  • 局限:这个学生非常擅长正确地画出盒子的“轮廓”(结构准确性),但有时仍难以让盒子里的“确切文字”完美无缺(语义正确性)。

4. 盒子里有什么?

  • 语言:主要是英语和繁体中文(约占数据的 88%),涵盖了 18,000 种不同类型的“规则集”。
  • 缺失内容:论文承认,他们没有包含网站的原始、杂乱的 HTML 代码(仅包含清理后的文本版本),并且尚未为每个答案提供“人工验证”的黄金标准。他们将这些留待未来的更新(2.0 版本)。

核心结论

这篇论文指出:“我们建立了一个庞大的真实世界案例库,记录了机器人尝试遵守严格规则以提取数据的过程。我们发现,当规则过于复杂时,机器人会感到困惑;但如果你用这些真实数据训练一个小机器人,它可以学会几乎像大机器人一样遵守规则。”

这是研究人员用来构建更好、更小、更高效的 AI 工具的工具,这些工具能够阅读网站而不会在细节中迷失方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →