← Últimos artigos
💬 NLP

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

Este artigo apresenta o ScrapeGraphAI-100k, um conjunto de dados em larga escala e do mundo real contendo 93.695 eventos de extração com restrições de esquema, derivados de telemetria de profissionais, que viabiliza o treinamento e a avaliação de modelos de linguagem grandes em tarefas de geração estruturada onde corpora sintéticos ou apenas textuais anteriores eram insuficientes.

Autores originais: William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

Publicado 2026-05-11
📖 4 min de leitura☕ Leitura rápida

Autores originais: William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robótico muito inteligente, mas às vezes excessivamente falante (um Modelo de Linguagem Grande). Você pede a ele para ler uma página da web bagunçada e extrair detalhes específicos, como o preço de um sapato ou o autor de um artigo. Você quer a resposta em uma caixa perfeita e organizada (um esquema JSON), não em um parágrafo prolixo.

O problema é que, embora tenhamos muitos dados sobre como esses robôs falam, não temos dados suficientes sobre como eles extraem informações de sites reais quando você lhes dá regras estritas. A maioria dos conjuntos de dados existentes são como exercícios de prática criados em laboratório — eles não se parecem com os sites bagunçados do mundo real que as pessoas realmente usam.

Apresentamos o "ScrapeGraphAI-100k".

Pense neste artigo como a introdução de um manual de treinamento massivo e do mundo real para esses robôs. Aqui está a explicação em termos simples:

1. A "Academia do Mundo Real"

Os autores não criaram sites falsos. Eles coletaram 93.695 exemplos reais de pessoas usando seu software para extrair dados da internet.

  • A Fonte: Eles pediram a 9 milhões de usuários de sua ferramenta de código aberto se podiam compartilhar anonimamente o que estavam fazendo. Cerca de 93.000 dessas interações foram mantidas após a limpeza de duplicatas e ruídos.
  • A "Quadrupla": Cada exemplo neste conjunto de dados é uma história completa:
    1. O Conteúdo: O texto da página da web (convertido para Markdown, como um documento limpo).
    2. O Pedido: O prompt do humano (por exemplo, "Obtenha o preço e o tamanho").
    3. As Regras: A "caixa" estrita (esquema JSON) que o robô teve que preencher.
    4. O Resultado: O que o robô realmente escreveu de volta.

2. A "Armadilha da Complexidade"

Os pesquisadores analisaram esses exemplos e encontraram um padrão fascinante, como um sinal de limite de velocidade para robôs.

  • Tarefas Simples: Se as regras (esquema) são simples (como pedir apenas um nome e um preço), os robôs são ótimos em segui-las.
  • O Penhasco: À medida que as regras ficam mais complexas (mais pastas aninhadas, mais campos, mais lógica "se/então"), os robôs começam a falhar.
  • A Descoberta: Existe um "limiar de falha" agudo. Assim que um conjunto de regras fica muito profundo ou tem muitas chaves, a taxa de sucesso cai como uma pedra. É como pedir a um humano para preencher um formulário com 500 campos; eventualmente, eles desistem ou cometem erros.

3. O Experimento "Aluno vs. Professor"

Para provar que este conjunto de dados é útil, os autores realizaram um pequeno experimento, como um projeto de feira de ciências:

  • O Professor: Um modelo muito inteligente e caro (GPT-5-nano) que gerou respostas perfeitas para o conjunto de dados.
  • O Aluno: Um modelo minúsculo e barato (1,7 bilhão de parâmetros) que foi "ensinado" usando este novo conjunto de dados.
  • O Resultado: O pequeno aluno aprendeu tão bem com os exemplos do mundo real que começou a agir quase tão bem quanto um modelo muito maior e mais caro (30 bilhões de parâmetros) quando se tratava de seguir as regras estritas.
  • O Problema: O aluno era ótimo em desenhar o contorno da caixa corretamente (precisão estrutural), mas às vezes ainda tinha dificuldade em obter as palavras exatas dentro da caixa perfeitas (correção semântica).

4. O Que Há Dentro da Caixa?

  • Idiomas: É principalmente inglês e chinês tradicional (cerca de 88% dos dados), cobrindo 18.000 tipos diferentes de "conjuntos de regras".
  • O Que Faltou: O artigo admite que não incluíram o código HTML bruto e bagunçado dos sites (apenas a versão de texto limpa) e não têm um padrão "verificado por humanos" de ouro para cada resposta ainda. Eles estão reservando isso para uma atualização futura (Versão 2.0).

A Conclusão

Este artigo diz: "Construímos uma biblioteca massiva de exemplos do mundo real onde robôs tentaram seguir regras estritas para extrair dados. Descobrimos que os robôs ficam confusos quando as regras ficam muito complexas, mas se você treinar um robô pequeno nesses dados reais, ele pode aprender a seguir as regras quase tão bem quanto um robô gigante."

É uma ferramenta para pesquisadores construírem ferramentas de IA melhores, menores e mais eficientes que podem ler sites sem se perder nos detalhes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →