← Nieuwste papers
💬 NLP

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

Dit artikel introduceert ScrapeGraphAI-100k, een grootschalige, real-world dataset van 93.695 schema-gedwongen extractie-gebeurtenissen afgeleid van praktijkgerelateerde telemetrie, die het trainen en benchmarken van grote taalmodellen op gestructureerde generatietaken mogelijk maakt waar eerdere synthetische of alleen-tekst corpora ontoereikend waren.

Oorspronkelijke auteurs: William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

Gepubliceerd 2026-05-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar soms overdreven kletsende robotassistent hebt (een Large Language Model). Je vraagt het om een rommelige webpagina te lezen en specifieke details eruit te halen, zoals de prijs van een schoen of de auteur van een artikel. Je wilt het antwoord in een perfect, netjes vakje (een JSON-schema), niet in een zwetsend alinea.

Het probleem is dat we hoewel we veel data hebben over hoe deze robots praten, niet genoeg data hebben over hoe ze informatie extraheren uit echte websites wanneer je ze strikte regels geeft. De meeste bestaande datasets zijn als oefenopdrachten die in een lab zijn bedacht; ze lijken niet op de rommelige, realistische websites die mensen daadwerkelijk gebruiken.

Maak kennis met "ScrapeGraphAI-100k."

Beschouw dit artikel als de introductie van een enorme, realistische trainingshandleiding voor deze robots. Hier is de uitleg in eenvoudige termen:

1. De "Realistische Sportschool"

De auteurs hebben geen nepwebsites bedacht. Ze verzamelden 93.695 echte voorbeelden van mensen die hun software gebruikten om data van het internet te scrapen.

  • De Bron: Ze vroegen 9 miljoen gebruikers van hun open-source tool of ze anoniem konden delen wat ze deden. Ongeveer 93.000 van die interacties werden behouden na het opschonen van duplicaten en ruis.
  • De "Vier-tupel": Elk voorbeeld in deze dataset is een compleet verhaal:
    1. De Inhoud: De tekst van de webpagina (omgezet naar Markdown, zoals een schoon document).
    2. Het Verzoek: De prompt van de mens (bijvoorbeeld: "Haal de prijs en maat op").
    3. De Regels: Het strikte "vakje" (JSON-schema) dat de robot moest invullen.
    4. Het Resultaat: Wat de robot daadwerkelijk terugschreef.

2. De "Complexiteitsval"

De onderzoekers analyseerden deze voorbeelden en vonden een fascinerend patroon, als een snelheidslimietbord voor robots.

  • Eenvoudige Taken: Als de regels (schema) simpel zijn (zoals vragen om alleen een naam en prijs), zijn de robots uitstekend in het volgen ervan.
  • De Afgrond: Naarmate de regels complexer worden (meer geneste mappen, meer velden, meer "als/dan"-logica), beginnen de robots te crashen.
  • De Bevinding: Er is een scherpe "faalgrens". Zodra een regelset te diep wordt of te veel sleutels heeft, daalt het succespercentage als een steen. Het is alsof je een mens vraagt een formulier in te vullen met 500 velden; uiteindelijk geven ze het op of maken ze fouten.

3. Het "Leerling vs. Leraar"-Experiment

Om te bewijzen dat deze dataset nuttig is, voerden de auteurs een klein experiment uit, als een sciencefair-project:

  • De Leraar: Een zeer slim, duur model (GPT-5-nano) dat perfecte antwoorden genereerde voor de dataset.
  • De Leerling: Een klein, goedkoop model (1,7 miljard parameters) dat "onderwezen" werd met deze nieuwe dataset.
  • Het Resultaat: De kleine leerling leerde zo goed van de realistische voorbeelden dat het begon te handelen bijna even goed als een veel groter, duurder model (30 miljard parameters) als het ging om het volgen van de strikte regels.
  • De Haken: De leerling was uitstekend in het correct tekenen van de omlijning van het vakje (structurele nauwkeurigheid), maar had soms nog steeds moeite om de exacte woorden binnenin het vakje perfect te krijgen (semantische correctheid).

4. Wat zit er in het vakje?

  • Talen: Het is voornamelijk Engels en Traditioneel Chinees (ongeveer 88% van de data), met 18.000 verschillende soorten "regelsets".
  • Wat Ontbreekt: Het artikel geeft toe dat ze de ruwe, rommelige HTML-code van de websites niet hebben opgenomen (alleen de schone tekstversie) en dat ze nog geen "door mensen geverifieerde" gouden standaard hebben voor elk enkel antwoord. Ze bewaren dat voor een toekomstige update (Versie 2.0).

De Conclusie

Dit artikel zegt: "We hebben een enorme bibliotheek gebouwd van realistische voorbeelden waarbij robots probeerden strikte regels te volgen om data te extraheren. We hebben ontdekt dat robots in de war raken wanneer regels te complex worden, maar als je een kleine robot traint op deze echte data, kan het leren de regels bijna even goed te volgen als een gigantische robot."

Het is een hulpmiddel voor onderzoekers om betere, kleinere en efficiëntere AI-tools te bouwen die websites kunnen lezen zonder zich te verliezen in de details.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →