ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation
Ce papier présente ScrapeGraphAI-100k, un jeu de données à grande échelle et réel de 93 695 événements d'extraction contraints par un schéma, dérivés de la télémétrie des praticiens, qui permet l'entraînement et l'évaluation des grands modèles de langage sur des tâches de génération structurée où les corpus synthétiques ou purement textuels antérieurs étaient insuffisants.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un assistant robot très intelligent, mais parfois trop bavard (un Modèle de Langage à Grande Échelle). Vous lui demandez de lire une page web désordonnée et d'extraire des détails spécifiques, comme le prix d'une chaussure ou l'auteur d'un article. Vous voulez la réponse dans un cadre parfait et ordonné (un schéma JSON), et non dans un paragraphe décousu.
Le problème est que, bien que nous disposions de nombreuses données sur la façon dont ces robots parlent, nous n'avons pas assez de données sur la façon dont ils extraient des informations de vrais sites web lorsque vous leur donnez des règles strictes. La plupart des ensembles de données existants sont comme des exercices d'entraînement inventés en laboratoire ; ils ne ressemblent pas aux sites web désordonnés du monde réel que les gens utilisent réellement.
Voici "ScrapeGraphAI-100k".
Considérez ce papier comme l'introduction d'un manuel d'entraînement massif et réel pour ces robots. Voici le détail en termes simples :
1. La "Salle de Sport du Monde Réel"
Les auteurs n'ont pas inventé de faux sites web. Ils ont collecté 93 695 exemples réels de personnes utilisant leur logiciel pour extraire des données d'Internet.
- La Source : Ils ont demandé à 9 millions d'utilisateurs de leur outil open-source s'ils pouvaient partager anonymement ce qu'ils faisaient. Environ 93 000 de ces interactions ont été conservées après avoir éliminé les doublons et le bruit.
- Le "Quadruplet" : Chaque exemple dans cet ensemble de données est une histoire complète :
- Le Contenu : Le texte de la page web (converti en Markdown, comme un document propre).
- La Demande : L'invite de l'humain (par exemple, "Obtenez le prix et la taille").
- Les Règles : Le "cadre" strict (schéma JSON) que le robot devait remplir.
- Le Résultat : Ce que le robot a réellement écrit en retour.
2. Le "Piège de la Complexité"
Les chercheurs ont analysé ces exemples et ont découvert un motif fascinant, comme un panneau de limitation de vitesse pour les robots.
- Tâches Simples : Si les règles (schéma) sont simples (comme demander juste un nom et un prix), les robots sont excellents pour les suivre.
- La Falaise : À mesure que les règles deviennent plus complexes (plus de dossiers imbriqués, plus de champs, plus de logique "si/alors"), les robots commencent à planter.
- La Découverte : Il existe un "seuil d'échec" net. Dès qu'un ensemble de règles devient trop profond ou possède trop de clés, le taux de succès chute comme une pierre. C'est comme demander à un humain de remplir un formulaire avec 500 champs ; éventuellement, ils abandonnent ou font des erreurs.
3. L'Expérience "Élève vs Professeur"
Pour prouver que cet ensemble de données est utile, les auteurs ont mené une petite expérience, comme un projet de foire scientifique :
- Le Professeur : Un modèle très intelligent et coûteux (GPT-5-nano) qui a généré des réponses parfaites pour l'ensemble de données.
- L'Élève : Un modèle minuscule et bon marché (1,7 milliard de paramètres) qui a été "enseigné" en utilisant cet nouvel ensemble de données.
- Le Résultat : Le petit élève a appris si bien à partir des exemples du monde réel qu'il a commencé à se comporter presque aussi bien qu'un modèle beaucoup plus grand et plus coûteux (30 milliards de paramètres) lorsqu'il s'agissait de suivre les règles strictes.
- Le Bémol : L'élève était excellent pour dessiner correctement le contour du cadre (précision structurelle), mais avait parfois encore du mal à obtenir les mots exacts à l'intérieur du cadre parfaitement justes (exactitude sémantique).
4. Qu'y a-t-il dans le Cadre ?
- Langues : C'est principalement de l'anglais et du chinois traditionnel (environ 88 % des données), couvrant 18 000 types différents d'"ensembles de règles".
- Ce qui manque : Le papier admet qu'ils n'ont pas inclus le code HTML brut et désordonné des sites web (seulement la version texte propre) et qu'ils n'ont pas encore de norme de référence "vérifiée par l'humain" pour chaque réponse individuelle. Ils réservent cela pour une mise à jour future (Version 2.0).
La Conclusion
Ce papier dit : "Nous avons construit une immense bibliothèque d'exemples du monde réel où des robots ont essayé de suivre des règles strictes pour extraire des données. Nous avons constaté que les robots se perdent lorsque les règles deviennent trop complexes, mais si vous entraînez un petit robot sur ces données réelles, il peut apprendre à suivre les règles presque aussi bien qu'un robot géant."
C'est un outil pour les chercheurs afin de construire de meilleurs outils d'IA, plus petits et plus efficaces, capables de lire des sites web sans se perdre dans les détails.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.