← नवीनतम पेपर
💬 NLP

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

यह शोध पत्र ScrapeGraphAI-100k को प्रस्तुत करता है, जो व्यावहारिक टेलीमेट्री से प्राप्त 93,695 स्कीमा-प्रतिबंधित निष्कर्षण घटनाओं का एक बड़े पैमाने का, वास्तविक दुनिया का डेटासेट है, जो बड़े भाषा मॉडलों (LLMs) को उन संरचित पीढ़ी कार्यों पर प्रशिक्षित करने और उनका बेंचमार्किंग करने में सक्षम बनाता है जहाँ पूर्व सिंथेटिक या केवल टेक्स्ट कॉर्पोरा अपर्याप्त थे।

मूल लेखक: William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

प्रकाशित 2026-05-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन कभी-कभी ज़रूरत से ज़्यादा बातें करने वाला रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल) है। आप उससे एक अव्यवस्थित वेबपेज को पढ़ने और उसमें से विशिष्ट विवरण निकालने के लिए कहते हैं, जैसे कि किसी जूते की कीमत या किसी लेख के लेखक का नाम। आप उत्तर एक आदर्श, साफ-सुथरे बॉक्स (JSON स्कीमा) में चाहते हैं, न कि एक लंबी और भटकाने वाली पैराग्राफ में।

समस्या यह है कि हमारे पास इस बात का बहुत सारा डेटा है कि ये रोबोट कैसे बात करते हैं, लेकिन हमारे पास इस बात का पर्याप्त डेटा नहीं है कि वे सख्त नियमों के साथ वास्तविक वेबसाइटों से जानकारी कैसे निकालते हैं। मौजूदा अधिकांश डेटासेट लैब में बनाए गए अभ्यास ड्रिल की तरह हैं—वे उन वास्तविक, वास्तविक दुनिया की वेबसाइटों जैसा नहीं दिखते जिनका लोग वास्तव में उपयोग करते हैं।

पेश है "ScrapeGraphAI-100k"।

इस पेपर को एक विशाल, वास्तविक दुनिया के प्रशिक्षण मैनुअल के परिचय के रूप में समझें। यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. "वास्तविक दुनिया का जिम"

लेखकों ने नकली वेबसाइटें नहीं बनाईं। उन्होंने 93,695 वास्तविक उदाहरण एकत्र किए जहाँ लोगों ने इंटरनेट से डेटा निकालने के लिए उनके सॉफ़्टवेयर का उपयोग किया।

  • स्रोत: उन्होंने अपने ओपन-सोर्स टूल के 9 मिलियन उपयोगकर्ताओं से पूछा कि क्या वे गुमनाम रूप से यह साझा कर सकते हैं कि वे क्या कर रहे हैं। डुप्लिकेट और शोर (noise) को हटाने के बाद लगभग 93,000 इंटरैक्शन को रखा गया।
  • "फोर-टपल" (चार तत्वों का समूह): इस डेटासेट का प्रत्येक उदाहरण एक पूरी कहानी है:
    1. सामग्री (Content): वेबपेज का टेक्स्ट (मार्डाउन/Markdown में परिवर्तित, जो एक साफ दस्तावेज़ की तरह है)।
    2. अनुरोध (Request): इंसान का प्रॉम्प्ट (जैसे, "कीमत और आकार प्राप्त करें")।
    3. नियम (Rules): वह सख्त "बॉक्स" (JSON स्कीमा) जिसे रोबोट को भरना था।
    4. परिणाम (Result): जो रोबोट ने वास्तव में वापस लिखा।

2. "जटिलता का जाल" (The Complexity Trap)

शोधकर्ताओं ने इन उदाहरणों का विश्लेषण किया और उन्हें एक दिलचस्प पैटर्न मिला, जो रोबोट के लिए एक गति सीमा संकेत (speed limit sign) की तरह है।

  • सरल कार्य: यदि नियम (स्कीमा) सरल हैं (जैसे केवल नाम और कीमत मांगना), तो रोब गए उन्हें निभाने में बहुत अच्छे होते हैं।
  • खाई (The Cliff): जैसे-जैसे नियम अधिक जटिल होते जाते हैं (अधिक नेस्टेड फोल्डर, अधिक फील्ड्स, अधिक "यदि/तो" लॉजिक), रोबोट क्रैश होने लगते हैं।
  • निष्कर्ष: एक स्पष्ट "विफलता सीमा" (failure threshold) है। एक बार जब नियम सेट बहुत गहरा या उसमें बहुत अधिक 'कीज़' (keys) हो जाता है, तो सफलता दर तेजी से गिर जाती है। यह एक इंसान से 500 फील्ड्स वाला फॉर्म भरने के लिए कहने जैसा है; अंततः, वे या तो हार मान लेते हैं या गलतियाँ करते हैं।

3. "छात्र बनाम शिक्षक" प्रयोग

यह साबित करने के लिए कि यह डेटासेट उपयोगी है, लेखकों ने एक छोटा प्रयोग चलाया, जो एक विज्ञान मेले के प्रोजेक्ट की तरह है:

  • शिक्षक: एक बहुत ही स्मार्ट, महंगी मॉडल (GPT-5-nano) जिसने डेटासेट के लिए सटीक उत्तर उत्पन्न किए।
  • छात्र: एक छोटा, सस्ता मॉडल (1.7 बिलियन पैरामीटर्स) जिसे इस नए डेटासेट का उपयोग करके "सिखाया" गया।
  • परिणाम: छोटे छात्र ने वास्तविक दुनिया के उदाहरणों से इतनी अच्छी तरह सीखा कि वह सख्त नियमों का पालन करने के मामले में एक बहुत बड़े, अधिक महंगे मॉडल (30 बिलियन पैरामीटर्स) के लगभग उतना ही अच्छा व्यवहार करने लगा।
  • पेंच (The Catch): छात्र बॉक्स का आउटलाइन (ढांचा) सही ढंग से बनाने में बहुत अच्छा था (स्ट्रक्चरल एक्यूरेसी), लेकिन कभी-कभी बॉक्स के अंदर के सटीक शब्दों को एकदम सही करने में संघर्ष करता था (सिमेंटिक करेक्टनेस)।

4. बॉक्स के अंदर क्या है?

  • भाषाएँ: यह मुख्य रूप से अंग्रेजी और पारंपरिक चीनी (लगभग 88% डेटा) है, जो 18,000 अलग-अलग प्रकार के "नियम सेटों" को कवर करता है।
  • क्या गायब है: पेपर स्वीकार करता है कि उन्होंने वेबसाइटों का कच्चा, अव्यवस्थित HTML कोड शामिल नहीं किया (केवल उनका साफ टेक्स्ट संस्करण), और उनके पास अभी तक हर एक उत्तर के लिए "मानव-सत्यापित" गोल्ड स्टैंडर्ड नहीं है। वे इसे भविष्य के अपडेट (वर्जन 2.0) के लिए बचा रहे हैं।

मुख्य निष्कर्ष (The Bottom Line)

यह पेपर कहता है: "हमने वास्तविक दुनिया के उदाहरणों का एक विशाल पुस्तकालय बनाया है जहाँ रोबोटों ने सख्त नियमों का पालन करने की कोशिश की। हमने पाया कि जब नियम बहुत जटिल हो जाते हैं तो रोबोट भ्रमित हो जाते हैं, लेकिन यदि आप एक छोटे रोबोट को इस वास्तविक डेटा पर प्रशिक्षित करते हैं, तो वह एक विशाल रोबोट की तरह ही नियमों का पालन करना सीख सकता है।"

यह शोधकर्ताओं के लिए एक उपकरण है ताकि वे बेहतर, छोटे और अधिक कुशल AI टूल बना सकें जो विवरणों में खोए बिना वेबसाइटों को पढ़ सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →