ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation
यह शोध पत्र ScrapeGraphAI-100k को प्रस्तुत करता है, जो व्यावहारिक टेलीमेट्री से प्राप्त 93,695 स्कीमा-प्रतिबंधित निष्कर्षण घटनाओं का एक बड़े पैमाने का, वास्तविक दुनिया का डेटासेट है, जो बड़े भाषा मॉडलों (LLMs) को उन संरचित पीढ़ी कार्यों पर प्रशिक्षित करने और उनका बेंचमार्किंग करने में सक्षम बनाता है जहाँ पूर्व सिंथेटिक या केवल टेक्स्ट कॉर्पोरा अपर्याप्त थे।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन कभी-कभी ज़रूरत से ज़्यादा बातें करने वाला रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल) है। आप उससे एक अव्यवस्थित वेबपेज को पढ़ने और उसमें से विशिष्ट विवरण निकालने के लिए कहते हैं, जैसे कि किसी जूते की कीमत या किसी लेख के लेखक का नाम। आप उत्तर एक आदर्श, साफ-सुथरे बॉक्स (JSON स्कीमा) में चाहते हैं, न कि एक लंबी और भटकाने वाली पैराग्राफ में।
समस्या यह है कि हमारे पास इस बात का बहुत सारा डेटा है कि ये रोबोट कैसे बात करते हैं, लेकिन हमारे पास इस बात का पर्याप्त डेटा नहीं है कि वे सख्त नियमों के साथ वास्तविक वेबसाइटों से जानकारी कैसे निकालते हैं। मौजूदा अधिकांश डेटासेट लैब में बनाए गए अभ्यास ड्रिल की तरह हैं—वे उन वास्तविक, वास्तविक दुनिया की वेबसाइटों जैसा नहीं दिखते जिनका लोग वास्तव में उपयोग करते हैं।
पेश है "ScrapeGraphAI-100k"।
इस पेपर को एक विशाल, वास्तविक दुनिया के प्रशिक्षण मैनुअल के परिचय के रूप में समझें। यहाँ सरल शब्दों में इसका विवरण दिया गया है:
1. "वास्तविक दुनिया का जिम"
लेखकों ने नकली वेबसाइटें नहीं बनाईं। उन्होंने 93,695 वास्तविक उदाहरण एकत्र किए जहाँ लोगों ने इंटरनेट से डेटा निकालने के लिए उनके सॉफ़्टवेयर का उपयोग किया।
- स्रोत: उन्होंने अपने ओपन-सोर्स टूल के 9 मिलियन उपयोगकर्ताओं से पूछा कि क्या वे गुमनाम रूप से यह साझा कर सकते हैं कि वे क्या कर रहे हैं। डुप्लिकेट और शोर (noise) को हटाने के बाद लगभग 93,000 इंटरैक्शन को रखा गया।
- "फोर-टपल" (चार तत्वों का समूह): इस डेटासेट का प्रत्येक उदाहरण एक पूरी कहानी है:
- सामग्री (Content): वेबपेज का टेक्स्ट (मार्डाउन/Markdown में परिवर्तित, जो एक साफ दस्तावेज़ की तरह है)।
- अनुरोध (Request): इंसान का प्रॉम्प्ट (जैसे, "कीमत और आकार प्राप्त करें")।
- नियम (Rules): वह सख्त "बॉक्स" (JSON स्कीमा) जिसे रोबोट को भरना था।
- परिणाम (Result): जो रोबोट ने वास्तव में वापस लिखा।
2. "जटिलता का जाल" (The Complexity Trap)
शोधकर्ताओं ने इन उदाहरणों का विश्लेषण किया और उन्हें एक दिलचस्प पैटर्न मिला, जो रोबोट के लिए एक गति सीमा संकेत (speed limit sign) की तरह है।
- सरल कार्य: यदि नियम (स्कीमा) सरल हैं (जैसे केवल नाम और कीमत मांगना), तो रोब गए उन्हें निभाने में बहुत अच्छे होते हैं।
- खाई (The Cliff): जैसे-जैसे नियम अधिक जटिल होते जाते हैं (अधिक नेस्टेड फोल्डर, अधिक फील्ड्स, अधिक "यदि/तो" लॉजिक), रोबोट क्रैश होने लगते हैं।
- निष्कर्ष: एक स्पष्ट "विफलता सीमा" (failure threshold) है। एक बार जब नियम सेट बहुत गहरा या उसमें बहुत अधिक 'कीज़' (keys) हो जाता है, तो सफलता दर तेजी से गिर जाती है। यह एक इंसान से 500 फील्ड्स वाला फॉर्म भरने के लिए कहने जैसा है; अंततः, वे या तो हार मान लेते हैं या गलतियाँ करते हैं।
3. "छात्र बनाम शिक्षक" प्रयोग
यह साबित करने के लिए कि यह डेटासेट उपयोगी है, लेखकों ने एक छोटा प्रयोग चलाया, जो एक विज्ञान मेले के प्रोजेक्ट की तरह है:
- शिक्षक: एक बहुत ही स्मार्ट, महंगी मॉडल (GPT-5-nano) जिसने डेटासेट के लिए सटीक उत्तर उत्पन्न किए।
- छात्र: एक छोटा, सस्ता मॉडल (1.7 बिलियन पैरामीटर्स) जिसे इस नए डेटासेट का उपयोग करके "सिखाया" गया।
- परिणाम: छोटे छात्र ने वास्तविक दुनिया के उदाहरणों से इतनी अच्छी तरह सीखा कि वह सख्त नियमों का पालन करने के मामले में एक बहुत बड़े, अधिक महंगे मॉडल (30 बिलियन पैरामीटर्स) के लगभग उतना ही अच्छा व्यवहार करने लगा।
- पेंच (The Catch): छात्र बॉक्स का आउटलाइन (ढांचा) सही ढंग से बनाने में बहुत अच्छा था (स्ट्रक्चरल एक्यूरेसी), लेकिन कभी-कभी बॉक्स के अंदर के सटीक शब्दों को एकदम सही करने में संघर्ष करता था (सिमेंटिक करेक्टनेस)।
4. बॉक्स के अंदर क्या है?
- भाषाएँ: यह मुख्य रूप से अंग्रेजी और पारंपरिक चीनी (लगभग 88% डेटा) है, जो 18,000 अलग-अलग प्रकार के "नियम सेटों" को कवर करता है।
- क्या गायब है: पेपर स्वीकार करता है कि उन्होंने वेबसाइटों का कच्चा, अव्यवस्थित HTML कोड शामिल नहीं किया (केवल उनका साफ टेक्स्ट संस्करण), और उनके पास अभी तक हर एक उत्तर के लिए "मानव-सत्यापित" गोल्ड स्टैंडर्ड नहीं है। वे इसे भविष्य के अपडेट (वर्जन 2.0) के लिए बचा रहे हैं।
मुख्य निष्कर्ष (The Bottom Line)
यह पेपर कहता है: "हमने वास्तविक दुनिया के उदाहरणों का एक विशाल पुस्तकालय बनाया है जहाँ रोबोटों ने सख्त नियमों का पालन करने की कोशिश की। हमने पाया कि जब नियम बहुत जटिल हो जाते हैं तो रोबोट भ्रमित हो जाते हैं, लेकिन यदि आप एक छोटे रोबोट को इस वास्तविक डेटा पर प्रशिक्षित करते हैं, तो वह एक विशाल रोबोट की तरह ही नियमों का पालन करना सीख सकता है।"
यह शोधकर्ताओं के लिए एक उपकरण है ताकि वे बेहतर, छोटे और अधिक कुशल AI टूल बना सकें जो विवरणों में खोए बिना वेबसाइटों को पढ़ सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।