← नवीनतम पेपर
💬 NLP

D-SCoRE: Document-Centric Segmentation and CoT Reasoning with Structured Export for QA-CoT Data Generation

D-SCoRE एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो किसी भी टेक्स्ट स्रोत से स्वतः ही विविध, उच्च-गुणवत्ता वाले चेन-ऑफ-थॉट (Chain-of-Thought) QA डेटासेट उत्पन्न करता है, जिससे इसके आउटपुट पर फाइन-ट्यून किए गए लार्ज लैंग्वेज मॉडल्स, मानव-एनोटेटेड डेटा पर प्रशिक्षित मॉडल्स से बेहतर प्रदर्शन करने में सक्षम होते हैं जबकि उपभोक्ता-ग्रेड हार्डवेयर पर कुशलतापूर्वक कार्य करते हैं।

मूल लेखक: Weibo Zhou, Lingbo Li, Shangsong Liang

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weibo Zhou, Lingbo Li, Shangsong Liang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन छात्र (एक लार्ज लैंग्वेज मॉडल, या LLM) को जटिल पहेलियाँ हल करना सिखाना चाहते हैं। पारंपरिक रूप से, आपको हजारों पहेलियाँ और उनके लिए चरण-दर-चरण तर्क समझाने के लिए मानव विशेषज्ञों की एक टीम को काम पर रखना होगा। यह महंगा, धीमा और बड़े पैमाने पर करना कठिन है।

यह शोध पत्र D-SCoRE को पेश करता है, जो एक "ट्रेनिंग-फ्री" फ्रेमवर्क है जो एक अति-कुशल, स्वचालित ट्यूटर की तरह कार्य करता है। इंसानों को काम पर रखने के बजाय, यह एक स्मार्ट AI का उपयोग करता है जो आपके द्वारा दिए गए किसी भी टेक्स्ट (जैसे कोई समाचार लेख या कहानी) को पढ़ सकता है और तुरंत अपनी खुद की उच्च-गुणवत्ता वाली पहेलियाँ और तर्क मार्गदर्शिकाएँ (logic guides) बना सकता है।

यहाँ बताया गया है कि D-SCoRE कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. मूल विचार: "कॉपी-पेस्ट" से "गहन सोच" तक

अधिकांश स्वचालित प्रणालियाँ केवल ऐसे प्रश्न पूछती हैं जहाँ उत्तर टेक्स्ट से सीधे कॉपी किया जा सकने वाला एक शब्द होता है (जैसे, "कार किस रंग की है?")। यह एक छात्र से शब्दकोश में शब्द खोजने के लिए कहने जैसा है।

D-SCoRE दो चीजें अलग तरह से करता है:

  • स्पष्ट प्रश्न (Explicit Questions): यह आसान, कॉपी-पेस्ट वाले प्रश्न पूछता है।
  • निहित प्रश्न (Implicit Questions - असली जादू): यह ऐसे प्रश्न पूछता है जिनमें कड़ियों को जोड़ने की आवश्यकता होती है। उदाहरण के लिए, यदि टेक्स्ट कहता है "कार लाल और तेज़ थी," तो एक निहित प्रश्न हो सकता है, "कार संभवतः खतरनाक क्यों थी?" AI को यह तर्क करना होगा कि लाल + तेज़ = खतरनाक।
  • चेन-ऑफ-थॉट (CoT): इन कठिन प्रश्नों के लिए, D-SCoRE AI को अपने सोचने की प्रक्रिया को चरण-दर-चरण लिखने के लिए मजबूर करता है, जैसे कि एक छात्र गणित के टेस्ट में अपना काम दिखाता है।

2. तीन-चरणीय असेंबली लाइन

D-SCoRE को तीन अलग-अलग स्टेशनों वाले एक कारखाने के रूप में सोचें:

  • स्टेशन 1: निर्माता (Generation)
    AI टेक्स्ट के एक हिस्से को पढ़ता है और आसान और कठिन प्रश्नों का मिश्रण बनाता है। यह सुनिश्चित करता है कि कठिन प्रश्नों के साथ एक "तर्क पथ" (CoT) भी हो, जो यह दिखाए कि उत्तर तक पहुँचने का सटीक तरीका क्या है।
  • स्टेशन 2: निरीक्षक (Quality Control)
    यह महत्वपूर्ण है। AI अपने काम की जाँच करता है। वह खुद से पूछता है: "क्या मैंने ऐसा उत्तर बना दिया है जो टेक्स्ट में मौजूद ही नहीं है?" या "क्या मैंने इसे 'तर्क' वाला प्रश्न कहा जबकि उत्तर सिर्फ एक शब्द था जिसे मैंने कॉपी किया था?" यदि उत्तर "नहीं" है, तो वह खराब प्रश्न को ठीक करता है या हटा देता है।
    • पेपर का ट्विस्ट: शोध में पाया गया कि निरीक्षण के इस चरण के लिए एक अलग, अधिक स्मार्ट AI का उपयोग करना (उस AI के बजाय जिसने प्रश्न बनाए थे) एक सख्त शिक्षक की तरह काम करता है जो छात्र के होमवर्क को ग्रेड करता है। यह AI को खुद को धोखा देने से रोकता है और बहुत उच्च-गुणवत्ता वाला डेटा बनाता है।
  • स्टेशन 3: छली (Counterfactuals)
    प्रशिक्षण को और अधिक कठिन बनाने के लिए, AI "डिस्ट्रैक्टर्स" (distractors) बनाता है। ये वे गलत उत्तर हैं जो बहुत विश्वसनीय दिखते हैं (जैसे कि एक ट्रिकी बहुविकल्पीय विकल्प)। यह मॉडल को सावधान रहने और केवल अनुमान न लगाने के लिए प्रशिक्षित करता है।

3. परिणाम: यह गेम चेंजर क्यों है

लेखकों ने अपने मॉडल को D-SCoRE के स्वचालित रूप से उत्पन्न डेटा पर प्रशिक्षित करके और प्रसिद्ध, मानव-लिखित डेटासेट (जैसे SQuAD) के साथ प्रशिक्षित मॉडलों की तुलना करके इसका परीक्षण किया।

  • कम में बेहतर: D-SCoRE डेटा पर प्रशिक्षित मॉडल, मानव डेटा पर प्रशिक्षित मॉडलों की तुलना में समान रूप से या उससे भी बेहतर प्रदर्शन करते हैं, भले ही D-SCoRE ने केवल एक-तिहाई उदाहरणों का उपयोग किया हो।
  • "रीजनिंग ट्रांसफर" (Reasoning Transfer): भले ही अंतिम परीक्षण सरल "उत्तर ढूँढने" वाले कार्य थे, लेकिन कठिन, तर्क-प्रधान D-SScRE डेटा पर प्रशिक्षित मॉडल उनमें बेहतर थे। यह ऐसा है जैसे एक छात्र जो जटिल तर्क पहेलियाँ हल करने का अभ्यास करता है, वह अचानक सरल शब्दावली परीक्षणों में भी बहुत अच्छा हो जाता है क्योंकि उसका दिमाग अधिक तेज हो गया है।
  • गति और लागत: यह प्रणाली अविश्वसनीय रूप से तेज़ है। एक मानक, उपभोक्ता-ग्रेड कंप्यूटर (जैसे एक हाई-एंड गेमिंग पीसी) पर, यह एक घंटे में 1,100 से अधिक उच्च-गुणवत्ता वाले प्रश्न-उत्तर जोड़े उत्पन्न कर सकती है। यह संभव बनाता है कि कोई भी बिना सुपरकंप्यूटर के कस्टम प्रशिक्षण डेटा बना सके।

4. निष्कर्ष

D-SCoRE किसी भी टेक्स्ट को AI के लिए एक व्यक्तिगत, उच्च-गुणवत्ता वाले प्रशिक्षण मैनुअल में बदलने का एक तरीका है। केवल याद रखने के बजाय तर्क (reasoning) पर ध्यान केंद्रित करके, और काम की जाँच करने के लिए एक सख्त "दूसरी जोड़ी आँखों" का उपयोग करके, यह ऐसा डेटा बनाता है जो दक्षता और प्रदर्शन में मानव-लिखित उदाहरणों को भी मात देता है।

यह साबित करता है कि स्मार्ट AI बनाने के लिए आपको मानव प्रशिक्षकों की एक विशाल सेना की आवश्यकता नहीं है; आपको बस AI को सोचना सिखाने के लिए सही स्वचालित ढांचे की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →