← नवीनतम पेपर
💬 NLP

DS2^2-Instruct: Domain-Specific Data Synthesis for Large Language Models Instruction Tuning

यह शोधपत्र DS2^2-Instruct को प्रस्तुत करता है, जो एक ज़ीरो-शॉट फ्रेमवर्क है जो कार्य-सूचित कीवर्ड्स (task-informed keywords) को ब्लूम्स टैक्सोनॉमी (Bloom's Taxonomy) और सेल्फ-कंसिस्टेंसी वैलिडेशन के साथ जोड़कर उच्च-गुणवत्ता वाले, डोमेन-विशिष्ट इंस्ट्रक्शन ट्यूनिंग डेटासेट को संश्लेषित करता है, जिससे बिना मानव एनोटेशन के विशिष्ट क्षेत्रों में लार्ज लैंग्वेज मॉडल के प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Ruiyao Xu, Noelle I. Samia, Han Liu

प्रकाशित 2026-03-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruiyao Xu, Noelle I. Samia, Han Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन सामान्य ज्ञान वाले छात्र (एक लार्ज लैंग्वेज मॉडल, या LLM) को किसी बहुत ही विशिष्ट क्षेत्र, जैसे कि वित्त (finance), चिकित्सा (medicine), या उन्नत गणित (advanced math) में विश्व-स्तरीय विशेषज्ञ बनने के लिए सिखाना चाहते हैं।

समस्या यह है कि उन्हें सिखाने के लिए, आपको आमतौर पर एक मानव विशेषज्ञ द्वारा हजारों अभ्यास प्रश्न और उत्तर लिखवाने की आवश्यकता होती है। यह एक किताब को शून्य से लिखने के लिए प्रोफेसरों की एक टीम को काम पर रखने जैसा है। यह महंगा है, धीमा है, और इसे बड़े पैमाने पर लागू करना कठिन है।

मौजूदा तरीके AI का उपयोग प्रश्न लिखने के लिए करते हैं, लेकिन वे अक्सर एक सामान्य विश्वकोश लेखक की तरह व्यवहार करते हैं। वे पूछ सकते हैं, "स्टॉक क्या है?" लेकिन वे उस गहरे, जटिल तर्क को मिस कर देते हैं जिसकी एक वास्तविक वित्तीय विश्लेषक को आवश्यकता होती है। उनमें उस विशिष्ट क्षेत्र का "स्वाद" नहीं होता है।

DS2-INSTRUCT एक नया, चतुर ढांचा (framework) है जो इसे हल करता है। यह एक अत्यधिक कुशल, अथक AI शिक्षण सहायक (Teaching Assistant) के रूप में कार्य करता है जो बिना किसी मानव शिक्षक को एक भी प्रश्न लिखे, किसी भी विषय के लिए एक कस्टम पाठ्यक्रम बना सकता है।

यह कैसे काम करता है, इसे "लाइब्रेरी और परीक्षा निर्माता" उपमा (analogy) का उपयोग करके तीन सरल चरणों में समझा जा रहा है:

चरण 1: शब्दावली सूची बनाना (The "Keyword Expansion")

प्रश्न लिखने से पहले, आपको पता होना चाहिए कि कौन से शब्द महत्वपूर्ण हैं।

  • पुराना तरीका: आप "पैसा" या "स्टॉक" जैसे कुछ शब्दों का अनुमान लगाते हैं और उम्मीद करते हैं कि इतना पर्याप्त होगा।
  • DS2-INSTRUCT का तरीका: यह कुछ बीज शब्दों (seed words) से शुरू होता है (जैसे, "पोर्टफोलियो")। फिर, यह दो चीजें करता है:
    1. पीछे की ओर देखना: यह पूछता है, "पोर्टफोलियो को समझने से पहले आपको किन बुनियादी अवधारणाओं को जानने की आवश्यकता है?" (जैसे, "जोखिम", "विविधीकरण")।
    2. आगे की ओर देखना: यह पूछता है, "पोर्टफोलियो के ऊपर कौन से उन्नत विषय बनते हैं?" (जैसे, "डेरिवेटिव्स", "हेजिंग रणनीतियां") में।
    3. लाइब्रेरी की जाँच करना: यह केवल अनुमान नहीं लगाता; यह वास्तविक दस्तावेजों (जैसे विकिपीडिया या शैक्षणिक शोध पत्र) को पढ़ता है ताकि वास्तविक विशेषज्ञों द्वारा उपयोग किए जाने वाले सटीक पेशेवर शब्दों को खोजा जा सके।
    • परिणाम: एक विशाल, व्यापक कीवर्ड सूची जो शुरुआती बुनियादी बातों से लेकर विशेषज्ञ-स्तर की शब्दावली तक सब कुछ कवर करती है।

चरण 2: प्रश्न लिखना (The "Bloom's Taxonomy" मेनू)

अब जब इसके पास शब्दावली है, तो इसे प्रश्न लिखने की आवश्यकता है। एक बुरा शिक्षक केवल पूछता है, "X क्या है?" (स्मृति/याद रखना)। एक महान शिक्षक ऐसे प्रश्न पूछता है जो आपको सोचने पर मजबूर करें।

  • उपमा: एक रेस्टोरेंट मेनू की कल्पना करें। अधिकांश AI केवल "एपेटाइज़र" (Appetizers) परोसते हैं (सरल स्मरण)। DS2-INSTRUCT ब्लूम्स टैक्सोनॉमी (Bloom's Taxonomy) (एक प्रसिद्ध शैक्षिक ढांचा) के आधार पर एक पूरा कोर्स मील (full-course meal) तैयार करता है।
    • एपेटाइज़र (याद रखना - Remember): "'मुद्रास्फीति (inflation)' को परिभाषित करें।"
    • मुख्य व्यंजन (लागू करना - Apply): "यदि मुद्रास्फीति 5% है, तो यह आपके बॉन्ड पोर्टफोलियो को कैसे प्रभावित करती है?"
    • मिठाई (निर्माण करना - Create): "एक नई निवेश रणनीति डिजाइन करें जो उच्च मुद्रास्फीति से सुरक्षा प्रदान करे।"
  • यह क्यों महत्वपूर्ण है: AI को कठिनाई के हर स्तर (सरल परिभाषाओं से लेकर जटिल निर्माण तक) पर प्रश्न लिखने के लिए मजबूर करके, छात्र केवल रटना नहीं, बल्कि तर्क करना सीखता है।

चरण 3: "स्व-जांच" (गुणवत्ता नियंत्रण)

कभी-कभी, AI भी गलतियाँ कर सकता है या भ्रमित हो सकता है। यदि आप AI से एक कठिन प्रश्न पूछते हैं, तो वह गलत उत्तर दे सकता है।

  • उपमा: कल्पना कीजिए कि आप एक टेस्ट ग्रेड कर रहे हैं। एक छात्र के उत्तर पर भरोसा करने के बजाय, आप उसी प्रश्न को AI के पांच अलग-अलग संस्करणों से पूछते हैं।
    • यदि चार कहते हैं "उत्तर A" और एक कहता है "उत्तर B", तो आप "उत्तर A" पर भरोसा करते हैं।
    • यदि वे सभी अलग-अलग, विरोधाभासी उत्तर देते हैं, तो आप जानते हैं कि प्रश्न बहुत अस्पष्ट या भ्रमित करने वाला था, इसलिए आप उसे फेंक देते हैं
  • परिणाम: केवल सबसे स्पष्ट, सबसे सुसंगत प्रश्न और उत्तर ही अंतिम पाठ्यपुस्तक में शामिल होते हैं।

बड़ी तस्वीर: यह गेम-चेंजर क्यों है?

इस पेपर ने इस प्रणाली का परीक्षण सात कठिन क्षेत्रों में किया: गणित, वित्त, चिकित्सा, तर्क, विज्ञान, आदि।

  • परिणाम: जब उन्होंने इस डेटा का उपयोग छोटे AI मॉडल को प्रशिक्षित करने के लिए किया जिसे DS2-INSTRUCT द्वारा उत्पन्न किया गया था, तो वे मॉडल अन्य तरीकों द्वारा प्रशिक्षित मॉडलों की तुलना में काफी अधिक स्मार्ट हो गए।
  • रूपक: यह एक स्मार्ट हाई स्कूल के छात्र को एक कस्टम-मेड, विशेषज्ञ-स्तरीय पाठ्यक्रम देने जैसा है। उन्होंने केवल तथ्यों को नहीं सीखा; उन्होंने सीखा कि एक पेशेवर की तरह कैसे सोचें

संक्षेप में: DS2-INSTRUCT एक "ज़ीरो-शॉट" (जिसका अर्थ है कि इसे किसी मानवीय सहायता की आवश्यकता नहीं है) फैक्ट्री है जो स्वचालित रूप से उच्च-गुणवत्ता वाला, डोमेन-विशिष्ट प्रशिक्षण डेटा बनाती है। यह सुनिश्चित करता है कि AI सही शब्द सीखे, सही गहराई से सोचे, और केवल उन्हीं प्रश्नों के साथ अभ्यास करे जिन्हें गुणवत्ता के लिए कड़ाई से जांचा गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →