FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale
यह शोध पत्र FineInstructions को प्रस्तुत करता है, जो प्री-ट्रेनिंग कॉर्पोरा से अरबों सिंथेटिक निर्देश-प्रतिक्रिया युग्मों को उत्पन्न करने की एक विधि है जो बड़े भाषा मॉडल (LLMs) को केवल एक इंस्ट्रक्शन-ट्यूनिंग उद्देश्य पर शून्य से प्री-ट्रेन करने में सक्षम बनाती है, जिसके परिणामस्वरूप मानक प्री-ट्रेनिंग दृष्टिकोणों की तुलना में फ्री-फॉर्म रिस्पॉन्स बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को इंसानों के साथ चैट करना सिखाने की कोशिश कर रहे हैं। आमतौर पर, हम इसे इस तरह करते हैं जैसे रोबोट को किताबों का एक विशाल पुस्तकालय दे दिया जाए और कहा जाए, "सब कुछ पढ़ो और अगले शब्द का अनुमान लगाओ।" इसे प्री-ट्रेनिंग (Pre-training) कहा जाता है। यह वह तरीका है जिससे रोबोट तथ्य, इतिहास और वाक्यों की संरचना सीखता है। लेकिन यहाँ एक पेंच है: लाखों किताबें पढ़ने के बाद, रोबोट वाक्य पूरे करने में तो माहिर हो जाता है, लेकिन वास्तव में सवालों के जवाब देने या निर्देशों का पालन करने में बहुत खराब रहता है। यह एक ऐसे छात्र की तरह है जिसने पूरी विश्वकोश (encyclopedia) रट ली है, लेकिन जब आप उससे पूछते हैं, "मेरे पास का सबसे अच्छा पिज्जा प्लेस कौन सा है?" तो वह घबरा जाता है।
इसे ठीक करने के लिए, हम आमतौर पर रोबोट को "इंस्ट्रक्शन कार्ड्स" (निर्देश कार्डों) का एक छोटा, विशेष सेट देते हैं—सवाल और उनके सटीक जवाब—और कहते हैं, "इस शैली को सीखो!" लेकिन एक समस्या है: हमारे पास ऐसे कार्ड्स बहुत कम हैं। हमारे पास केवल कुछ हज़ार या शायद कुछ मिलियन ही हैं, जो ऐसा है जैसे आप सिर्फ एक पाठ्यपुस्तक के सहारे पूरे स्कूल के छात्रों को पढ़ाने की कोशिश कर रहे हों।
बड़ी अवधारणा: "रेसिपी बुक" क्रांति
इस पेपर के लेखकों ने, जो COLM 2026 में प्रकाशित हुआ है, एक क्रांतिकारी विचार दिया: क्यों न किताबों के पूरे पुस्तकालय को ही इंस्ट्रक्शन कार्ड्स में बदल दिया जाए?
उन्होंने FineInstructions नामक एक मशीन बनाई। इसे एक जादुई रसोईघर की तरह समझें।
- सामग्री (Ingredients): उन्होंने इंटरनेट से वास्तविक दस्तावेजों का एक बड़ा ढेर लिया (लगभग 300 बिलियन शब्दों का टेक्स्ट)।
- रेसिपी कार्ड्स: उन्होंने लगभग 18 मिलियन वास्तविक सवाल और प्रॉम्प्ट्स से शुरुआत की जो वास्तव में इंसानों ने ऑनलाइन पूछे थे (जैसे "कौन अधिक प्रभावशाली है: मेसी या रोनाल्डो?")। उन्होंने इन सवालों को "रेसिपी कार्ड्स" (टेम्पलेट्स) में बदलकर इन्हें तैयार किया, जिसमें विशिष्ट नामों को खाली जगह (blanks) से बदल दिया गया। उदाहरण के लिए, "
और के बीच, कौन अधिक है?" - खाना बनाना (The Cooking): मशीन एक दस्तावेज़ (मान लीजिए, स्मार्टवॉच के बारे में एक ब्लॉग पोस्ट) को देखती है और पूछती है, "क्या यह ब्लॉग पोस्ट हमारे किसी रेसिपी कार्ड से मेल खाता है?" यदि ब्लॉग एप्पल वॉच और गारमिन के बारे में बात करता है, तो यह "कौन अधिक मजबूत है?" वाली रेसिपी से मेल खाता है।
- भोजन (The Meal): मशीन फिर ब्लैंक्स को उस ब्लॉग पोस्ट का उपयोग करके भर देती है ताकि एक सटीक प्रश्न और उत्तर का जोड़ा बनाया जा सके। यह ऐसा है जैसे वह ब्लॉग पोस्ट अचानक एक प्रश्न-उत्तर सत्र बन गया हो।
परिणाम: एक अरब नए सबक
ऐसा करके, उन्होंने FineInstructions नामक एक डेटासेट बनाया जिसमें 1 बिलियन से अधिक सिंथेटिक इंस्ट्रक्शन-आंसर जोड़े शामिल हैं। यह बहुत बड़ा है! यह पूरी लाइब्रेरी को एक अरब फ्लैशकार्ड्स में बदलने जैसा है।
उन्होंने क्या पाया (प्रमाण)
टीम ने छोटे रोबोट दिमाग (1.8 बिलियन पैरामीटर्स वाले मॉडल) को शुरू से ही केवल इन नए इंस्ट्रक्शन कार्ड्स का उपयोग करके प्रशिक्षित किया। उन्होंने पुराने "अगले शब्द का अनुमान लगाने" वाले तरीके का उपयोग बिल्कुल नहीं किया।
- स्कोर: जब उन्होंने इन रोबोट्स का परीक्षण उन बेंचमार्क पर किया जो वास्तविक मानवीय प्रश्नों के उत्तर देने की उनकी क्षमता को मापते हैं (जैसे MixEval, MT-Bench-101, और AlpacaEval), तो FineInstructions पर प्रशिक्षित रोबोट्स ने प्रतियोगिता को पछाड़ दिया।
- तुलना: उन्होंने अपने तरीके की तुलना किताबों को सवालों में बदलने के अन्य शानदार तरीकों (जैसे IPT और Nemotron-CC) से की। FineInstructions वाले रोबोट्स एक बड़े अंतर से जीते। उदाहरण के लिए, MixEval बेंचमार्क पर, उन्होंने Nemotron-CC विधि की तुलना में लगभग 39% और मानक प्रशिक्षण की तुलना में 69% बेहतर प्रदर्शन किया।
- "जीत की दर" (Win Rate): आमने-सामने की चैट में अन्य मॉडल्स के खिलाफ मुकाबला करने पर, FineInstructions मॉडल लगभग 76% बार Nemotron-CC बेसलाइन के खिलाफ जीता।
वे स्पष्ट रूप से क्या नहीं कहते (Disclaimer)
यह जानना महत्वपूर्ण है कि यह पेपर क्या दावा नहीं करता है।
- यह "परप्लेक्सिटी" (Perplexity) के बारे में नहीं है: लेखक स्वीकार करते हैं कि यदि आप वाक्य में अगले शब्द की भविष्यवाणी करने की रोबोट की क्षमता को मापते हैं (एक मानक परीक्षण जिसे परप्लेक्सिटी कहा जाता है), तो उनका तरीका पुराने तरीके की तुलना में वास्तव में खराब हो सकता है। उन्हें उस टेस्ट की परवाह नहीं है। उन्हें इस बात की परवाह है कि रोबोट इंसानों के लिए कितना उपयोगी है।
- यह "जादू" या "डिस्टिलेशन" (Distillation) नहीं है: कुछ पिछले तरीकों ने एक सुपर-स्मार्ट रोबोट का उपयोग करके सभी सवाल लिखने की कोशिश की थी। लेखक तर्क देते हैं कि इससे नया रोबत केवल पुराने वाले की शैली की नकल करता है, बिना कुछ नया सीखे। उनका तरीका अलग है क्योंकि वे वास्तविक मानवीय प्रश्नों का उपयोग करते हैं और उनके उत्तरों को वास्तविक दस्तावेजों पर आधारित करते हैं, न कि काल्पनिक कहानियों पर।
- यह "हल की गई समस्या" (Solved Problem) नहीं है: पेपर सुझाव देता है कि यह दृष्टिकोण एक बड़ा कदम है, लेकिन वे नोट करते हैं कि जटिल टेम्पलेट्स को पूरी तरह से मैच करना अभी भी कठिन है। वे यह भी स्वीकार करते हैं कि उनके वर्तमान सेटअप में कुछ मैनुअल ट्यूनिंग (जैसे कि एक विशिष्ट मैचिंग स्कोर 0.865 चुनना) शामिल है जो शायद अभी तक पूर्णतः सटीक सेटिंग नहीं है।
निष्कर्ष (The Bottom Line)
पेपर सुझाव देता है कि रोबोट्स को डेटा खिलाने के तरीके को बदलकर—कच्चे टेक्स्ट को एक अरब यथार्थवादी Q&A जोड़ों में बदलकर—हम उन्हें निर्देश मानने और इंसानों की मदद करने में बहुत बेहतर बना सकते हैं, भले ही हमें पारंपरिक "अगले शब्द का अनुमान लगाने" वाले प्रशिक्षण को छोड़ना पड़े। यह एक रोबोट को "पाठक" बनने के बजाय एक "सहायक" बनने की शिक्षा देने की ओर एक बदलाव है।
लेखक अपने परिणामों के प्रति आश्वस्त हैं क्योंकि उन्होंने नियंत्रित प्रयोग किए जहाँ प्रत्येक रोबोट को सीखने के लिए बिल्कुल समान मात्रा में टेक्स्ट मिला, बस एक अलग प्रारूप में। डेटा दिखाता है कि "इंस्ट्रक्शन-ओनली" प्रारूप वास्तविक दुनिया के कार्यों के लिए बहुत अधिक स्मार्ट और सहायक रोबोट बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।