Scaling Towards the Information Boundary of Instruction Sets: The Infinity Instruct Subject Technical Report
वर्तमान निर्देश डेटासेट की कवरेज और जटिलता संबंधी सीमाओं को संबोधित करने के लिए, यह शोध पत्र निरंतर डेटा विकास के लिए एक व्यवस्थित, पुनरावृत्ति क्लोज्ड-लूप फ्रेमवर्क का प्रस्ताव करता है और "इन्फिनिटी इंस्ट्रक्ट सब्जेक्ट" (Infinity Instruct Subject) पेश करता है, जो 1.5 मिलियन निर्देशों का एक उच्च-गुणवत्ता वाला डेटासेट है जो बड़े पैमाने के मॉडलों की निर्देश-अनुसरण करने की क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विश्व-स्तरीय शेफ को प्रशिक्षित करने की कोशिश कर रहे हैं।
यदि आप उस शेफ को केवल ग्रिल्ड चीज़ सैंडविच और स्क्रैम्बल एग्स (scrambled eggs) की रेसिपी देते हैं, तो वह नाश्ते का उस्ताद तो बन जाएगा, लेकिन यदि कोई ग्राहक उससे बीफ वेलिंगटन (Beef Wellington) या सुशी (Sushi) के लिए पूछेगा, तो वह पूरी तरह से खो जाएगा। भले ही आप उसे ग्रिल्ड चीज़ बनाने के दस मिलियन अलग-अलग तरीके दे दें, फिर भी वह सुशी बनाना नहीं सीख पाएगा।
यह शोध पत्र, "द इन्फिनिटी इंस्ट्रक्ट सब्जेक्ट" (The Infinity Instruct Subject), आर्टिफिशियल इंटेलिजेंस के लिए ठीक इसी समस्या को हल करने के बारे में है।
समस्या: "मात्रा बनाम गुणवत्ता" का जाल
अभी, जब हम AI (जैसे ChatGPT) को प्रशिक्षित करते हैं, तो हम उसे निर्देशों के विशाल ढेर देते हैं। लेकिन इनमें से अधिकांश ढेर "दोहराव वाले" होते हैं। यह एक छात्र को लाखों गणित के सवाल देने जैसा है जो मूल रूप से "2 + 2" ही हैं। छात्र सरल गणित में बहुत तेज़ हो जाएगा, लेकिन वह कभी जटिल भौतिकी समीकरण (physics equation) हल करना या फ्रेंच में कविता लिखना नहीं सीख पाएगा।
शोधकर्ताओं ने AI प्रशिक्षण में दो मुख्य कमियां देखीं:
- कवरेज की कमी: AI ने कार्यों के पर्याप्त प्रकार नहीं देखे हैं (वह "गणित" जानता है लेकिन "प्राचीन इतिहास" नहीं जानता)।
- गहराई की कमी: AI ने पर्याप्त कठिन कार्य नहीं देखे हैं (वह "सरल गणित" जानता है लेकिन "जटिल तर्क" (complex logic) में विफल हो जाता है)।
समाधान: "अनंत प्रशिक्षण चक्र" (The Infinite Training Loop)
AI के मस्तिष्क में केवल अधिक डेटा डालने के बजाय, शोधकर्ताओं ने एक स्मार्ट, स्व-सुधार प्रणाली बनाई। इसे एक "स्मार्ट ट्यूटर" के रूप में सोचें जो चार चरणों का पालन करता है:
1. मास्टर लाइब्रेरियन (पदानुक्रमित टैगिंग - Hierarchical Tagging)
सबसे पहले, उन्होंने सब कुछ व्यवस्थित करने के लिए एक प्रणाली बनाई। कल्पना कीजिए कि एक लाइब्रेरी है जहाँ हर किताब को केवल "विज्ञान" के रूप में लेबल नहीं किया गया है, बल्कि उसे हजारों सूक्ष्म विवरणों के साथ टैग किया गया है: "क्वांटम फिजिक्स," "19वीं शताब्दी," "अंग्रेजी में लिखित," "कैलकुलस की आवश्यकता है।" यह शोधकर्ताओं को यह देखने की अनुमति देता है कि AI के मस्तिष्क में कौन सी "अलमारियाँ" खाली हैं।
2. खजाना खोजने वाला (सीड सिलेक्शन - Seed Selection)
रैंडम डेटा चुनने के बजाय, वे "सोने" की तलाश करते हैं। वे ऐसे निर्देशों की खोज करते हैं जो हैं:
- दुर्लभ (Rare): ऐसी चीजें जो AI ने बहुत कम देखी हैं ("लॉन्ग टेल")।
- कठिन (Hard): ऐसी चीजें जो AI को संघर्ष करने पर मजबूर करती हैं।
- जटिल (Complex): ऐसी चीजें जिनमें एक साथ कई कौशलों का उपयोग करने की आवश्यकता होती है।
3. इवोल्यूशनरी जिम (डेटा सिंथेसिस - Data Synthesis)
एक बार जब उन्हें एक अच्छा "सीड" (जैसे एक साधारण गणित का सवाल) मिल जाता है, तो वे उसे वहीं नहीं छोड़ते। वे इसे "विकसित" (evolve) करने के लिए एक एल्गोरिदम का उपयोग करते हैं। यह ब्रेड के एक बुनियादी नुस्खे को विदेशी मसालों के साथ एक जटिल, बहु-परतीय 'सॉरडो' (sourdough) में बदलने जैसा है। वे सरल निर्देशों को लेते हैं और उन्हें "बॉस-लेवल" चुनौतियों में बदल देते हैं।
4. डॉक्टर (कमी का निदान - Deficiency Diagnosis)
यह सबसे शानदार हिस्सा है। वे वास्तव में AI का "परीक्षण" करते हैं ताकि देख सकें कि वह कहाँ लड़खड़ाता है और गिरता है। यदि AI जीव विज्ञान (biology) के एक प्रश्न में विफल रहता है, तो सिस्टम कहता है, "अहा! AI में जीव विज्ञान की कमजोरी है!" इसके बाद, यह विशेष रूप से उस विशिष्ट कमजोरी को "ठीक" करने के लिए नए, लक्षित प्रशिक्षण अभ्यास बनाता है।
बड़ी खोज: "ज्ञान का इंटरनेट"
इस डेटा का अध्ययन करते समय, शोधकर्ताओं ने कुछ अद्भुत पाया। उन्होंने पाया कि AI में ज्ञान एक "स्केल-फ्री" (Scale-Free) पैटर्न का पालन करता है, बिल्कुल इंटरनेट या सोशल नेटवर्क की तरह।
एक सोशल नेटवर्क में, कुछ लोग (जैसे सेलिब्रिटी) सभी से जुड़े होते हैं, जबकि अधिकांश लोग केवल कुछ ही लोगों को जानते हैं। उन्होंने पाया कि AI के ज्ञान में, कुछ "मुख्य कौशल" (जैसे तर्क/Logic) सेलिब्रिटी की तरह कार्य करते हैं—वे लगभग हर अन्य विषय से जुड़े होते हैं। यह हमें AI के लिए अधिक "जुड़ा हुआ" और स्मार्ट मस्तिष्क बनाने में मदद करता है।
परिणाम
इस पद्धति का उपयोग करके, उन्होंने इन्फिनिटी इंस्ट्रक्ट सब्जेक्ट नामक एक डेटासेट बनाया। जब उन्होंने इसका उपयोग AI को प्रशिक्षित करने के लिए किया, तो मॉडल न केवल उन चीजों में बेहतर हुए जो वे पहले से जानते थे—बल्कि वे उन जटिल, कठिन और दुर्लभ कार्यों को संभालने में भी बहुत बेहतर हो गए जो आमतौर पर उन्हें उलझा देते हैं।
संक्षेप में: उन्होंने AI को "अधिक भोजन" खिलाना बंद कर दिया और उसे "बेहतर पोषण" देना शुरू कर दिया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।