Agentic Instruction Data Selection: Let DataMaster Interpret Your Intent
यह शोध पत्र DataMaster को प्रस्तुत करता है, जो एक स्वचालित एजेंट है जो प्राकृतिक भाषा के माध्यम से उपयोगकर्ता के इरादे की व्याख्या करता है ताकि अनुकूलतम निर्देश डेटा चयन रणनीतियों को स्वायत्त रूप से संकलित किया जा सके, जिससे मैनुअल ह्यूरिस्टिक डिज़ाइन की आवश्यकता समाप्त हो जाती है और विविध डोमेन में स्थिर बेसलाइन से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को सोचना सिखाने की कोशिश कर रहे हैं। आपके पास किताबों का एक विशाल पुस्तकालय है, लेकिन उनमें से अधिकांश केवल रैंडम शोर (noise) हैं, या वे रोबोट को ऐसी चीजें सिखाते हैं जो वह पहले से ही जानता है, या वे ऐसी भाषा में लिखे गए हैं जिन्हें रोबोट समझ नहीं सकता। यदि आप पूरा पुस्तकालय बस रोबोट के सामने फेंक देंगे, तो वह भ्रमित हो जाएगा, समय बर्बाद करेगा, और शायद बुरी आदतें भी सीख लेगा। यह लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया है, जो चैटबॉट्स और कोड जनरेटर को शक्ति देने वाले बुद्धिमान AI सिस्टम हैं। उन्हें विशिष्ट कार्यों में बेहतर बनाने के लिए—जैसे गणित की समस्याओं को हल करने या चिकित्सा सलाह लिखने के लिए—इंसानों को आमतौर पर एक लाइब्रेरियन की तरह काम करना पड़ता है, जो ढेर से सबसे "अच्छी" किताबें खुद चुनता है। लेकिन यहाँ एक पेंच है: गणित के पाठ के लिए "सबसे अच्छी" किताब, चिकित्सा के पाठ के लिए "सबसे अच्छी" किताब से बिल्कुल अलग होती है। हर स्थिति के लिए एकदम सही किताबें चुनने के लिए नियमों का एक ही सेट लिखने की कोशिश करना, कागज, बाल और स्टील काटने के लिए एक ही जोड़ी कैंची का उपयोग करने जैसा है; यह ठीक से काम नहीं करता है।
यहीं पर डेटामास्टर (DataMaster) नामक एक नया विचार आता है। डेटामास्टर को एक कठोर नियम पुस्तिका के रूप में नहीं, बल्कि एक अत्यधिक कुशल, जिज्ञासु सहायक के रूप में सोचें जो आपके मन को पढ़ सकता है। आपको इसे "500 शब्द और बिना चित्रों वाली किताबें चुनें" जैसे लंबे और सख्त निर्देश देने के बजाय, आप इसे साधारण अंग्रेजी में बता सकते हैं कि आप क्या चाहते हैं, जैसे "मुझे ऐसी कहानियाँ चाहिए जो मुझे कठिन गणितीय पहेलियों को हल करना सिखाएं।" इसके बाद डेटामास्टर एक जासूसी मिशन पर निकलता है। यह डेटा के बिखरे हुए ढेर को देखता है, यह समझता है कि आपको वास्तव में क्या चाहिए, और एकदम सही नमूने खोजने के लिए स्वचालित रूप से कस्टम फिल्टर की एक टीम बनाता है। यह एक व्यक्तिगत शेफ की तरह है जो न केवल रेसिपी का पालन करता है बल्कि सामग्री का स्वाद लेता है, आपके मूड की जांच करता है, और आपके लिए बिल्कुल वैसा ही भोजन बनाता है जिसकी आपको इच्छा है, चाहे वह तीखा स्टिर-फ्राई हो या हल्का सूप।
समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) का जाल
कुछ समय से, वैज्ञानिक "खराब डेटा" की समस्या को हल करने के लिए डेटा की गुणवत्ता को स्कोर करने के लिए फैंसी गणितीय सूत्रों का उपयोग करने की कोशिश कर रहे हैं। वे इन सूत्रों को "मेट्रिक्स" कहते हैं। कुछ मेट्रिक्स देखते हैं कि डेटा उच्च गुणवत्ता वाला है या नहीं, कुछ देखते हैं कि यह कितना कठिन है, और कुछ देखते हैं कि यह कितना दिलचस्प है। लेकिन समस्या यह है कि ये सूत्र स्थिर (static) हैं। वे धूप के चश्मे की तरह हैं जो केवल नीली रोशनी को ही अंदर आने देते हैं। यदि आप लाल रोशनी देखना चाहते हैं, तो आप भाग्यशाली नहीं होंगे।
इस शोधपत्र के पीछे के शोधकर्ताओं ने पाया कि वास्तविक दुनिया का डेटा अव्यवस्थपूर्ण और जटिल है। गणित की समस्याएं चुनने के लिए काम करने वाली विधि चिकित्सा संबंधी प्रश्नों को चुनने में बुरी तरह विफल हो सकती है। अतीत में, डेवलपर्स को हर नए प्रोजेक्ट के लिए इन सूत्रों को मैन्युअल रूप से ट्यून करना पड़ता था, जो धीमा, उबाऊ और गलतियों से भरा था। वे एक चौकोर टुकड़े को गोल छेद में जबरदस्ती फिट करने की कोशिश में फंसे हुए थे, इस उम्मीद में कि शायद छेद थोड़ा खिंच जाए।
समाधान: डेटामास्टर से मिलिए, एक 'इरादा समझने वाला एजेंट'
लेखक एक बड़ा बदलाव प्रस्तावित करते हैं: खुद एक आदर्श नियम पुस्तिका लिखने की कोशिश करना बंद करें। इसके बजाय, एक AI एजेंट (एक स्मार्ट प्रोग्राम जो निर्णय ले सकता है) को आपके लिए काम करने दें। वे इस सिस्टम को डेटामास्टर कहते हैं।
डेटामास्टर एक चार-चरणीय असेंबली लाइन की तरह काम करता है, लेकिन कन्वेयर बेल्ट के बजाय, यह बुद्धिमान निर्णयों का एक प्रवाह है। आप अपने लक्ष्य का वर्णन करने वाला एक सरल वाक्य देते हैं, और यह आपके लक्ष्य को चार अलग-अलग कार्यों में विभाजित करता है:
- डोमेन डिटेक्टिव (क्षेत्र का जासूस): सबसे पहले, यह पूछता है, "हम किस तरह की दुनिया में हैं?" यदि आप "गणित" कहते हैं, तो यह सभी कुकिंग रेसिपी और इतिहास की किताबों को अनदेखा कर देता है। यह समान डेटा को समूहबद्ध करने के लिए एक स्मार्ट सॉर्टिंग मशीन का उपयोग करता है और गणित के क्लस्टर्स को चुन लेता है, बाकी सबको पीछे छोड़ देता है।
- कैरेक्टर इंस्पेक्टर (चरित्र निरीक्षक): इसके बाद, यह मिले हुए डेटा को देखता है और पूछता है, "यह डेटा कैसा दिखता है?" यह देख सकता है कि गणित की समस्याएं बहुत छोटी हैं या उनका फॉर्मेट अजीब है। एक निश्चित नियम जैसे "100 शब्द होने चाहिए" का उपयोग करने के बजाय, यह तुरंत एक कस्टम नियम बनाता है, जैसे "उनको रखें जो असली टेक्स्टबुक की समस्याओं की तरह दिखते हैं।"
- लर्निंग वैल्यू स्काउट (सीखने के मूल्य का खोजकर्ता): यह सबसे चतुर हिस्सा है। डेटामास्टर यह जांचता है कि लक्ष्य रोबोट (जिसे आप प्रशिक्षित कर रहे हैं) प्रत्येक डेटा के टुकड़े से कितना सीखेगा। यह पूछता है, "क्या यह रोबोट यह पहले से जानता है? क्या यह बहुत आसान है? क्या यह बहुत भ्रमित करने वाला है?" यह इस विशिष्ट रोबोट के लिए एक कस्टम स्कोरकार्ड बनाता है, जो विभिन्न कारकों (जैसे कि डेटा पढ़ने से रोबोट के मस्तिष्क में कितना बदलाव आता है) को तौलकर सीखने का "स्वीट स्पॉट" ढूंढता है।
- क्वालिटी जज (गुणवत्ता न्यायाधीश): अंत में, यह एक सख्त संपादक की तरह कार्य करता है। यह शेष शीर्ष उम्मीदवारों को पढ़ता है और पूछता है, "क्या यह वास्तव में अच्छा है?" लेकिन फिर से, यह एक सामान्य "अच्छा" का उपयोग नहीं करता है। यदि आपने गणित मांगा है, तो यह तार्किक चरणों की तलाश करता है। यदि आपने कोड मांगा है, तो यह बग्स की तलाश करता है। यह इस कार्य के लिए विशेष रूप से एक कस्टम ग्रेडिंग रूब्रिक बनाता है और सबसे बेहतरीन नमूनों को चुनता है।
उन्होंने क्या पाया: अनुकूलन का जादू
शोधकर्ताओं ने तीन बहुत अलग दुनियाओं पर डेटामास्टर का परीक्षण किया: गणित (Math), चिकित्सा (Medicine), और कोडिंग (Coding)। उन्होंने तीन अलग-अलग रोबोट दिमागों (मॉडल्स) का उपयोग किया यह देखने के लिए कि क्या डेटामास्टर उन्हें बेहतर सीखने में मदद कर सकता है।
परिणाम प्रभावशाली थे। अधिकांश परीक्षणों में, डेटामास्टर द्वारा चुने गए 10,000 उदाहरणों के समूह ने रोबोट को पूरे, बिखरे हुए, बिना क्यूरेट किए गए पुस्तकालय (जो 10 से 40 गुना बड़ा हो सकता है!) पर प्रशिक्षित करने की तुलना में बेहतर प्रदर्शन कराया।
- स्थिर नियमों को पछाड़ना: डेटामास्टर ने लगातार पुराने, स्थिर तरीकों को पछाड़ दिया। 18 में से 16 अलग-अलग परीक्षण परिदृश्यों में, डेटामास्टर द्वारा चुने गए डेटा पर प्रशिक्षित रोबोट ने, सबसे अच्छे फिक्स्ड-रूल मेथड्स पर प्रशिक्षित रोबोट की तुलना में उच्च स्कोर प्राप्त किया।
- "फुल पूल" को पछाड़ना: आश्चर्यजनक रूप से, 18 में से 12 मामलों में, डेटामास्टर के छोटे, सटीक सबसेट पर प्रशिक्षित रोबोट ने, पूरे विशाल डेटासेट पर प्रशिक्षित रोबोट की तुलना में बेहतर प्रदर्शन किया। यह सुझाव देता है कि अधिक डेटा होना हमेशा बेहतर नहीं होता; सही डेटा होना ही वास्तव में मायने रखता है।
- अन्य AI सहायकों को पछाड़ना: उन्होंने डेटामास्टर की तुलना एक अन्य AI सिस्टम (क्लॉड कोड) से भी की, जो यही काम करने की कोशिश कर रहा था। डेटामास्टर अक्सर जीत गया, जिससे पता चलता है कि इसका विशिष्ट चार-चरणीय, कैस्केडिंग दृष्टिकोण एक ही बार में "सबसे अच्छा सामान" चुनने के लिए AI से पूछने की तुलना में अधिक प्रभावी है।
यह क्यों महत्वपूर्ण है
यह शोधपत्र सुझाव देता है कि अब हमें प्रशिक्षण डेटा को क्यूरेट करने के लिए विशेषज्ञ डेटा वैज्ञानिक होने की आवश्यकता नहीं है। हमें बस यह बताने में सक्षम होना चाहिए कि हम क्या चाहते हैं। डेटामास्टर डेटा को "हाथ से चुनने" के थकाऊ और त्रुटि-प्रवण कार्य को एक सरल बातचीत में बदल देता है।
लेखकों का कहना है कि हालांकि यह उनके द्वारा परीक्षण किए गए 7-बिलियन से 8-बिलियन पैरामीटर वाले मॉडल्स के लिए बहुत अच्छा काम करता है, लेकिन यह अभी भी एक सुझाव है कि यह और भी बड़े मॉडल्स के लिए काम कर सकता है। वे यह भी बताते हैं कि इस सिस्टम का उपयोग करने की लागत बहुत कम है—एक कार्य को चलाने के लिए AI एजेंट लगभग $5 खर्च करता है।
संक्षेप में, डेटामास्टर सुझाव देता है कि AI को सिखाने का भविष्य बड़े, अधिक जटिल नियम पुस्तिकाएं बनाने के बारे में नहीं है। यह ऐसे स्मार्ट सहायकों के बारे में है जो आपके इरादे को सुन सकें, डेटा की जटिलता को समझ सकें और आपके लिए एकदम सही पाठ योजना तैयार कर सकें। यह "यहाँ नियम हैं, इनका पालन करो" से बदलकर "यहाँ मेरा लक्ष्य है, सबसे अच्छा तरीका पता लगाओ" की ओर एक बदलाव है। और इन प्रयोगों में, यह दृष्टिकोण चमत्कारिक परिणाम दे रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।