AI Research Preference Models
यह शोध पत्र AI रिसर्च प्रिफरेंस मॉडल्स (RPMs) को प्रस्तुत करता है, जो निष्पादन के लिए सबसे आशाजनक मशीन लर्निंग रिसर्च उम्मीदवारों को कुशलतापूर्वक प्राथमिकता देने और चुनने के लिए फ्रोजन लैंग्वेज मॉडल्स का लाभ उठाते हैं, जिससे अनगाइडेड एजेंट्स की तुलना में कंप्यूटेशनल लागत में काफी कमी आती है और फ्रंटियर टास्क पर प्रगति में तेजी आती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, अनछुए आकाशगंगा की खोज कर रहे एक अंतरिक्ष यान के कप्तान हैं। आपके पास एक शक्तिशाली इंजन है जो पलक झपकते ही हजारों नए मानचित्र मार्ग (map routes) बना सकता है। हालाँकि, आपके जहाज के साथ एक गंभीर समस्या है: यह जांचना कि कोई मार्ग वास्तव में खजाने वाले द्वीप तक ले जाता है या नहीं, इसमें ईंधन और समय के कई दिन लग जाते है। यदि आप अपने इंजन द्वारा बनाए गए प्रत्येक मार्ग का परीक्षण करने का प्रयास करेंगे, तो आप शुरुआती रेखा छोड़ने से पहले ही ईंधन समाप्त कर देंगे। यह ठीक वही दुविधा है जिसका सामना "AI रिसर्च एजेंटों" नामक कृत्रिम बुद्धिमत्ता की एक नई पीढ़ी को करना पड़ रहा है। ये स्मार्ट कंप्यूटर प्रोग्राम हैं जिन्हें विशेष रूप से मशीन लर्निंग के क्षेत्र में अपने स्वयं के वैज्ञानिक प्रयोगों को आविष्कार करने और परीक्षण करने के लिए डिज़ाइन किया गया है। पेच यह है कि जबकि ये एजेंट नए विचार (जैसे कि एक नए AI मॉडल के लिए कोड लिखना) मिनटों में गढ़ सकते हैं, उन विचारों को यह देखने के लिए चलाना कि वे काम करते हैं या नहीं, इसमें घंटों या यहाँ तक कि दिनों की महंगी कंप्यूटर शक्ति लग सकती है।
इस समस्या को हल करने के लिए, वैज्ञानिक "सर्च स्कैफोल्ड्स" (search scaffolds) बना रहे हैं, जो इन AI खोजकर्ताओं के लिए नेविगेशन सिस्टम की तरह हैं। ये सिस्टम AI को कई संभावित समाधान उत्पन्न करने, एक को चुनने, परीक्षण करने और फिर परिणामों का उपयोग करके विचारों का अगला बैच बनाने की अनुमति देते हैं। लेकिन अब तक, इस प्रणाली का वह हिस्सा जो यह तय करता है कि अगला कौन सा विचार परीक्षण किया जाए, थोड़ा पासे फेंकने जैसा रहा है। चूंकि AI सब कुछ परीक्षण करने का खर्च नहीं उठा सकता, इसलिए इसे अनुमान लगाना पड़ता है कि कौन सा विचार सबसे अच्छा है। यदि यह गलत अनुमान लगाता है, तो यह एक मृत-अंत वाले विचार पर कीमती समय और पैसा बर्बाद कर देता है। बड़ा सवाल यह है: एक AI यह कैसे सीख सकता है कि बिना लॉटरी के हर एक टिकट खरीदे, जीतने वाला टिकट कैसे चुना जाए?
यह शोध पत्र एक चतुर नए उपकरण जिसे AI रिसर्च प्रेफरेंस मॉडल (RPM) कहा जाता है, का परिचय देता है। एक RPM को AI के विचारों के लिए एक सुपर-स्मार्ट स्काउट या एक "टेस्ट-टेस्टर" के रूप में समझें। इसके बजाय कि AI अंधे होकर परीक्षण के लिए रास्ता चुने, RPM नए विचारों को देखता है, उनकी तुलना पिछले प्रयोगों से करता है, और भविष्यवाणी करता है कि कौन सा विचार सफल होने की सबसे अधिक संभावना रखता है। शोधकर्ताओं ने इन स्काउट्स के दो प्रकार बनाए। पहला एक "इन्फरेंस-ओनली" (Inference-only) स्काउट है जो विचारों का न्याय करने के लिए शुद्ध तर्क का उपयोग करता है, जैसे कि एक आलोचक फिल्म की पटकथा पढ़ता है और अनुमान लगाता है कि क्या वह हिट होगी। दूसरा एक "एजेंटिक" (Agentic) स्काउट है जो अंतिम निर्णय लेने से पहले विचारों पर छोटे, त्वरित अभ्यास परीक्षण (जिन्हें पायलट प्रयोग कहा जाता है) वास्तव में चलाता है, जैसे कि एक निर्देशक पूरी फिल्म बनाने से पहले यह देखने के लिए एक छोटा दृश्य शूट करता है कि लाइटिंग कैसी है।
जब शोधकर्ताओं ने इन स्काउट्स को अपने AI एक्सप्लोरर (जिसे AIRA-dojo कहा जाता है) में लगाया और उसे 20 अलग-अलग मशीन लर्निंग चुनौतियों को हल करने के मिशन पर भेजा, तो परिणाम प्रभावशाली थे। "इन्फरेंस-ओनली" स्काउट वाले AI ने अपने औसत स्कोर को 0.684 से बढ़ाकर 0.711 कर दिया। "एजेंटिक" स्काउट वाले AI ने, जिसने अतिरिक्त अभ्यास परीक्षण किए थे, और भी बेहतर प्रदर्शन किया, 0.729 का स्कोर प्राप्त किया। शायद सबसे रोमांचक बात यह है कि इन स्काउट्स से लैस AI ने उसी उच्च प्रदर्शन स्तर को प्राप्त कर लिया जिसे अनगाइडेड (unguided) AI ने 24 घंटों में हासिल किया था, लेकिन इसने इसे लगभग 15 घंटों में कर दिखाया। इसका मतलब है कि AI ने उस कंप्यूटर पावर से दो-तिहाई से भी कम का उपयोग किया जो इसे अन्यथा आवश्यक होता। वास्तव में, दो विशिष्ट कार्यों पर, सर्वश्रेष्ठ स्काउट्स वाले AI ने नए विश्व रिकॉर्ड स्थापित किए, जो पिछले सभी प्रयासों को पीछे छोड़ गए। अध्ययन बताता है कि सही विचार चुनने के लिए थोड़ा अतिरिक्त सोचने का समय खर्च करके, AI शोधकर्ता भारी मात्रा में समय और ऊर्जा बचा सकते हैं, जिससे वे अपने संसाधनों को खत्म किए बिना वैज्ञानिक सीमा का अधिक अन्वेषण कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।