← नवीनतम पेपर
🤖 AI

AI Research Preference Models

यह शोध पत्र AI रिसर्च प्रिफरेंस मॉडल्स (RPMs) को प्रस्तुत करता है, जो निष्पादन के लिए सबसे आशाजनक मशीन लर्निंग रिसर्च उम्मीदवारों को कुशलतापूर्वक प्राथमिकता देने और चुनने के लिए फ्रोजन लैंग्वेज मॉडल्स का लाभ उठाते हैं, जिससे अनगाइडेड एजेंट्स की तुलना में कंप्यूटेशनल लागत में काफी कमी आती है और फ्रंटियर टास्क पर प्रगति में तेजी आती है।

मूल लेखक: Thomas Simon Foster, Bassel Al Omari, Tingchen Fu, Thomas Mann, Carl Domond, Lucia Cipolina-Kun, Bhavul Gauri, Muna Aghamelu, Alexander D. Goldie, Eryk Helenowski, Jean-Christophe Gagnon-Audet, Albert
प्रकाशित 2026-08-17
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Thomas Simon Foster, Bassel Al Omari, Tingchen Fu, Thomas Mann, Carl Domond, Lucia Cipolina-Kun, Bhavul Gauri, Muna Aghamelu, Alexander D. Goldie, Eryk Helenowski, Jean-Christophe Gagnon-Audet, Alberto Pepe, Saba Nazir, Daniel Izcovich, Noam Levi, Rishi Hazra, Karen Hambardzumyan, Nicolas Baldwin, Xian Li, Martin Josifoski, Paris Giampouras, Masoud Jalili Sabet, Anya Sims, Hela Momand, Tatiana Shavrina, Despoina Magka, Jason Weston, Yulin Wang, Anirudh Goyal, João Henriques, Yoram Bachrach, Emily McMilin, Jakob Nicolaus Foerster

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अनछुए आकाशगंगा की खोज कर रहे एक अंतरिक्ष यान के कप्तान हैं। आपके पास एक शक्तिशाली इंजन है जो पलक झपकते ही हजारों नए मानचित्र मार्ग (map routes) बना सकता है। हालाँकि, आपके जहाज के साथ एक गंभीर समस्या है: यह जांचना कि कोई मार्ग वास्तव में खजाने वाले द्वीप तक ले जाता है या नहीं, इसमें ईंधन और समय के कई दिन लग जाते है। यदि आप अपने इंजन द्वारा बनाए गए प्रत्येक मार्ग का परीक्षण करने का प्रयास करेंगे, तो आप शुरुआती रेखा छोड़ने से पहले ही ईंधन समाप्त कर देंगे। यह ठीक वही दुविधा है जिसका सामना "AI रिसर्च एजेंटों" नामक कृत्रिम बुद्धिमत्ता की एक नई पीढ़ी को करना पड़ रहा है। ये स्मार्ट कंप्यूटर प्रोग्राम हैं जिन्हें विशेष रूप से मशीन लर्निंग के क्षेत्र में अपने स्वयं के वैज्ञानिक प्रयोगों को आविष्कार करने और परीक्षण करने के लिए डिज़ाइन किया गया है। पेच यह है कि जबकि ये एजेंट नए विचार (जैसे कि एक नए AI मॉडल के लिए कोड लिखना) मिनटों में गढ़ सकते हैं, उन विचारों को यह देखने के लिए चलाना कि वे काम करते हैं या नहीं, इसमें घंटों या यहाँ तक कि दिनों की महंगी कंप्यूटर शक्ति लग सकती है।

इस समस्या को हल करने के लिए, वैज्ञानिक "सर्च स्कैफोल्ड्स" (search scaffolds) बना रहे हैं, जो इन AI खोजकर्ताओं के लिए नेविगेशन सिस्टम की तरह हैं। ये सिस्टम AI को कई संभावित समाधान उत्पन्न करने, एक को चुनने, परीक्षण करने और फिर परिणामों का उपयोग करके विचारों का अगला बैच बनाने की अनुमति देते हैं। लेकिन अब तक, इस प्रणाली का वह हिस्सा जो यह तय करता है कि अगला कौन सा विचार परीक्षण किया जाए, थोड़ा पासे फेंकने जैसा रहा है। चूंकि AI सब कुछ परीक्षण करने का खर्च नहीं उठा सकता, इसलिए इसे अनुमान लगाना पड़ता है कि कौन सा विचार सबसे अच्छा है। यदि यह गलत अनुमान लगाता है, तो यह एक मृत-अंत वाले विचार पर कीमती समय और पैसा बर्बाद कर देता है। बड़ा सवाल यह है: एक AI यह कैसे सीख सकता है कि बिना लॉटरी के हर एक टिकट खरीदे, जीतने वाला टिकट कैसे चुना जाए?

यह शोध पत्र एक चतुर नए उपकरण जिसे AI रिसर्च प्रेफरेंस मॉडल (RPM) कहा जाता है, का परिचय देता है। एक RPM को AI के विचारों के लिए एक सुपर-स्मार्ट स्काउट या एक "टेस्ट-टेस्टर" के रूप में समझें। इसके बजाय कि AI अंधे होकर परीक्षण के लिए रास्ता चुने, RPM नए विचारों को देखता है, उनकी तुलना पिछले प्रयोगों से करता है, और भविष्यवाणी करता है कि कौन सा विचार सफल होने की सबसे अधिक संभावना रखता है। शोधकर्ताओं ने इन स्काउट्स के दो प्रकार बनाए। पहला एक "इन्फरेंस-ओनली" (Inference-only) स्काउट है जो विचारों का न्याय करने के लिए शुद्ध तर्क का उपयोग करता है, जैसे कि एक आलोचक फिल्म की पटकथा पढ़ता है और अनुमान लगाता है कि क्या वह हिट होगी। दूसरा एक "एजेंटिक" (Agentic) स्काउट है जो अंतिम निर्णय लेने से पहले विचारों पर छोटे, त्वरित अभ्यास परीक्षण (जिन्हें पायलट प्रयोग कहा जाता है) वास्तव में चलाता है, जैसे कि एक निर्देशक पूरी फिल्म बनाने से पहले यह देखने के लिए एक छोटा दृश्य शूट करता है कि लाइटिंग कैसी है।

जब शोधकर्ताओं ने इन स्काउट्स को अपने AI एक्सप्लोरर (जिसे AIRA-dojo कहा जाता है) में लगाया और उसे 20 अलग-अलग मशीन लर्निंग चुनौतियों को हल करने के मिशन पर भेजा, तो परिणाम प्रभावशाली थे। "इन्फरेंस-ओनली" स्काउट वाले AI ने अपने औसत स्कोर को 0.684 से बढ़ाकर 0.711 कर दिया। "एजेंटिक" स्काउट वाले AI ने, जिसने अतिरिक्त अभ्यास परीक्षण किए थे, और भी बेहतर प्रदर्शन किया, 0.729 का स्कोर प्राप्त किया। शायद सबसे रोमांचक बात यह है कि इन स्काउट्स से लैस AI ने उसी उच्च प्रदर्शन स्तर को प्राप्त कर लिया जिसे अनगाइडेड (unguided) AI ने 24 घंटों में हासिल किया था, लेकिन इसने इसे लगभग 15 घंटों में कर दिखाया। इसका मतलब है कि AI ने उस कंप्यूटर पावर से दो-तिहाई से भी कम का उपयोग किया जो इसे अन्यथा आवश्यक होता। वास्तव में, दो विशिष्ट कार्यों पर, सर्वश्रेष्ठ स्काउट्स वाले AI ने नए विश्व रिकॉर्ड स्थापित किए, जो पिछले सभी प्रयासों को पीछे छोड़ गए। अध्ययन बताता है कि सही विचार चुनने के लिए थोड़ा अतिरिक्त सोचने का समय खर्च करके, AI शोधकर्ता भारी मात्रा में समय और ऊर्जा बचा सकते हैं, जिससे वे अपने संसाधनों को खत्म किए बिना वैज्ञानिक सीमा का अधिक अन्वेषण कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →