← नवीनतम पेपर
🤖 machine learning

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

Molt एक कॉम्पैक्ट, PyTorch-नेटिव ओपन-सोर्स फ्रेमवर्क है जिसे एजेंटिक सुदृढीकरण लर्निंग (reinforcement learning) अनुसंधान को सरल बनाने के लिए डिज़ाइन किया गया है, जो प्रदर्शन से समझौता किए बिना एंड-टू-एंड एल्गोरिदम संशोधनों को सक्षम बनाता है, अत्याधुनिक Megatron-आधारित स्टैक्स के साथ सांख्यिकीय समानता सुनिश्चित करता है और प्रशिक्षण निरंतरता एवं कोडबेस स्पष्टता सुनिश्चित करता है।

मूल लेखक: Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang, Hemil Desai, Michael Demoret, Pavlo Molchanov, Jan Kautz, Yi Dong

प्रकाशित 2026-07-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang, Hemil Desai, Michael Demoret, Pavlo Molchanov, Jan Kautz, Yi Dong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल सवालों के जवाब ही नहीं देते, बल्कि वास्तव में साहसिक कार्य (adventures) पर निकलते हैं, पहेलियाँ सुलझाते हैं, कोड लिखते हैं, और यहाँ तक कि स्मार्ट बनने के लिए गेम भी खेलते हैं। यह एजेंटिक रीइन्फोर्समेंट लर्निंग (Agentic Reinforcement Learning) का रोमांचक क्षितिज है। इसे एक वीडियो गेम कैरेक्टर को स्क्रिप्ट देने के बजाय, उसे गेम खेलने देने, गलतियाँ करने देने और मिलने वाले रिवॉर्ड्स से सीखने देने जैसा समझें। लक्ष्य ऐसे AI एजेंट बनाना है जो अपने आप सोच सकें, टूल्स का उपयोग कर सकें और जटिल, बहु-चरणीय कार्यों को संभाल सकें।

हालाँकि, इन स्मार्ट एजेंटों को बनाना वर्तमान में एक रेस कार को 200 मील प्रति घंटे की रफ्तार से चलते समय ठीक करने की कोशिश करने जैसा है। इन एजेंटों को प्रशिक्षित करने के लिए शोधकर्ता जिन सॉफ्टवेयर टूल्स का उपयोग करते हैं, वे विशाल, जटिल और बड़े औद्योगिक-स्तर के कारखानों के लिए बनाए गए हैं। यदि कोई शोधकर्ता एक नया विचार आज़माना चाहता है—जैसे कि एजेंट को अपनी गलती से कैसे सीखने के तरीके को बदलना—तो उन्हें अक्सर उलझे हुए कोड की कई परतों में खुदाई करनी पड़ती है, जैसे कि ऊन के एक विशाल गोले को सुलझाना। यह प्रयोग करने की प्रक्रिया को धीमा और निराशाजनक बना देता है। बड़ा सवाल यह है: क्या हम एक ऐसा प्रशिक्षण तंत्र बना सकते हैं जो सबसे बड़े सुपरकंप्यूटरों के लिए पर्याप्त तेज़ और शक्तिशाली हो, लेकिन एक अकेले शोधकर्ता के लिए समझने और बदलने में इतना सरल और साफ भी हो कि वह एक दोपहर में इसे कर सके?

यह पेपर मोल्ट (Mlt) पेश करता है, जो ठीक इसी समस्या को हल करने के लिए डिज़ाइन किया गया एक नया प्रशिक्षण ढांचा (framework) है। लेखक, जो NVIDIA की एक टीम है, तर्क देते हैं कि शक्तिशाली AI को प्रशिक्षित करने के लिए आपको एक विशाल, जटिल मशीन की आवश्यकता नहीं है; आपको बस एक अधिक स्वच्छ और पठनीय मशीन की आवश्यकता है। उन्होंने मोल्ट को "पायटॉर्च-नेटिव" (PyTorch-native) फ्रेमवर्क के रूप में बनाया है, जिसका अर्थ है कि यह सबसे लोकप्रिय AI कोडिंग टूल्स की भाषा बोलता है, जिससे सब कुछ एक ही स्थान पर रहता है।

पेपर का मुख्य निष्कर्ष यह है कि मोल्ट अविश्वसनीय रूप से कुशल है। यह इतना छोटा है कि एक मानव शोधकर्ता (या यहाँ तक कि एक AI कोडिंग असिस्टेंट भी) पूरे कोडबेस को पढ़ सकता है और शुरू से अंत तक समझ सकता है कि एजेंट कैसे सीखता है। अन्य प्रणालियों की तुलना में बहुत छोटा और सरल होने के बावजूद, लेखकों ने इसके प्रदर्शन को मापा और पाया कि यह आज के सबसे उन्नत, भारी-भरकम सिस्टम के सांख्यिकीय रूप से तुलनीय (statistically comparable) है। एक आमने-सामने के परीक्षण में, मोल्ट ने एक जटिल प्रतिस्पर्धी जितनी ही तेज़ी से एक AI मॉडल को प्रशिक्षित किया, जिससे यह सिद्ध हुआ कि आपको सरलता के लिए गति का त्याग करने की आवश्यकता नहीं है।

पेपर स्पष्ट रूप से इस विचार का खंडन करता है कि अच्छे शोध के लिए "हाइपरस्केल" जटिलता आवश्यक है। वे इस धारणा को खारिज करते हैं कि शोधकर्ताओं को एक प्रयोग चलाने के लिए हज़ारों लाइनों के भ्रमित करने वाले कोड को विरासत में लेना ही होगा। इसके बजाय, वे दिखाते हैं कि कोड को साफ और मुख्य एल्गोरिदम पर केंद्रित रखकर, आप वही परिणाम प्राप्त कर सकते हैं। वे इस विचार को भी खारिज करते हैं कि "टोकन ड्रिफ्ट" (जहाँ कंप्यूटर एक शब्द बनाता है लेकिन प्रशिक्षण के दौरान उसका एक अलग संस्करण गिनता है) स्वीकार्य है; मोल्ट यह सुनिश्चित करता है कि AI को ठीक उन्हीं टोकन पर प्रशिक्षित किया जाए जो उसने उत्पन्न किए थे, जिससे छिपी हुई त्रुटियों को रोका जा सके।

संक्षेप में, मोल्ट एक "लीन" (lean) प्रशिक्षण लूप है जो शोधकर्ताओं को चीज़ों को खराब किए बिना तेज़ी से आगे बढ़ने देता है। यह एक चतुर सेटअप का उपयोग करता है जहाँ AI उत्तर उत्पन्न करता है, उन्हें एक सरल कतार (queue) के माध्यम से भेजता है, और तुरंत प्रशिक्षण देता है, और साथ ही हर कदम का सटीक रिकॉर्ड भी रखता है। लेखकों ने इसे एक विशाल 35-बिलियन-पैरामीटर वाले मॉडल पर मापा और यहाँ तक कि इसे 700-बिलियन-पैरामीटर वाले मॉडल पर भी काम करते हुए दिखाया, जो यह सुझाव देता है कि यह सरल दृष्टिकोण AI की सबसे बड़ी चुनौतियों तक स्केल हो सकता है बिना जटिल हुए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →