← नवीनतम पेपर
🤖 machine learning

BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment

BitRL एक ऐसा फ्रेमवर्क है जो 1-बिट क्वांटाइज्ड लैंग्वेज मॉडल्स (BitNet b1.58) का उपयोग करके संसाधन-सीमित एज डिवाइसेज पर रिइन्फोर्समेंट लर्निंग एजेंट्स की तैनाती को सक्षम बनाता है ताकि उच्च कार्य प्रदर्शन बनाए रखते हुए मेमोरी और ऊर्जा की खपत को काफी कम किया जा सके।

मूल लेखक: Md. Ashiq Ul Islam Sajid, Mohammad Sakib Mahmood, Md. Tareq Hasan, Md Abdur Rahim, Rafat Ara, Md. Arafat Hossain

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Md. Ashiq Ul Islam Sajid, Mohammad Sakib Mahmood, Md. Tareq Hasan, Md Abdur Rahim, Rafat Ara, Md. Arafat Hossain

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-इंटेलिजेंट प्रोफेसर है जो किसी भी समस्या को हल कर सकता है, लेकिन वे इतने विशाल और भारी हैं कि वे केवल एक विशाल, महंगे गगनचुंबी इमारत (क्लाउड) में ही रह सकते हैं। यदि आप उस प्रोफेसर को अपने घर पर दैनिक कार्यों में मदद करने के लिए लाना चाहते हैं, तो आपको अपने लिविंग रूम में एक गगनचुंबी इमारत बनानी होगी, जो असंभव है।

यह पेपर, BitRL, उस प्रोफेसर को एक छोटी, हल्की पॉकेट गाइड में "सिकुड़ने" का एक तरीका है जो एक छोटे, सस्ते डिवाइस—जैसे कि एक स्मार्ट टोस्टर या एक छोटे रोबोट—के अंदर रह सके, बिना उनकी बुद्धिमत्ता को बहुत अधिक खोए।

इसे उन्होंने इस प्रकार किया है:

1. "अत्यधिक आहार" (1-bit Quantization)

सामान्य तौर पर, AI मॉडल विशाल विश्वकोशों की तरह होते हैं जहाँ हर शब्द बहुत ही बारीक, विस्तृत सुलेख (calligraphy) में लिखा जाता है (यह "Full Precision" है)। यह बहुत अधिक जगह घेरता है और इसे पढ़ने में धीमा होता है।

शोधकर्ताओं ने 1-bit quantization नामक तकनीक का उपयोग किया। कल्पना कीजिए कि आप उस विश्वकोश को केवल तीन प्रतीकों का उपयोग करके फिर से लिख रहे हैं: प्लस (+), माइनस (-), और जीरो (0)।

  • जटिल संख्याओं के बजाय, AI का "मस्तिष्क" (weights) "हाँ," "नहीं," या "शायद" की एक सरल श्रृंखला बन जाता है।
  • यह AI को अविश्वसनीय रूप से हल्का बना देता है। यह एक भारी, चमड़े से बंधी किताब को एक छोटी, हल्की चीट शीट में बदलने जैसा है। क्योंकि गणित इतना सरल है (जटिल गुणा के बजाय केवल जोड़ना और घटाना), डिवाइस गर्म नहीं होता है और बैटरी बहुत लंबे समय तक चलती है।

2. "मस्तिष्क और रिफ्लेक्सिस" (Frozen Backbone vs. Trainable Heads)

शोधकर्ताओं ने पूरे विश्वकोश को शुरू से फिर से लिखने की कोशिश नहीं की। इसके बजाय, उन्होंने एक "फ्रोजन" (frozen) 1-bit मस्तिष्क लिया जो पहले से ही जानता है कि भाषा कैसे काम करती है।

इसे ऐसे समझें: आप एक ऐसे जीनियस को लेते हैं जिसने दुनिया की हर किताब पढ़ी है (Frozen Backbone), लेकिन उसने कभी वीडियो गेम नहीं खेला है। उसे गेमर बनाने के लिए, आप उसे फिर से पढ़ना नहीं सिखाते; आप बस उसे एक छोटा, विशेष "कंट्रोलर" (Trainable Head) देते हैं जो उसे जॉयस्टिक चलाने का तरीका सिखाता है। इस तरह, डिवाइस को केवल बहुत कम नई जानकारी को "सीखने" की आवश्यकता होती है, जिससे इसे छोटे डिवाइस पर प्रशिक्षित करना बहुत तेज़ हो जाता है।

3. "शराबी चलने वाला" समस्या (The Challenge)

जब आप AI को इस हद तक सिकोड़ते हैं, तो यह थोड़ा "भोंडा" हो जाता है। क्योंकि जानकारी इतनी सरल हो जाती है, AI की वास्तविकता की समझ थोड़ी धुंधली हो जाती है।

शोधकर्ताओं ने पाया कि यह AI को थोड़ा "शराबी चलने वाले" (drunken walker) की तरह व्यवहार करने पर मजबूर करता है। क्योंकि यह दुनिया को पूर्ण स्पष्टता के साथ नहीं देख सकता, इसलिए यह लड़खड़ाता अधिक है (इसे "शोर" या noise कहा जाता है)।

  • अच्छी खबर: यह लड़खड़ाना वास्तव में मदद करता है! रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) में, "लड़खड़ाना" अन्वेषण (exploration) का एक रूप है। यह AI को अनजाने में समस्या को हल करने के नए तरीके खोजने में मदद करता है जिन्हें एक "परफेक्ट" AI अनदेखा कर सकता था।
  • बुरी खबर: यह AI को बहुत ही नाजुक, सटीक गतिविधियों (जैसे कि सर्जन) को करने में कठिन बनाता है। यह यह तय करने के लिए महान है कि "क्या मुझे बाएं मुड़ना चाहिए या दाएं?" लेकिन यह इस मामले में संघर्ष करता है कि "मुझे अपनी उंगली को ठीक कितने मिलीमीटर हिलाना चाहिए?"

4. परिणाम: एक छोटा पावरहाउस

शोधकर्ताओं ने इसका परीक्षण एक Raspberry Pi (एक छोटा, सस्ता कंप्यूटर जो क्रेडिट कार्ड के आकार का है) पर किया।

  • मेमोरी: इसने 10 से 16 गुना कम जगह का उपयोग किया।
  • ऊर्जा: इसने 3 से 5 गुना कम बिजली का उपयोग किया।
  • बुद्धिमत्ता: इसने अपनी मूल समझ का लगभग 85% से 98% बनाए रखा।

सारांश: यह क्यों मायने रखता है?

अभी, अधिकांश "स्मार्ट" चीजें वास्तव में "डंब" चीजें हैं जो सोचने के लिए आपका डेटा बादलों में स्थित एक विशाल कंप्यूटर को भेजती हैं। यह उन्हें धीमा, महंगा और आपकी गोपनीयता के लिए बुरा बनाता है।

BitRL यह सिद्ध करता है कि हम विशाल लैंग्वेज मॉडल्स के "जादू" को छोटे, सस्ते, बैटरी से चलने वाले गैजेट्स में समाहित कर सकते हैं। यह एक ऐसे भविष्य का मार्ग प्रशस्त करता है जहाँ आपका रोबोट वैक्यूम क्लीनर, आपका स्मार्ट होम, और आपके पहनने योग्य उपकरण (wearables) वास्तव में स्वयं सोच और सीख सकते हैं, सीधे आपकी जेब में, बिना कभी क्लाउड को "घर कॉल" किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →