← नवीनतम पेपर
💬 NLP

TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation

यह शोध पत्र TinyR1-32B-Preview को प्रस्तुत करता है, जो एक नवीन 'ब्रांच-मर्ज डिस्टिलेशन' (Branch-Merge distillation) दृष्टिकोण के माध्यम से विकसित एक 32B-पैरामीटर वाला मॉडल है, जो विशिष्ट छात्र मॉडलों को चुनिंदा रूप से प्रशिक्षित करने और उन्हें मर्ज करने के माध्यम से गणित, कोडिंग और विज्ञान में मौजूदा डिस्टिल्ड समकक्षों से काफी बेहतर प्रदर्शन करता है और बड़े DeepSeek-R1 शिक्षक मॉडल के प्रदर्शन के बराबर पहुँच जाता है।

मूल लेखक: Lin Sun, Guangxiang Zhao, Xiaoqi Jian, Yuhan Wu, Weihong Lin, Yongfu Zhu, Qilong Shi, Change Jia, Aomufei Yuan, Yuxuan Tian, Linglin Zhang, Jinzhu Wu, Junfeng Ran, Sai-er Hu, Zihan Jiang, Junting Zhou
प्रकाशित 2026-04-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lin Sun, Guangxiang Zhao, Xiaoqi Jian, Yuhan Wu, Weihong Lin, Yongfu Zhu, Qilong Shi, Change Jia, Aomufei Yuan, Yuxuan Tian, Linglin Zhang, Jinzhu Wu, Junfeng Ran, Sai-er Hu, Zihan Jiang, Junting Zhou, Wenrui Liu, Xusen Xiao, Bin Cui, Tong Yang, Xiangzheng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ TinyR1-32B-Preview पेपर का स्पष्टीकरण दिया गया है, जिसे रोज़मर्रा के उदाहरणों के साथ सरल अवधारणाओं में तोड़ा गया है।

बड़ी समस्या: "सब कुछ जानने वाला" (Jack-of-All-Trades) की दुविधा

कल्पना कीजिए कि आपके पास एक शानदार, विश्व स्तरीय प्रोफेसर (एक विशाल AI मॉडल) है जो सब कुछ जानता है: उन्नत गणित, जटिल कोडिंग और गहरा विज्ञान। आप इस प्रोफेसर का एक छोटा, सस्ता संस्करण बनाना चाहते हैं जिसे आप अपने लैपटॉप पर चला सकें।

इसे करने का सामान्य तरीका यह है कि बड़े प्रोफेसर के नोट्स लें और उन्हें एक साथ एक छोटी नोटबुक में भरने की कोशिश करें। यह पेपर तर्क देता है कि यह आमतौर पर विफल रहता है। यदि आप गणित, कोडिंग और विज्ञान के नोट्स को एक ही बड़े ढेर में मिला देते हैं, तो छात्र भ्रमित हो जाता है। गणित के नोट्स कोडिंग के नोट्स के साथ "लड़" सकते हैं, जिससे छात्र हर चीज़ कम सीख पाता है। यह बिल्कुल वैसा ही है जैसे एक ही विशाल, मिश्रित किताब पढ़कर एक ही समय में वायलिन बजाना, कैलकुलस हल करना और सूफ़ले (soufflé) बनाना सीखने की कोशिश करना। इसका परिणाम अक्सर एक ऐसा छात्र होता है जो हर चीज़ में ठीक-ठाक है लेकिन किसी भी चीज़ में महान नहीं।

समाधान: "ब्रांच एंड मर्ज" (Branch and Merge) रणनीति

लेखक छोटे छात्र को सिखाने का एक स्मार्ट तरीका प्रस्तावित करते हैं, जिसे वे Branch-Merge Distillation कहते हैं। इसे एक विशेष प्रशिक्षण शिविर और उसके बाद एक अंतिम टीम-अप के रूप में सोचें।

चरण 1: द ब्रांच (विशेष प्रशिक्षण - The Branch)

सब कुछ मिलाने के बजाय, वे बड़े प्रोफेसर के ज्ञान को तीन अलग-अलग "शाखाओं" या विशेष ट्यूटर्स में विभाजित करते हैं:

  1. गणित ट्यूटर: केवल गणित के सवाल सिखाता है।
  2. कोडिंग ट्यूटर: केवल प्रोग्रामिंग सिखाता है।
  3. विज्ञान ट्यूटर: केवल वैज्ञानिक अवधारणाएं सिखाता है।

वे छोटे छात्र के तीन अलग-अलग "विशेषज्ञ" संस्करणों को प्रशिक्षित करते हैं। क्योंकि प्रत्येक छात्र केवल एक विषय पर ध्यान केंद्रित करता है, वे अन्य विषयों से भ्रमित हुए बिना उस विशिष्ट क्षेत्र के सच्चे उस्ताद बन जाते हैं।

  • उदाहरण: एक छात्र द्वारा एक साथ तीन विषय सीखने के बजाय, आप तीन अलग-अलग ट्यूटर्स को नियुक्त करते हैं। एक केवल गणित सिखाता है, एक केवल कोडिंग, और एक केवल विज्ञान। प्रत्येक छात्र अपनी विशिष्ट कक्षा में विशेषज्ञ बन जाता है।

चरण 2: द मर्ज (टीम-अप - The Merge)

अब, टीम के पास तीन प्रतिभाशाली विशेषज्ञ हैं, लेकिन उन्हें एक ऐसे एकल छात्र की आवश्यकता है जो इन तीनों को जानता हो। यदि वे केवल तीनों छात्रों के दिमाग को आपस में मिला दें, तो वे प्रत्येक की अनूठी प्रतिभा को खो सकते हैं।

इसके बजाय, वे एक स्मार्ट "मर्जिंग" टूल (जिसे Arcee Fusion कहा जाता है) का उपयोग करते हैं। यह टूल एक बहुत ही सख्त संपादक (editor) की तरह कार्य करता है। यह तीन विशेषज्ञों को देखता है और पूछता है: "क्या गणित ट्यूटर से प्राप्त यह नया ज्ञान वास्तव में छात्र के मस्तिष्क में सुधार करता है, या यह केवल शोर (noise) है?"

  • नियम: यदि गणित ट्यूटर के पास एक शानदार, अनूखी अंतर्दृष्टि (insight) है जो वर्तमान छात्र के पास नहीं है, तो संपादक उसे रखता है। यदि अंतर्दृष्टि कमजोर है या मौजूदा ज्ञान के साथ संघर्ष करती है, तो संपादक उसे हटा देता है।
  • उदाहरण: कल्पना कीजिए कि आपके पास तीन शेफ हैं। एक बेहतरीन स्टेक बनाता है, एक बेहतरीन सूप, और एक बेहतरीन केक। आप उनके अवयवों (ingredients) को ब्लेंडर में नहीं मिलाते हैं। इसके बजाय, आप सबसे अच्छा स्टेक रेसिपी, सबसे अच्छा सूप रेसिपी और सबसे अच्छा केक रेसिपी लेते हैं और उन्हें एक मास्टर कुकबुक में मिलाते हैं। आप केवल उन हिस्सों को रखते हैं जो वास्तव में उत्कृष्ट हैं।

परिणाम: एक सुपर-स्टूडेंट

इस प्रक्रिया का परिणाम TinyR1-32B-Preview है।

  • प्रदर्शन: यह छोटा मॉडल गणित, कोडिंग और विज्ञान में अन्य छोटे मॉडलों की तुलना में काफी बेहतर है जिन्हें "पुराने तरीके" (सभी डेटा को एक साथ मिलाकर) से प्रशिक्षित किया गया था।
  • तुलना: यह विशाल "DeepSeek-R1" शिक्षक मॉडल के लगभग समान प्रदर्शन करता है, जबकि यह आकार में बहुत छोटा है।
  • दक्षता: यह विधि अविश्वसनीय रूप से तेज़ और सस्ती भी है। पेपर नोट करता है कि इन मॉडलों को मर्ज करने में शक्तिशाली कंप्यूटरों पर केवल 4 घंटे लगे, जबकि मिश्रित डेटा के साथ एक मॉडल को फिर से प्रशिक्षित करने में 740 घंटे लगते। यह 30 दिनों के बजाय 4 घंटों में एक मास्टर शेफ प्राप्त करने जैसा है।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का दावा है कि यह AI की दुनिया में एक "फ्री लंच" (मुफ्त का लाभ) है। यह "टास्क इंटरफेरेंस" (जहाँ एक चीज़ सीखना दूसरी चीज़ सीखने की क्षमता को नुकसान पहुँचाता है) की समस्या को हल करता है—पहले सीखने को अलग करके, फिर सबसे अच्छे हिस्सों को सावधानीपूर्वक जोड़कर।

यह पेपर क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि यह मॉडल चिकित्सा निदान या कानूनी सलाह के लिए तैयार है।
  • यह दावा नहीं करता कि यह तरीका हर संभव AI कार्य के लिए काम करता है (उन्होंने केवल गणित, कोडिंग और विज्ञान का परीक्षण किया है)।
  • यह दावा नहीं करता कि मॉडल पूर्ण है; वे स्वीकार करते हैं कि जटिल निर्देशों का पालन करने या सुरक्षा जाँचों जैसी चीज़ों पर अभी भी काम करने की आवश्यकता है।

संक्षेप में, पेपर दिखाता है कि यदि आप एक छोटा, स्मार्ट AI चाहते हैं, तो उसे एक साथ सब कुछ सिखाने की कोशिश न करें। उसे एक समय में एक चीज़ सिखाएं, विशेषज्ञ बनें, और फिर उन विशेषज्ञों को सावधानीपूर्वक एक साथ जोड़ दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →