Gemma 4, Phi-4, and Qwen3: Accuracy-Efficiency Tradeoffs in Dense and MoE Reasoning Language Models
यह शोध पत्र कई कार्यों और प्रॉम्प्टिंग रणनीतियों के माध्यम से सात डेंस और मिक्स्चर-ऑफ-एक्सपर्ट्स (MoE) रीजनिंग लैंग्वेज मॉडल्स का एक व्यापक अनुभवजन्य बेंचमार्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि केवल स्पार्स एक्टिवेशन ही इष्टतम प्रदर्शन की गारंटी नहीं देता है और सर्वोत्तम सटीकता-दक्षता ट्रेड-ऑफ आर्किटेक्चर, प्रॉम्प्टिंग प्रोटोकॉल और कार्य संरचना के विशिष्ट परस्पर संबंध पर निर्भर करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप रहस्यों को सुलझाने के लिए जासूसों की एक टीम को काम पर रखने की कोशिश कर रहे हैं। कुछ जासूस जनरलिस्ट (generalists) हैं जो अपने साथ हर तरह के औजारों से भरा एक विशाल बैग लेकर चलते हैं (डेंस मॉडल्स)। अन्य स्पेशलिस्ट (specialists) हैं जो एक छोटा और हल्का बैग रखते हैं लेकिन जरूरत पड़ने पर ज्ञान के विशाल पुस्तकालय से तुरंत एक सटीक विशेषज्ञ को बुला सकते हैं (मिक्सचर-ऑफ-एक्सपर्ट्स, या MoE)।
बड़ा सवाल यह है कि कोई भी AI सिस्टम बनाने वाले व्यक्ति के लिए: "कौन सा जासूस बिना बजट बिगाड़े या हमारे संसाधनों को थकाए काम पूरा करेगा?"
यह शोध पत्र, जिसे रेंसलेयर पॉलिटेकनिक इंस्टीट्यूट के शोधकर्ताओं द्वारा लिखा गया है, एक विशाल, नियंत्रित जासूसी प्रतियोगिता की तरह है। उन्होंने केवल यह नहीं पूछा, "कौन सबसे बुद्धिमान है?" बल्कि उन्होंने पूछा, "कितना समय, मेमोरी और ऊर्जा खर्च करने के बदले कौन सबसे बुद्धिमान है?"
यहाँ उनके निष्कर्षों की कहानी है, जिसे सरल अवधारणाओं में विभाजित किया गया है।
1. प्रतियोगी: "हेवी हिटर्स" बनाम "लाइटवेट"
शोधकर्ताओं ने सात अलग-अलग AI मॉडलों का परीक्षण किया, जो दो मुख्य समूहों में आते हैं:
- डेंस मॉडल्स (भारी बैग वाले): Phi-4 और Qwen3-8B जैसे मॉडल। ये एक ऐसे अकेले जासूस की तरह हैं जिसने एक विशाल विश्वकोश (encyclopedia) याद कर रखा है। हर बार जब वे सोचते हैं, तो वे अपने पूरे मस्तिष्क का उपयोग करते हैं। वे शक्तिशाली हैं लेकिन यदि बैग बहुत बड़ा है तो भारी और धीमे हो सकते हैं।
- MoE मॉडल्स (विशेषज्ञों को बुलाने वाले): Gemma-4 और Qwen3-30B जैसे मॉडल। ये एक ऐसे जासूस की तरह हैं जिसके पास एक छोटी नोटबुक है लेकिन 100 अलग-अलग विशेषज्ञों का फोन नंबर है। जब कोई प्रश्न आता है, तो वे केवल उस विशिष्ट कार्य के लिए आवश्यक एक विशेषज्ञ को बुलाते हैं। यह उन्हें तेज़ और मेमोरी के मामले में हल्का बनाता है, भले ही उनका कुल "ज्ञान आधार" बहुत बड़ा हो।
2. परीक्षण: सवाल पूछने के तीन अलग तरीके
शोधकर्ताओं ने जासूसों को केवल पहेलियाँ हल करने के लिए नहीं कहा। उन्होंने निर्देश देने के तीन अलग-अलग तरीके (प्रॉम्प्टिंग रणनीतियाँ) आजमाए:
- ज़ीरो-शॉट (Zero-Shot): "यहाँ रहस्य है। इसे सुलझाओ।" (कोई मदद नहीं दी गई)।
- चेन-ऑफ-थॉट (CoT): "यहाँ रहस्य है। उत्तर देने से पहले कदम-दर-कदम सोचें।" (उन्हें अपना काम दिखाने के लिए कहना)।
- फ्यू-शॉट कोटी (Few-Shot CoT): "यहाँ एक रहस्य है, और यहाँ इसे हल करने का एक उदाहरण दिया गया है। अब, कदम-दर-कदम सोचें और इस नए रहस्य को हल करें।" (उन्हें एक चीट शीट/उदाहरण देना)।
3. रहस्य की श्रेणियाँ
उन्होंने जासूसों का चार प्रकार के मामलों पर परीक्षण किया:
- विज्ञान सामान्य ज्ञान (ARC): सामान्य ज्ञान के प्रश्न।
- ग्रेड स्कूल गणित (GSM8K): सरल अंकगणित वाले शब्द समस्याएँ।
- कठिन गणित (Math L1–3): जटिल, बहु-चरणीय गणित की समस्याएँ।
- सत्यता (TruthfulQA): ऐसे प्रश्न जो AI को झूठ बोलने या आम मिथकों को दोहराने के लिए उकसाते हैं।
4. बड़े आश्चर्य (परिणाम)
🏆 समग्र विजेता: "गोल्डिलॉक्स" MoE
समग्र चैंपियनशिप जीतने वाला मॉडल Gemma-4-E4B था, जिसने "फ्यू-शॉट चेन-ऑफ-थॉट" विधि का उपयोग किया।
- क्यों? यह एक आदर्श संतुलन था। यह उच्चतम स्कोर प्राप्त करने के लिए पर्याप्त बुद्धिमान था, लेकिन इसे चलाने के लिए बहुत बड़े कंप्यूटर की आवश्यकता नहीं थी। यह एक ऐसे जासूस की तरह था जिसने केस को जल्दी, सटीक रूप से और बिना कारों के बेड़े की आवश्यकता के सुलझा लिया।
- उपविजेता: बड़ा Gemma-4-26B लगभग उतना ही स्मार्ट था, लेकिन इसे तीन गुना अधिक मेमोरी (जैसे गैरेज के बजाय एक विशाल गोदाम की आवश्यकता) की आवश्यकता थी। अधिकांश लोगों के लिए, छोटा और तेज़ विजेता बेहतर सौदा था।
🧠 "विशेषज्ञ" बनाम "जनरलिस्ट"
- गणित का जादूगर: Phi-4 मॉडल साधारण गणित (GSM8K) में अविश्वसनीय थे जब उनसे केवल "कदम-दर-कदम सोचने" के लिए कहा गया। वे एक गणित के जीनियस की तरह थे जो मन ही मन तुरंत समीकरणों को हल कर सकते थे।
- सत्य का खोजी: Phi मॉडल झूठ पकड़ने (TruthfulQA) में भी सर्वश्रेष्ठ थे।
- विज्ञान और कठिन गणित के राजा: Gemma मॉडलों ने विज्ञान के प्रश्नों और सबसे कठिन गणित की समस्याओं पर दबदबा बनाया।
⚠️ जाल: "अधिक उदाहरण" हमेशा बेहतर नहीं होते
यह सबसे आश्चर्यजनक खोज थी। आमतौर पर, AI को एक उदाहरण (Few-Shot) देने से उसकी मदद होती है।
- अधिकांश मॉडलों के लिए: उदाहरण देने से वे स्मार्ट बन गए।
- गणित पर Phi-4 रीजनिंग मॉडल के लिए: उदाहरण देने से इसका प्रदर्शन बर्बाद हो गया। इसका स्कोर 67% से गिरकर 11% रह गया।
- उपमा: एक ऐसे जीनियस की कल्पना करें जो अपने अनूठे तरीके से सोचने के माध्यम से समस्याओं को हल करता है। यदि आप उन्हें एक विशिष्ट उदाहरण का पालन करने के लिए मजबूर करते हैं, तो वे भ्रमित हो जाते हैं और सोचना भूल जाते हैं। कभी-कभी, कम निर्देश ही अधिक प्रभावी होते हैं।
5. सबक: यह "सर्वश्रेष्ठ" मॉडल के बारे में नहीं है
इस शोध पत्र का मुख्य निष्कर्ष यह है कि कोई एक "सर्वश्रेष्ठ" AI मॉडल नहीं है। यह पूरी तरह से इस पर निर्भर करता है कि आप क्या करने की कोशिश कर रहे हैं और आपके पास कौन से उपकरण हैं।
- यदि आपके पास एक छोटा सर्वर है और आपको विज्ञान के प्रश्नों को हल करने की आवश्यकता है, तो मध्यम आकार का Gemma मॉडल चुनें।
- यदि आपको फेक न्यूज पहचानने या सरल गणित करने की आवश्यकता है, तो Phi मॉडल आपका सबसे अच्छा दोस्त हो सकता है।
- यदि आप "सबसे बड़े" मॉडल का उपयोग करने की कोशिश करते हैं, तो आप पाएंगे कि यह बहुत धीमा और महंगा है, और "सबसे स्मार्ट" मॉडल विफल हो सकता है यदि आप उससे गलत तरीके से पूछते हैं।
निचोड़
AI मॉडल चुनने को एक वाहन चुनने की तरह समझें।
- आप केवल इसलिए सेमी-ट्रक नहीं खरीदते क्योंकि उसमें सबसे अधिक हॉर्सपावर है यदि आप केवल किराने के सामान के लिए जा रहे हैं।
- आप मोटर साइकिल नहीं खरीदते यदि आपको घर ढोने की आवश्यकता है।
शोधकर्ताओं ने एक "टेस्ट ट्रैक" बनाया है ताकि हमें दिखा सकें कि कौन सा वाहन (मॉडल) किस सड़क (कार्य) और किस मौसम की स्थिति (प्रॉम्प्टिंग रणनीति) के लिए सबसे अच्छा है। उनका फैसला? मध्यम आकार का, विशेषज्ञ-बुलाने वाला Gemma मॉडल वर्तमान में सबसे कुशल ऑल-राउंडर है, लेकिन सबसे अच्छे परिणाम पाने के लिए आपको इसे बात करना आना चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।