← नवीनतम पेपर
💬 NLP

Gemma 4, Phi-4, and Qwen3: Accuracy-Efficiency Tradeoffs in Dense and MoE Reasoning Language Models

यह शोध पत्र कई कार्यों और प्रॉम्प्टिंग रणनीतियों के माध्यम से सात डेंस और मिक्स्चर-ऑफ-एक्सपर्ट्स (MoE) रीजनिंग लैंग्वेज मॉडल्स का एक व्यापक अनुभवजन्य बेंचमार्क प्रस्तुत करता है, जो यह प्रदर्शित करता है कि केवल स्पार्स एक्टिवेशन ही इष्टतम प्रदर्शन की गारंटी नहीं देता है और सर्वोत्तम सटीकता-दक्षता ट्रेड-ऑफ आर्किटेक्चर, प्रॉम्प्टिंग प्रोटोकॉल और कार्य संरचना के विशिष्ट परस्पर संबंध पर निर्भर करते हैं।

मूल लेखक: Md Motaleb Hossen Manik, Ge Wang

प्रकाशित 2026-04-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Md Motaleb Hossen Manik, Ge Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रहस्यों को सुलझाने के लिए जासूसों की एक टीम को काम पर रखने की कोशिश कर रहे हैं। कुछ जासूस जनरलिस्ट (generalists) हैं जो अपने साथ हर तरह के औजारों से भरा एक विशाल बैग लेकर चलते हैं (डेंस मॉडल्स)। अन्य स्पेशलिस्ट (specialists) हैं जो एक छोटा और हल्का बैग रखते हैं लेकिन जरूरत पड़ने पर ज्ञान के विशाल पुस्तकालय से तुरंत एक सटीक विशेषज्ञ को बुला सकते हैं (मिक्सचर-ऑफ-एक्सपर्ट्स, या MoE)।

बड़ा सवाल यह है कि कोई भी AI सिस्टम बनाने वाले व्यक्ति के लिए: "कौन सा जासूस बिना बजट बिगाड़े या हमारे संसाधनों को थकाए काम पूरा करेगा?"

यह शोध पत्र, जिसे रेंसलेयर पॉलिटेकनिक इंस्टीट्यूट के शोधकर्ताओं द्वारा लिखा गया है, एक विशाल, नियंत्रित जासूसी प्रतियोगिता की तरह है। उन्होंने केवल यह नहीं पूछा, "कौन सबसे बुद्धिमान है?" बल्कि उन्होंने पूछा, "कितना समय, मेमोरी और ऊर्जा खर्च करने के बदले कौन सबसे बुद्धिमान है?"

यहाँ उनके निष्कर्षों की कहानी है, जिसे सरल अवधारणाओं में विभाजित किया गया है।

1. प्रतियोगी: "हेवी हिटर्स" बनाम "लाइटवेट"

शोधकर्ताओं ने सात अलग-अलग AI मॉडलों का परीक्षण किया, जो दो मुख्य समूहों में आते हैं:

  • डेंस मॉडल्स (भारी बैग वाले): Phi-4 और Qwen3-8B जैसे मॉडल। ये एक ऐसे अकेले जासूस की तरह हैं जिसने एक विशाल विश्वकोश (encyclopedia) याद कर रखा है। हर बार जब वे सोचते हैं, तो वे अपने पूरे मस्तिष्क का उपयोग करते हैं। वे शक्तिशाली हैं लेकिन यदि बैग बहुत बड़ा है तो भारी और धीमे हो सकते हैं।
  • MoE मॉडल्स (विशेषज्ञों को बुलाने वाले): Gemma-4 और Qwen3-30B जैसे मॉडल। ये एक ऐसे जासूस की तरह हैं जिसके पास एक छोटी नोटबुक है लेकिन 100 अलग-अलग विशेषज्ञों का फोन नंबर है। जब कोई प्रश्न आता है, तो वे केवल उस विशिष्ट कार्य के लिए आवश्यक एक विशेषज्ञ को बुलाते हैं। यह उन्हें तेज़ और मेमोरी के मामले में हल्का बनाता है, भले ही उनका कुल "ज्ञान आधार" बहुत बड़ा हो।

2. परीक्षण: सवाल पूछने के तीन अलग तरीके

शोधकर्ताओं ने जासूसों को केवल पहेलियाँ हल करने के लिए नहीं कहा। उन्होंने निर्देश देने के तीन अलग-अलग तरीके (प्रॉम्प्टिंग रणनीतियाँ) आजमाए:

  • ज़ीरो-शॉट (Zero-Shot): "यहाँ रहस्य है। इसे सुलझाओ।" (कोई मदद नहीं दी गई)।
  • चेन-ऑफ-थॉट (CoT): "यहाँ रहस्य है। उत्तर देने से पहले कदम-दर-कदम सोचें।" (उन्हें अपना काम दिखाने के लिए कहना)।
  • फ्यू-शॉट कोटी (Few-Shot CoT): "यहाँ एक रहस्य है, और यहाँ इसे हल करने का एक उदाहरण दिया गया है। अब, कदम-दर-कदम सोचें और इस नए रहस्य को हल करें।" (उन्हें एक चीट शीट/उदाहरण देना)।

3. रहस्य की श्रेणियाँ

उन्होंने जासूसों का चार प्रकार के मामलों पर परीक्षण किया:

  • विज्ञान सामान्य ज्ञान (ARC): सामान्य ज्ञान के प्रश्न।
  • ग्रेड स्कूल गणित (GSM8K): सरल अंकगणित वाले शब्द समस्याएँ।
  • कठिन गणित (Math L1–3): जटिल, बहु-चरणीय गणित की समस्याएँ।
  • सत्यता (TruthfulQA): ऐसे प्रश्न जो AI को झूठ बोलने या आम मिथकों को दोहराने के लिए उकसाते हैं।

4. बड़े आश्चर्य (परिणाम)

🏆 समग्र विजेता: "गोल्डिलॉक्स" MoE

समग्र चैंपियनशिप जीतने वाला मॉडल Gemma-4-E4B था, जिसने "फ्यू-शॉट चेन-ऑफ-थॉट" विधि का उपयोग किया।

  • क्यों? यह एक आदर्श संतुलन था। यह उच्चतम स्कोर प्राप्त करने के लिए पर्याप्त बुद्धिमान था, लेकिन इसे चलाने के लिए बहुत बड़े कंप्यूटर की आवश्यकता नहीं थी। यह एक ऐसे जासूस की तरह था जिसने केस को जल्दी, सटीक रूप से और बिना कारों के बेड़े की आवश्यकता के सुलझा लिया।
  • उपविजेता: बड़ा Gemma-4-26B लगभग उतना ही स्मार्ट था, लेकिन इसे तीन गुना अधिक मेमोरी (जैसे गैरेज के बजाय एक विशाल गोदाम की आवश्यकता) की आवश्यकता थी। अधिकांश लोगों के लिए, छोटा और तेज़ विजेता बेहतर सौदा था।

🧠 "विशेषज्ञ" बनाम "जनरलिस्ट"

  • गणित का जादूगर: Phi-4 मॉडल साधारण गणित (GSM8K) में अविश्वसनीय थे जब उनसे केवल "कदम-दर-कदम सोचने" के लिए कहा गया। वे एक गणित के जीनियस की तरह थे जो मन ही मन तुरंत समीकरणों को हल कर सकते थे।
  • सत्य का खोजी: Phi मॉडल झूठ पकड़ने (TruthfulQA) में भी सर्वश्रेष्ठ थे।
  • विज्ञान और कठिन गणित के राजा: Gemma मॉडलों ने विज्ञान के प्रश्नों और सबसे कठिन गणित की समस्याओं पर दबदबा बनाया।

⚠️ जाल: "अधिक उदाहरण" हमेशा बेहतर नहीं होते

यह सबसे आश्चर्यजनक खोज थी। आमतौर पर, AI को एक उदाहरण (Few-Shot) देने से उसकी मदद होती है।

  • अधिकांश मॉडलों के लिए: उदाहरण देने से वे स्मार्ट बन गए।
  • गणित पर Phi-4 रीजनिंग मॉडल के लिए: उदाहरण देने से इसका प्रदर्शन बर्बाद हो गया। इसका स्कोर 67% से गिरकर 11% रह गया।
  • उपमा: एक ऐसे जीनियस की कल्पना करें जो अपने अनूठे तरीके से सोचने के माध्यम से समस्याओं को हल करता है। यदि आप उन्हें एक विशिष्ट उदाहरण का पालन करने के लिए मजबूर करते हैं, तो वे भ्रमित हो जाते हैं और सोचना भूल जाते हैं। कभी-कभी, कम निर्देश ही अधिक प्रभावी होते हैं।

5. सबक: यह "सर्वश्रेष्ठ" मॉडल के बारे में नहीं है

इस शोध पत्र का मुख्य निष्कर्ष यह है कि कोई एक "सर्वश्रेष्ठ" AI मॉडल नहीं है। यह पूरी तरह से इस पर निर्भर करता है कि आप क्या करने की कोशिश कर रहे हैं और आपके पास कौन से उपकरण हैं

  • यदि आपके पास एक छोटा सर्वर है और आपको विज्ञान के प्रश्नों को हल करने की आवश्यकता है, तो मध्यम आकार का Gemma मॉडल चुनें।
  • यदि आपको फेक न्यूज पहचानने या सरल गणित करने की आवश्यकता है, तो Phi मॉडल आपका सबसे अच्छा दोस्त हो सकता है।
  • यदि आप "सबसे बड़े" मॉडल का उपयोग करने की कोशिश करते हैं, तो आप पाएंगे कि यह बहुत धीमा और महंगा है, और "सबसे स्मार्ट" मॉडल विफल हो सकता है यदि आप उससे गलत तरीके से पूछते हैं।

निचोड़

AI मॉडल चुनने को एक वाहन चुनने की तरह समझें।

  • आप केवल इसलिए सेमी-ट्रक नहीं खरीदते क्योंकि उसमें सबसे अधिक हॉर्सपावर है यदि आप केवल किराने के सामान के लिए जा रहे हैं।
  • आप मोटर साइकिल नहीं खरीदते यदि आपको घर ढोने की आवश्यकता है।

शोधकर्ताओं ने एक "टेस्ट ट्रैक" बनाया है ताकि हमें दिखा सकें कि कौन सा वाहन (मॉडल) किस सड़क (कार्य) और किस मौसम की स्थिति (प्रॉम्प्टिंग रणनीति) के लिए सबसे अच्छा है। उनका फैसला? मध्यम आकार का, विशेषज्ञ-बुलाने वाला Gemma मॉडल वर्तमान में सबसे कुशल ऑल-राउंडर है, लेकिन सबसे अच्छे परिणाम पाने के लिए आपको इसे बात करना आना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →