← नवीनतम पेपर
🤖 machine learning

Systematic Exploration of 4-Expert Heterogeneous Mixture-of-Experts via Automated Pipeline Search

यह शोध पत्र LEMUR डेटासेट के भीतर विषम 4-एक्सपर्ट मिक्स्चर-ऑफ-एक्सपर्ट आर्किटेक्चर की खोज के लिए एक स्वचालित पाइपलाइन प्रस्तुत करता है, जो एक महत्वपूर्ण वर्णमाला क्रम संबंधी पूर्वाग्रह (alphabetical enumeration bias) को प्रकट करता है जिसने खोज स्थान को AirNet-केंद्रित संयोजनों तक सीमित कर दिया था, जबकि उच्च-सटीकता वाले एन्सेम्बल्स के लिए ShuffleNet और MobileNetV3 को इष्टतम भागीदारों के रूप में पहचाना।

मूल लेखक: Yashkumar R Lukhi, Harsh Rameshbhai Moradiya, Radu Timofte, Dmitry Ignatov

प्रकाशित 2026-06-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yashkumar R Lukhi, Harsh Rameshbhai Moradiya, Radu Timofte, Dmitry Ignatov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक परम "सुपर-सूप" बनाने की कोशिश कर रहे हैं। आपके पास एक पेंट्री (LEMUR डेटासेट) है जिसमें 24 अलग-अलग प्रकार के पहले से बने हुए शोरबे (जैसे चिकन, बीफ, वेजिटेबल, आदि) हैं। आपका लक्ष्य इन 29 शोरबों में से ठीक चार को आपस में मिलाना है ताकि यह देखा जा सके कि कौन सा संयोजन सबसे अच्छा स्वाद देता है।

यह पेपर एक रोबोट शेफ के बारे में बताता है जिसने इसे स्वचालित रूप से करने की कोशिश की, लेकिन एक मज़ेदार गलती हुई जिसने परिणामों को बदल दिया। यहाँ बताया गया है कि क्या हुआ, जिसे सरल रूप में तोड़कर समझाया गया है।

1. लक्ष्य: एक "सुपर-सूप" बनाना

AI की दुनिया में, एक Mixture-of-Experts (MoE) विशेषज्ञों की एक टीम की तरह है। एक विशाल मस्तिष्क द्वारा समस्या को हल करने के बजाय, आपके पास चार छोटे, अलग-अलग मस्तिष्क हैं जो मिलकर काम करते हैं।

  • कार्य: रोबोट को 29 विकल्पों वाली पेंट्री में से 4 अलग-अलग AI "मस्तिष्क" (आर्किटेक्चर) चुनने और उन्हें एक टीम में मिलाने की आवश्यकता थी।
  • गणित: 29 में से 4 मस्तिष्क चुनने के 23,751 संभावित तरीके हैं। सूप के इतने सारे रेसिपी टेस्ट करना!

2. रोबोट शेफ की रसोई

शोधकर्ताओं ने इस काम को बिना मानवीय सहायता के करने के लिए एक स्वचालित रसोई (एक पाइपलाइन) बनाई।

  • जेनेरेटर: एक रोबोट स्क्रिप्ट जो नए सूप रेसिपी के लिए कोड लिखती है। यह केवल अनुमान नहीं लगाती; यह कोड को लेगो सेट की तरह सावधानीपूर्वक जोड़ती है।
  • सुरक्षा जांच: पकाने से पहले, रोबोट रेसिपी की तीन बार जांच करता है:
    1. क्या व्याकरण सही है? (सिंटैक्स चेक)
    2. क्या बर्तन चूल्हे पर फिट बैठता है? (CPU टेस्ट यह देखने के लिए कि आकार काम करता है या नहीं)
    3. क्या हमने यह सूप पहले बनाया है? (डुप्लिकेट की जाँच करना)
  • खाना बनाना: यदि रेसिपी पास हो जाती है, तो यह केवल एक दिन (एक ट्रेनिंग इपोक) के लिए एक बहुत शक्तिशाली चूल्हे (NVIDIA RTX 4090 ग्राफिक्स कार्ड) पर पकती है। लक्ष्य एक आदर्श सूप बनाना नहीं था, बल्कि सबसे उम्मीदवार संयोजनों को तेज़ी से खोजना था।

3. बड़ी गलती: "वर्णानुक्रम" (Alphabetical) का जाल

रोबोट शेफ को सभी 23,751 संयोजनों को आज़माना था। हालाँकि, इसने अपने सामग्री चुनने के तरीके में एक गंभीर त्रुटि की।

रोबोट को वर्णानुक्रम (alphabetical order) में संयोजन चुनने के लिए कहा गया था।

  • कल्पना कीजिए कि आपकी पेंट्री वर्णानुक्रम में व्यवस्थित है। सबसे पहला आइटम है "AirNet।"
  • रोबोट ने रेसिपी चुनना शुरू किया। उसने हर उस संयोजन को चुना जिसमें "AirNet" शामिल था।
  • क्योंकि "AirNet" को तीन अन्य सामग्रियों के साथ मिलाने के बहुत सारे तरीके हैं, रोबोट ने अपना सारा समय "AirNet" वाले सूप बनाने में बिता दिया।
  • परिणाम: 28 दिनों तक खाना बनाने के बाद, रोबोट ने 1,146 रेसिपी आजमा ली थीं। लेकिन क्या आप जानते हैं? उनमें से हर एक में "AirNet" शामिल था।
  • इसने कभी भी ऐसा सूप नहीं बनाया जिसमें "AirNet" न हो। इसने कुल संभावित रेसिपी में से केवल 4.8% का ही पता लगाया। यह एक ऐसे शेफ की तरह था जो केवल "चिकन-आधारित" सूप बनाता रहता है और कभी "बीफ-आधारित" सूप नहीं आज़माता, सिर्फ इसलिए क्योंकि सूची में "चिकन" पहले आता है।

4. उन्होंने क्या पाया ( "AirNet" ज़ोन के अंदर)

भले ही उन्होंने केवल "AirNet" सूप देखे, फिर भी उन्हें कुछ दिलचस्प चीजें मिलीं:

  • सबसे अच्छी सामग्रियां: जब "AirNet" को ShuffleNet या MobileNetV3 के साथ मिलाया गया, तो सूप का स्वाद सबसे अच्छा था (उच्चतम सटीकता)। ये दो "गुप्त मसाले" थे जिन्होंने टीम को अच्छी तरह से काम करने में मदद की।
  • खराब सामग्रियां:
    • FractalNet: यह सामग्री आपदा थी। यह इतनी जटिल थी कि इसने बार-बार चूल्हा तोड़ दिया (मेमोरी खत्म हो गई)। यह एक "डेड एंड" (बंद रास्ता) था।
    • MNASNet: इस सामग्री ने चूल्हा तो नहीं तोड़ा, लेकिन सूप का स्वाद बहुत खराब था। यह एक "कम उपज" वाली सामग्री थी जिसने टीम का प्रदर्शन खराब कर दिया।
  • विजेता: सबसे अच्छा सूप जो मिला वह था AirNet + AlexNet + DPN68 + ResNet का मिश्रण। इसने केवल एक दिन में मानक परीक्षण (CIFAR-10) पर 68% का स्कोर प्राप्त किया।

5. सीखा गया सबक

शोधकर्ताओं ने महसूस किया कि उनका रोबोट पक्षपाती था क्योंकि वह बहुत व्यवस्थित था।

  • सुधार: सूची को वर्णानुक्रम में चुनने के बजाय, उन्हें शुरू करने से पहले सूची को रैंडमली (यादृच्छिक रूप से) शफल करना चाहिए था। इस तरह, "AirNet" केवल लगभग 14% रेसिपी में दिखाई देता (जो कि निष्पक्ष है), और उन्हें सभी संभावित संयोजनों का वास्तविक स्वाद मिलता।

सारांश

  • उन्होंने क्या किया: सबसे अच्छी टीम खोजने के लिए 4 अलग-अलग AI मॉडल को स्वचालित रूप से मिलाने के लिए एक रोबोट बनाया।
  • क्या गलत हुआ: रोबोट एक "वर्णानुक्रम लूप" में फंस गया, जिससे वह केवल एक विशिष्ट मॉडल (AirNet) वाला संयोजन ही टेस्ट कर सका, जिससे 95% संभावनाएं छूट गईं।
  • उन्होंने क्या सीखा: इस गलती के बावजूद, उन्होंने पाया कि ShuffleNet और MobileNetV3 AI टीमों के लिए बेहतरीन साथी हैं, जबकि FractalNet और MNASNet बुरे साथी हैं।
  • सीख: सर्वोत्तम संयोजन खोजने के लिए, क्रम में न चलें; इसे रैंडमली मिक्स करें ताकि बेहतरीन विकल्पों को मिस करने से बचा जा सके।

इस "वर्णानुक्रम जाल" के लिए कोड और सुधार दूसरों के उपयोग के लिए जारी कर दिया गया है, ताकि भविष्य के रोबोट शेफ ऐसी गलती न करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →