← नवीनतम पेपर
⚛️ high-energy experiments

Conditional Capacity and Routing in Mixture-of-Experts Particle Transformers

यह शोध पत्र JetClass-II डेटासेट पर Mixture-of-Experts (MoE) Particle Transformers की जांच करता है, जो यह प्रदर्शित करता है कि top-1 MoE कॉन्फ़िगरेशन लगभग अपरिवर्तित सक्रिय गणना के साथ डेंस बेसलाइन की तुलना में वर्गीकरण सटीकता में महत्वपूर्ण सुधार कर सकते हैं, जबकि यह भी प्रकट करता है कि बढ़े हुए विशेषज्ञ भंडारण (expert storage) से मिलने वाला लाभ घटता जाता है और रूटिंग संरचना का प्रदर्शन के साथ कोई सख्त सहसंबंध नहीं है।

मूल लेखक: Kaushik Pendiyala, Haris Zia, Trevin Lee, Timothy Legge, Alejandro J. De Leon, Zihan Zhao, Aaron Wang, Abhijith Gandrakota, Jennifer Ngadiuba, Richard Cavanaugh, Javier Duarte

प्रकाशित 2026-10-05
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaushik Pendiyala, Haris Zia, Trevin Lee, Timothy Legge, Alejandro J. De Leon, Zihan Zhao, Aaron Wang, Abhijith Gandrakota, Jennifer Ngadiuba, Richard Cavanaugh, Javier Duarte

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

उच्च-ऊर्जा भौतिकी प्रयोगशालाओं में, जहाँ वैज्ञानिक ब्रह्मांड की मौलिक संरचना को समझने के लिए कणों को आपस में टकराते हैं, डेटा एक अराजक, अत्यधिक प्रवाह के रूप में आता है। जब दो प्रोटॉन आपस में टकराते हैं, तो वे छोटे कणों के फुहारों में टूट जाते जिन्हें 'जेट्स' कहा जाता है। ये जेट्स एकसमान नहीं होते; ये दर्जनों व्यक्तिगत कणों वाले जटिल बादल होते हैं, जिनमें से प्रत्येक की अपनी गति, दिशा और पहचान होती है। इसे समझने के लिए, भौतिक विज्ञानी इन जेट्स को श्रेणियों में वर्गीकृत करने के लिए शक्तिशाली कंप्यूटर मॉडल का उपयोग करते हैं, ताकि वे उन दुर्लभ, विलक्षण संकेतों की खोज कर सकें जो शोर के भीतर छिपे प्रकृति के नए नियमों का संकेत दे सकते हैं। वर्षों से, इस काम के लिए सबसे सफल उपकरण डीप लर्निंग सिस्टम रहे हैं जो प्रत्येक जेट में मौजूद प्रत्येक कण को एक समूह के विशिष्ट सदस्य के रूप में देखते हैं और विश्लेषण करते हैं कि वे एक-दूसरे से कैसे संबंधित हैं। हालाँकि, जैसे-जैसे श्रेणियों की संख्या बढ़ती जा रही है—जो अब कणों के लगभग दो सौ अलग-अलग प्रकारों तक पहुँच गई है—ये सिस्टम एक दुविधा का सामना करते हैं। अधिक श्रेणियों को संभालने के लिए उन्हें बड़ा बनाने का अर्थ आमतौर पर उन्हें चलाना धीमा और अधिक महंगा होना है, क्योंकि प्रत्येक एकल कण को पूरे कंप्यूटर मस्तिष्क का पूर्ण ध्यान आकर्षित करने की आवश्यकता होती है।

शोधकर्ताओं की एक टीम ने 'मिक्सचर-ऑफ-एक्सपर्ट्स' (mixture-of-experts) मॉडल के रूप में जानी जाने वाली एक अलग प्रकार की वास्तुकला का परीक्षण करके इस समस्या को हल करने का प्रयास किया। एक विशेषज्ञ टीम की कल्पना करें, जहाँ एक प्रबंधक यह निर्णय लेता है कि प्रत्येक आने वाले कार्य को कौन सा विशिष्ट विशेषज्ञ संभालेगा, बजाय इसके कि पूरी टीम से एक साथ सब कुछ करने के लिए कहा जाए। कण भौतिकी के संदर्भ में, इसका अर्थ है कि कंप्यूटर मॉडल के पास कई आंतरिक "विशेषज्ञ" नेटवर्क हैं, लेकिन जेट में प्रत्येक कण के लिए, यह केवल उन कुछ विशेषज्ञों को सक्रिय करता है जो उस विशिष्ट कण का विश्लेषण करने के लिए सबसे उपयुक्त हैं। यह दृष्टिकोण मॉडल को भारी गणना लागत के बिना ज्ञान का एक विशाल भंडार रखने की अनुमति देता है। शोधकर्ताओं ने इस विचार को 'पार्टिकलल ट्रांसफॉर्मर' (Particle Transformer) नामक एक परिष्कृत प्रणाली पर लागू किया, जो जेट वर्गीकरण के लिए पहले से ही एक स्वर्ण मानक है, और उन्होंने 188 विभिन्न प्रकार के कण जेट्स वाले एक विशाल डेटासेट के विरुद्ध इसका परीक्षण किया। उनका लक्ष्य यह देखना था कि क्या ज्ञान का यह "ऑन-डिमांड" सक्रियण, एक बहुत बड़े और पूरी तरह से सक्रिय कंप्यूटर मस्तिष्क को चलाने की भारी लागत के बिना सटीकता में सुधार कर सकता है।

अध्ययन ने इस बात की एक सूक्ष्म तस्वीर पेश की कि ये मॉडल कैसे सीखते और प्रदर्शन करते हैं। जब शोधकर्ताओं ने सिस्टम को इस तरह से कॉन्फ़िगर किया कि प्रत्येक कण को गारंटी के साथ ठीक एक विशेषज्ञ द्वारा संसाधित किया जाए, तो मॉडल पारंपरिक, पूरी तरह से सक्रिय संस्करण की तुलना में काफी अधिक सटीक हो गया, भले ही इसने लगभग उतनी ही कंप्यूटिंग शक्ति का उपयोग किया। यह सुझाव देता है कि सिस्टम के पास उपलब्ध ज्ञान का अधिक हिस्सा होने मात्र से, भले ही किसी भी समय केवल एक छोटा हिस्सा उपयोग किया जाए, कंप्यूटर को कण जेट के बीच सूक्ष्म अंतर को पहचानने में मदद मिलती है। हालाँकि, टीम ने यह भी पाया कि इस लाभ की एक सीमा है। विशेषज्ञों के पूल में एक निश्चित बिंदु के बाद अधिक विशेषज्ञ जोड़ने से मॉडल को जेट की पहचान करने में कोई अतिरिक्त सुधार नहीं हुआ, भले ही संग्रहीत जानकारी की कुल मात्रा काफी बढ़ गई थी। अतिरिक्त ज्ञान निष्क्रिय रहा, जिसने अंतिम उत्तर में कोई सुधार नहीं किया।

शोधकर्ताओं ने यह भी पता लगाया कि क्या होता है जब वे सिस्टम को प्रत्येक कण के लिए एक से अधिक विशेषज्ञ से परामर्श करने की अनुमति देते हैं। उन्होंने पाया कि प्रत्येक कण के लिए दो या चार विशेषज्ञों को सक्रिय करने से मॉडल की सिग्नल और बैकग्राउंड शोर के बीच अंतर करने की क्षमता में वास्तव में वृद्धि हुई, लेकिन इसकी एक भारी कीमत थी: इन लाभों को प्राप्त करने के लिए कंप्यूटर को लगभग डेढ़ गुना अधिक काम करना पड़ा। यह व्यापार (trade-off) ज्ञान के एक बड़े पुस्तकालय और वास्तव में उसका उपयोग करने के बीच के महत्वपूर्ण अंतर को रेखांकित करता है। टीम ने यह भी जांचा कि कंप्यूटर यह कैसे तय करता है कि किस कण के लिए किस विशेषज्ञ का उपयोग किया जाए। उन्होंने पाया कि सिस्टम स्वाभाविक रूप से खुद को व्यवस्थित करने लगा, विशिष्ट विशेषज्ञों को कणों के विशिष्ट प्रकारों को सौंपने के लिए, जो उनके भौतिक गुणों, जैसे कि उनकी गति या आवेश पर आधारित थे। फिर भी, इस आंतरिक संगठन का बेहतर प्रदर्शन के साथ हमेशा संबंध नहीं था। कुछ मामलों में, मॉडल ने अपने विशेषज्ञों के बीच काम को विभाजित करने के बहुत मजबूत, संरचित तरीके विकसित किए, लेकिन इससे उच्च सटीकता में कोई वृद्धि नहीं हुई। वास्तव में, सबसे संरचित रूटिंग ने हमेशा सर्वोत्तम परिणाम नहीं दिए, जिससे पता चलता कि श्रम का एक व्यवस्थित आंतरिक विभाजन सही उत्तर की गारंटी नहीं है।

शायद इस अध्ययन का सबसे व्यावहारिक सबक सिस्टम की क्षमता की सीमाओं के बारे में है। शोधकर्ताओं ने पाया कि यदि सिस्टम को सीमित संख्या में विशेषज्ञों को बहुत अधिक कणों को रूट करने के लिए कहा गया, तो कंप्यूटर वर्कलोड को बनाए रखने के लिए अतिरिक्त कणों को बस छोड़ (drop) देता है। जब ऐसा हुआ, तो मॉडल का प्रदर्शन तेजी से गिर गया, जो मानक, गैर-विशिष्ट संस्करण से भी खराब हो गया। यह निष्कर्ष इस बात पर जोर देता है कि कई विशेषज्ञों की उपस्थिति ही पर्याप्त नहीं है; सिस्टम के पास उन असाइनमेंटों को संसाधित करने के लिए पर्याप्त स्थान भी होना चाहिए जो वह बनाता है। यदि रूटिंग तंत्र बहुत सख्त है, तो कई विशेषज्ञों के होने के संभावित लाभ खो जाते हैं क्योंकि सिस्टम ट्रैफ़िक को संभालने में असमर्थ होता है। अध्ययन यह निष्कर्ष निकालता है कि इन कण क्लासिफायर के प्रभावी होने के लिए, वैज्ञानिकों को तीन चीजों के बीच सावधानीपूर्वक संतुलन बनाना चाहिए: ज्ञान की कुल मात्रा, वास्तव में उपयोग की जाने वाली कंप्यूटिंग शक्ति, और सूचना के प्रवाह को बिना गिराए (dropping) प्रबंधित करने की क्षमता। केवल अधिक विशेषज्ञ जोड़ना एक जादुई समाधान नहीं है; मूल्य इस बात से आता है कि उन विशेषज्ञों को कैसे सक्रिय किया जाता है और क्या सिस्टम सूचना के प्रवाह को सफलतापूर्वक प्रबंधित कर सकता है।

अंततः, यह कार्य उप-परमाणु दुनिया का विश्लेषण करने के लिए बेहतर उपकरण बनाने के लिए एक स्पष्ट रोडमैप प्रदान करता है। यह दिखाता है कि जबकि स्पार्स (sparse), विशेषज्ञ-आधारित मॉडल भारी लागत वृद्धि के बिना पारंपरिक मॉडलों से बेहतर प्रदर्शन कर सकते हैं, उन्हें अपने आंतरिक तंत्र के सूक्ष्म ट्यूनिंग की आवश्यकता होती है। शोधकर्ताओं ने प्रदर्शित किया कि सर्वोत्तम प्रदर्शन अक्सर उस 'स्वीट स्पॉट' से आता है जहाँ सिस्टम के पास देखे गए कणों की विविधता को कवर करने के लिए पर्याप्त विशेषज्ञ होते हैं, लेकिन इतने अधिक नहीं होते कि रूटिंग अक्षम हो जाए या अतिरिक्त ज्ञान का उपयोग न हो सके। संग्रहीत क्षमता, सक्रिय गणना और रूटिंग संगठन की अवधारणाओं को अलग करके, टीम ने स्पष्ट किया है कि ये जटिल सिस्टम वास्तव में कैसे कार्य करते हैं। उनके निष्कर्ष बताते हैं कि कण भौतिकी मशीन लर्निंग का भविष्य केवल मॉडलों को बड़ा बनाने में नहीं, बल्कि इस बात में है कि वे अपने पास मौजूद संसाधनों का उपयोग कितनी समझदारी से करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →