← नवीनतम पेपर
🤖 AI

Beyond Routing Saturation: A Long-Horizon Class-Incremental Perspective on Expert Routing in Multimodal Continual Instruction Tuning

यह शोध पत्र FLEX को प्रस्तुत करता है, जो एक चुनौतीपूर्ण 34-कार्य वाला बेंचमार्क है जो टेक्स्टुअल फिंगरप्रिंट्स को हटाकर और टास्क होराइजन्स का विस्तार करके मल्टीमॉडल कॉन्टिनुअल इंस्ट्रक्शन ट्यूनिंग में वर्तमान एक्सपर्ट रूटिंग की सीमाओं को उजागर करता है, जबकि एक सिद्धांत-आधारित क्लास-इन्क्रीमेंटल लर्निंग फ्रेमवर्क का प्रस्ताव देता है जो रूटिंग सटीकता और समग्र प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Huiyu Yi, Yongqi Xu, Bogang Zhang, Dunwei Tu, Xu Zhiming, Zhen-Hao Xie, Baile Xu, Furao Shen

प्रकाशित 2026-08-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huiyu Yi, Yongqi Xu, Bogang Zhang, Dunwei Tu, Xu Zhiming, Zhen-Hao Xie, Baile Xu, Furao Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को एक के बाद एक कई अलग-अलग कौशल में महारत हासिल करना सिखा रहे हैं। पहले, आप उसे बिल्लियों और कुत्तों को पहचानना सिखाते हैं। फिर, आप उसे गणित की समस्याएँ हल करना सिखाते हैं। इसके बाद, आप उसे मेडिकल एक्स-रे पढ़ना सिखाते हैं। इसे कंटीन्यूअल लर्निंग (Continual Learning) कहा जाता है। पेचीदा बात यह है कि जैसे-जैसे रोबोट नए कौशल सीखता है, वह अक्सर पुराने कौशल भूल जाता है, या जब आप उससे कोई सवाल पूछते हैं तो वह भ्रमित हो जाता है कि कौन सा कौशल उपयोग करना है।

इस समस्या को ठीक करने के लिए, वैज्ञानिक रोबोट को विशेष सहायकों का एक "टूलबॉक्स" देते हैं, जिन्हें LoRA एक्सपर्ट्स कहा जाता है। इन विशेषज्ञों को एक विशाल रसोई में अलग-अलग शेफ (रसोइयों) के रूप में सोचें। एक शेफ बेकिंग में माहिर है, दूसरा ग्रिलिंग में, और तीसरा सुशी बनाने में। जब आप कोई ऑर्डर देते हैं, तो आपको एक राउटर (Router)—एक स्मार्ट वेटर—की आवश्यकता होती है जो आपके ऑर्डर को देखे और उसे सही शेफ के पास भेजे। यदि वेटर सुशी का ऑर्डर ग्रिलिंग शेफ को भेज देता है, तो भोजन आपदा बन जाएगा। बड़ा सवाल यह है: क्या हमारा वेटर यह जानने में बेहतर हो सकता है कि बिल्कुल सही शेफ किसे चुनना है, खासकर जब रेस्टोरेंट में दर्जनों शेफ हो जाते हैं और ऑर्डर एक जैसे दिखने लगते हैं?


समस्या: वेटर शॉर्टकट पर निर्भर है (लेकिन केवल इसलिए क्योंकि मेनू बहुत आसान है)

नानजिंग यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने यह जांचने का फैसला किया कि ये "वेटर" (राउटर) वास्तव में अपना काम कितनी अच्छी तरह कर रहे हैं। उन्होंने इन रोबोटों को प्रशिक्षित करने के लिए उपयोग किए जाने वाले मानक परीक्षणों को देखा और पाया कि कुछ संदिग्ध था: वेटर बेहतरीन स्कोर प्राप्त कर रहे थे, लेकिन वे शॉर्टकट का सहारा ले रहे थे।

मौजूदा परीक्षणों में, "मेनू" (रोबोट को दिए गए निर्देश) में स्पष्ट संकेत थे। उदाहरण के लिए, एक गणित की समस्या हमेशा "Calculate the sum" (योग की गणना करें) वाक्यांश से शुरू हो सकती है, जबकि एक चित्र का वर्णन हमेशा "Describe the image" (छवि का वर्णन करें) से शुरू हो सकता है। वेटर को चित्र देखने या गणित को समझने की आवश्यकता नहीं थी; उसे बस सही शेफ को चुनने के लिए निर्देश के पहले कुछ शब्दों को पढ़ने की आवश्यकता थी। शोधकर्ता इन संकेतों को "टेक्स्टुअल फिंगरप्रिंट्स" (Textual Fingerprints) कहते हैं।

चूंकि मौजूदा परीक्षणों में केवल कुछ ही कार्य (जैसे 6 से 10 शेफ) थे और मेनू बहुत स्पष्ट थे, इसलिए राउटिंग की समस्या "सैचुरेटेड" (तृप्त) थी। यह एक छोटे से रेस्टोरेंट में एक वेटर की तरह था जिसमें केवल तीन टेबल हैं; वे ग्राहकों के नाम सीखने के बजाय केवल टेबल नंबर याद कर सकते थे। शोधकर्ताओं ने महसूस किया कि यदि हम एक ऐसा रोबोट बनाना चाहते हैं जो लंबे समय तक सैकड़ों कौशल सीख सके, तो हमें बहुत कठिन परीक्षण की आवश्यकता है जहाँ मेनू एक जैसे दिखें, जिससे वेटर को वास्तव में सामग्री को समझने के लिए मजबूर होना पड़े।

समाधान: एक नया, कठिन रेस्टोरेंट (FLEX)

इसे ठीक करने के लिए, टीम ने FLEX (Fingerprint-reduced Long-horizon Expert eXamination) नामक एक नया बेंचमार्क बनाया।

कल्पIFiaना करें कि FLEX एक विशाल, अराजक रेस्टोरेंट है जिसमें केवल कुछ के बजाय 34 अलग-अलग शेफ (कार्य) हैं। इस रेस्टोरेंट में, प्रत्येक शेफ एक ही मेनू टेम्पलेट का उपयोग करता है। चाहे आप गणित की समस्या, मेडिकल डायग्नोसिस, या सूर्यास्त का वर्णन ऑर्डर कर रहे हों, निर्देश बिल्कुल एक जैसा दिखता है। यह जानने का एकमात्र तरीका कि किस शेफ को चुनना है, वास्तव में चित्र को देखना और संदर्भ को समझना है।

शोधकर्ताओं ने "शॉर्टकट" संकेतों को भी हटा दिया। उन्होंने यह सुनिश्चित किया कि केमिस्ट्री की समस्या के निर्देश आर्ट हिस्ट्री (कला इतिहास) के निर्देशों से अलग न दिखें। इसने राउटिंग सिस्टम को शॉर्टकट पर निर्भर रहने के बजाय वास्तव में यह समझने का कठिन काम करने के लिए मजबूर किया कि कार्य वास्तव में क्या है।

बड़ा विचार: वेटर केवल एक क्लासिफायर है

यहाँ वह चतुर मोड़ है जिसे यह पेपर पेश करता है। शोधकर्ताओं ने महसूस किया कि वेटर (राउटर) का काम वास्तव में क्लास-इन्क्रीमेंटल लर्निंग (Class-Incremental Learning - CIL) नामक एक क्लासिक मशीन लर्निंग समस्या के समान है।

CIL में, आप एक कंप्यूटर को नई श्रेणियों (जैसे "बिल्लियाँ", फिर "कुत्ते", फिर "पक्षी") को पहचानना सिखाते हैं बिना पुरानी चीज़ों को भूले। शोधकर्ताओं ने दिखाया कि सही LoRA एक्सपर्ट चुनना बिल्कुल सही कैटेगरी (श्रेणी) चुनने के समान है।

  • Task 1 (गणित) = Class 1
  • Task 2 (कला) = Class 2
  • Task 34 (मेडिसिन) = Class 34

इस समस्या को इस तरह से देखकर, वे उन शक्तिशाली "वेटर ट्रेनिंग" तकनीकों को उधार ले सके जो पहले से ही CIL के लिए आविष्कार की गई थीं। उन्होंने चार अलग-अलग तरीकों (HC, HC-SOINN, RanPAC, और DDAS) को लिया और उन्हें मौजूदा रोबोटों के राउटिंग सिस्टम में प्लग किया।

परिणाम: एक बहुत अधिक स्मार्ट वेटर

जब उन्होंने इन नए "प्लग-इन" वेटरों का कठिन FLEX रेस्टोरेंट में परीक्षण किया, तो परिणाम प्रभावशाली थे:

  • बेहतर सटीकता (Better Accuracy): नए राउटर पुराने वाले की तुलना में 16.3 प्रतिशत अंक अधिक बार सही शेफ की पहचान करने में सफल रहे।
  • बेहतर प्रदर्शन (Better Performance): रोबोट का समग्र प्रदर्शन (जिसे MacroScore कहा जाता है) 4.6 अंक तक सुधरा।
  • गैप को कम करना (Closing the Gap): नए राउटर वर्तमान प्रदर्शन और "परफेक्ट" प्रदर्शन (जहाँ रोबोट हमेशा सही शेफ को जानता है) के बीच के अंतर को 28% से 50% तक रिकवर करने में सक्षम रहे।

हालाँकि, पेपर में यह भी पाया गया कि सभी रोबोट समान रूप से लाभ नहीं उठाते हैं। कुछ मौजूदा सिस्टम (जैसे HiDe-LLaVA) इस तरह डिज़ाइन किए गए थे कि एक परफेक्ट वेटर भी अंतिम भोजन को बहुत अधिक नहीं सुधार सकता था, क्योंकि समस्या वास्तव में शेफ के खाना बनाने के तरीके में थी, न कि वेटर के ऑर्डर देने के तरीके में। लेकिन उन सिस्टमों के लिए जो वेटर पर बहुत अधिक निर्भर थे (जैसे DISCO और SAME), सुधार बहुत बड़ा था।

यह क्यों महत्वपूर्ण है

यह पेपर सुझाव देता है कि एक रोबोट के लिए वास्तव में लंबे समय तक निरंतर रूप से सीखने के लिए, हम उसे स्पष्ट संकेतों वाले आसान परीक्षण नहीं दे सकते। हमें ऐसे वातावरण बनाने की आवश्यकता है जहाँ रोबोट को वास्तव में कार्य को समझना होगा, न कि केवल लेबल को पढ़ना होगा। "किसे बुलाना है?" की समस्या को "यह कौन सी श्रेणी है?" की समस्या के रूप में मानकर, हम अपने AI को बहुत अधिक विश्वसनीय बनाने के लिए मौजूदा, शक्तिशाली उपकरणों का उपयोग कर सकते हैं।

शोधकर्ताओं ने केवल यह सुझाव नहीं दिया; उन्होंने नया टेस्ट (FLEX) बनाया, यह साबित किया कि पुराने टेस्ट बहुत आसान थे, और दिखाया कि इन नए राउटिंग तरीकों को बदलना काम करता है। उन्होंने यह दावा नहीं किया कि उन्होंने सब कुछ हल कर लिया है—परफेक्शन तक का गैप अभी भी मौजूद है—लेकिन उन्होंने मल्टीमॉडल AI को बेहतर बनाने के लिए एक स्पष्ट, सिद्धांत आधारित रास्ता दिखाया है जो वास्तव में भ्रमित हुए बिना लगातार सीख सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →