UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling
यह शोधपत्र UniScale को प्रस्तुत करता है, जो एक ऑनलाइन फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल डिप्लॉयमेंट में बेहतर गुणवत्ता-लागत संतुलन प्राप्त करने के लिए कॉन्टेक्स्टुअल मल्टी-आर्म्ड बैंडिट्स का उपयोग करके मॉडल रूटिंग और टेस्ट-टाइम स्केलिंग को एक एकल अनुकूली अनुकूलन स्थान (adaptive optimization space) में एकीकृत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त रेस्टोरेंट किचन चला रहे हैं। आपका लक्ष्य ग्राहकों को स्वादिष्ट भोजन (उच्च-गुणवत्ता वाले उत्तर) जितनी जल्दी और कम लागत में (कम कंप्यूटेशनल लागत) परोसना है।
लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया में, शेफ पारंपरिक रूप से इन दो अलग-अलग रणनीतियों का उपयोग करते हैं:
"मेन्यू स्विच" (मॉडल रूटिंग): यदि कोई ग्राहक साधारण सलाद ऑर्डर करता है, तो आप उसे एक जूनियर कुक के पास भेजते हैं। यदि वह जटिल 10-कोर्स वाला भोज ऑर्डर करता है, तो आप उसे हेड शेफ के पास भेजते हैं। समस्या यह है कि आपके पास केवल कुछ विशिष्ट शेफ ही स्टाफ में हैं। आप आसानी से मध्यम कठिनाई वाले व्यंजन के लिए "मिड-लेवल" शेफ नहीं ढूंढ सकते। या तो आपको साधारण सलाद मिलेगा या एक विशाल भोज, बीच का कोई रास्ता नहीं है।
"अतिरिक्त प्रयास" (टेस्ट-टाइम स्केलिंग): आप उसी शेफ को रखते हैं लेकिन उन्हें और अधिक गहराई से सोचने के लिए कहते हैं। शायद वे सूप को एक बार के बजाय पांच बार चखते हैं, या वे एक बेहतरीन रेसिपी परोसने से पहले तीन अलग-अलग रेसिपी लिख लेते हैं। समस्या यह है कि सबसे अच्छे शेफ की भी एक सीमा होती है। यदि व्यंजन बहुत जटिल है, तो कितना भी अतिरिक्त सोचने से काम नहीं चलेगा, और वे थक सकते हैं (समय और ऊर्जा बर्बाद कर सकते हैं)।
समस्या:
लंबे समय तक, इन दोनों रणनीतियों को अलग-अलग चलाया गया था। पेपर का तर्क है कि यह ऐसा है जैसे एक मैनेजर तय करता है कि कौन सा शेफ इस्तेमाल करना है, और एक दूसरा मैनेजर तय करता है कि उस शेफ को कितनी मेहनत करनी चाहिए, बिना उन दोनों के आपस में बात किए। इससे अक्षमता आती है: आप एक साधारण ऑर्डर को हेड शेफ के पास भेज सकते हैं जो उस पर ज़रूरत से ज़्यादा सोचता है, या एक कठिन ऑर्डर को जूनियर शेफ के पास भेज सकते हैं जो बहुत जल्दी हार मान लेता है।
समाधान: UNISCALE
लेखक UNISCALE (यूनिफाइड इन्फरेंस स्केलिंग) नामक एक नई प्रणाली पेश करते हैं। इसे एक सुपर-इंटेलिजेंट हेड शेफ के रूप में सोचें जो वास्तविक समय में पूरे किचन का प्रबंधन करता है।
केवल एक शेफ या एक प्रयास स्तर चुनने के बजाय, यह हेड शेफ हर एक ऑर्डर को देखता है और तुरंत दोनों निर्णयों को मिलाने वाला एक कस्टम प्लान बनाता है।
- "यह ऑर्डर ट्रिकी है, इसलिए चलिए हमारे 4-स्टार शेफ का उपयोग करते हैं, लेकिन उन्हें अपना काम दो बार चेक करने के लिए कहें।"
- "यह ऑर्डर आसान है, इसलिए चलिए हमारे 1-स्टार शेफ का उपयोग करते हैं, लेकिन बस सुरक्षा के लिए उन्हें एक बार दोबारा चेक करने दें।"
- "यह ऑर्डर एक दुस्वप्न है, इसलिए हमें 5-स्टार शेफ की ज़रूरत है जो पाँच अलग-अलग वर्ज़न लिखे और उनमें से सबसे अच्छा चुने।"
यह कैसे सीखता है (एक "स्मार्ट वेटर"):
किचन अराजक है। ऑर्डर बदलते रहते हैं, नए शेफ आते हैं और कभी-कभी पुराने शेफ चले जाते हैं। हेड शेफ हर नियम को याद नहीं रख सकता। इसके बजाय, UNISCALE एक स्मार्ट वेटर की तरह काम करता है जो करके सीखता है।
- यह LinUCB (जुआ खेलने और निर्णय लेने में उपयोग की जाने वाली एक गणितीय तकनीक) का उपयोग करता है।
- हर बार जब यह कोई व्यंजन परोसता है, तो इसे फीडबैक मिलता है: "क्या यह स्वादिष्ट था?" और "इसकी लागत कितनी थी?"
- यह फीडबैक का उपयोग करके एक मानसिक मानचित्र बनाता है। यह सीखता है कि "गणित के सवालों के लिए, 4 चेक के साथ 8B मॉडल एकदम सही है," लेकिन "कोडिंग के लिए, 2 चेक के साथ 14B मॉडल बेहतर है।"
- महत्वपूर्ण रूप से, यह एक्सप्लोरेशन (यह देखने के लिए नए संयोजनों को आज़माना कि क्या वे काम करते हैं) और एक्सप्लोइटेशन (जो वे पहले से जानते हैं कि काम करता है उसका उपयोग करना) के बीच संतुलन बनाता है।
इसके गुप्त हथियार:
इसे तेज़ और कुशल बनाने के लिए, सिस्टम के पास दो विशेष तरकीबें हैं:
"अर्ली एग्जिट" (पाथ-अवेयर अर्ली एग्जिटिंग): कल्पना कीजिए कि शेफ कई रेसिपी लिख रहे हैं। सिस्टम के पास एक "टेस्ट-टेस्टर" (वेरिफायर) है जो काम होते समय ही काम की जाँच करता है। यदि टेस्ट-टेस्टर देखता है कि एक रेसिपी स्पष्ट रूप से बहुत खराब होने वाली है, तो सिस्टम तुरंत उस शेफ को उस पर काम करना बंद करने के लिए कह देता है। यह बहुत सारा समय और ऊर्जा बचाता है क्योंकि यह खराब रेसिपी के पूरा होने का इंतज़ार नहीं करता।
"यूनिवर्सल स्कोरकार्ड" (कॉस्ट मॉडल): सिस्टम केवल "स्टेप्स" नहीं गिनता है। यह एक एकीकृत तरीके से "प्रयास" को गिनता है। यह समझता है कि भारी बर्तन उठाना (मेमोरी) उतना ही थका देने वाला है जितना कि सब्जियां काटना (कंप्यूटेशन)। यह एक छोटे शेफ द्वारा बहुत अधिक काम करने बनाम एक बड़े शेफ द्वारा थोड़ा काम करने की तुलना एक समान धरातल पर करने की अनुमति देता है।
परिणाम:
पेपर ने गणित के सवालों (जैसे AIME परीक्षा) पर इस सिस्टम का परीक्षण किया।
- बेहतर संतुलन: UNISCALE ने हर सवाल के लिए "स्वीट स्पॉट" खोज निकाला। इसने केवल सबसे बड़ा मॉडल या सबसे अधिक प्रयास नहीं चुना; इसने दोनों का सही मिश्रण खोजा।
- स्मूथ कर्व: "सस्ता लेकिन बुरा" से "महंगा लेकिन अच्छा" के बीच छलांग लगाने के बजाय, UNISCALE ने एक स्मूथ कर्व बनाया जहाँ आपको लागत में थोड़ी वृद्धि के साथ बेहतर उत्तर मिलते हैं, और यह सर्वोत्तम संभव उत्तरों तक जाता है।
- अनुकूलन क्षमता: जब "किचन" बदल गया (उदाहरण के लिए, एक शेफ चला गया या ऑर्डर्स का प्रकार बदल गया), तो UNISCALE ने तेज़ी से नई सर्वश्रेष्ठ रणनीति का पता लगा लिया, जबकि पुराने सिस्टम अटक गए या गलतियाँ करने लगे।
संक्षेप में:
UNISCALE एक ऑर्केस्ट्रा के मास्टर कंडक्टर की तरह है। केवल एक तेज़ वाद्य यंत्र (बड़ा मॉडल) चुनने या संगीतकारों को तेज़ बजाने (अधिक प्रयास) के लिए कहने के बजाय, यह गतिशील रूप से तय करता है कि कौन सा संगीतकार कौन सा हिस्सा बजाएगा और वे उसे कैसे बजाएंगे, और साथ ही वास्तविक समय में संगीत सुनते हुए किसी भी संगीतकार को गलत नोट बजाने से रोकता है। इसके परिणामस्वरूप एक सुंदर प्रदर्शन (उच्च गुणवत्ता) होता है जिसमें सबसे कम ऊर्जा (कम लागत) खर्च होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।