← नवीनतम पेपर
🤖 machine learning

Skip a Layer or Loop It? Learning Program-of-Layers in LLMs

यह शोध पत्र "प्रोग्राम-ऑफ-लेयर्स" (PoLar) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो प्रत्येक इनपुट के लिए अनुकूलित निष्पादन पथ बनाने के लिए पूर्व-प्रशिक्षित परतों को गतिशील रूप से छोड़ देता है या लूप करता है, यह प्रदर्शित करते हुए कि ऐसा लचीला अनुमान मानक निश्चित-गहराई वाले LLM प्रसंस्करण की तुलना में सटीकता और दक्षता में महत्वपूर्ण सुधार करता है।

मूल लेखक: Ziyue Li, Yang Li, Tianyi Zhou

प्रकाशित 2026-06-08
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ziyue Li, Yang Li, Tianyi Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, पूर्व-प्रशिक्षित रोबोट शेफ (लार्ज लैंग्वेज मॉडल, या LLM) है जो जटिल समस्याओं को हल करने के लिए प्रसिद्ध है। इस शेफ के पास एक सख्त रेसिपी बुक है जिसमें चरणों (लेयर्स) की एक निश्चित संख्या है जिसका वे हमेशा पालन करते हैं, चाहे वे कोई भी व्यंजन बना रहे हों।

यदि शेफ से "अंडा उबालने" के लिए कहा जाता है, तो वे अभी भी अपने 100-चरणों वाले मास्टर रेसिपी के हर एक चरण का पालन करते हैं—सब्जियां काटने से लेकर सूप में मसाला डालने तक—भले ही अंडे के लिए केवल पानी के एक बर्तन की आवश्यकता हो। यदि उनसे "चीनी से एक महल बनाने" के लिए कहा जाता है, तो वे अभी भी उन्हीं 100 चरणों का पालन करते हैं, भले ही वे बीच में कहीं फंस जाएं और उन्हें अपने दृष्टिकोण पर फिर से विचार करने की आवश्यकता हो।

समस्या:
यह शोध पत्र तर्क देता है कि यह "एक ही आकार के सभी के लिए" (one-size-fits-all) वाली रेसिपी अक्षम है। कभी-कभी शेफ अनावश्यक चरणों में समय बर्बाद करता है, और कभी-कभी वह इसलिए विफल हो जाता है क्योंकि उसे कठिन समस्या पर विचार करने के लिए पर्याप्त समय नहीं मिला।

खोज (वह "आहा!" क्षण):
शोधकर्ताओं ने पूछा: क्या होगा यदि शेफ अपनी रेसिपी को चलते-फिरते खुद लिख सके?

उन्होंने पाया कि लगभग हर समस्या के लिए, शेफ के कौशल का उपयोग करने का केवल एक "सही" तरीका नहीं है। कई अलग-अलग "प्रोग्राम" (चरणों के अनुक्रम) हो सकते हैं जो काम कर सकते हैं।

  • छोड़ना (Skipping): आसान समस्याओं के लिए (जैसे अंडा उबालना), शेफ पहले 50 चरणों को छोड़ सकता है और सीधे अंतिम 10 चरणों को कर सकता है।
  • लूपिंग (Looping): कठिन समस्याओं के लिए (जैसे चीनी का महल बनाना), शेफ एक विशिष्ट चरण पर अटक सकता है, परिणाम को बेहतर बनाने के लिए उसे कुछ बार दोहरा सकता है, और फिर आगे बढ़ सकता है।

शोधकर्ताओं ने इन छिपी हुई, बेहतर रेसिपी खोजने के लिए एक "सर्च इंजन" (जिसे मोंटे-कार्लो ट्री सर्च कहा जाता है) का उपयोग किया। उन्होंने पाया कि:

  1. छोटा होना अक्सर बेहतर होता है: कई समस्याओं को मानक रेसिपी की तुलना में कम चरणों के साथ सही ढंग से हल किया जा सकता है।
  2. दोहराना मदद करता है: कठिन समस्याओं के लिए, चरणों के एक विशिष्ट हिस्से को दोहराना (लूपिंग) अक्सर उन गलतियों को ठीक कर देता है जो मानक रेसिपी करती है।
  3. मिश्रण ही कुंजी है: सबसे अच्छी रेसिपी में कुछ हिस्सों को छोड़ने और कुछ को दोहराने का मिश्रण शामिल होता है।

समाधान: POLAR
इन सटीक रेसिपी को खोजने के साथ समस्या यह है कि उन्हें खोजने में बहुत समय लगता है। आप हर सवाल के लिए शेफ को "1,000 अलग-अलग रेसिपी आज़माने" के लिए नहीं कह सकते; इसमें बहुत समय लगेगा।

इसलिए, टीम ने एक छोटा, हल्का "रेसिपी प्रेडिक्टर" (POLAR) बनाया।

  • यह कैसे काम करता है: मुख्य शेफ शुरू करने से पहले, यह प्रेडिक्टर प्रश्न को देखता है और तुरंत सबसे अच्छी कस्टम रेसिपी का अनुमान लगा लेता है। यह कहता है, "चरण 1-10 को छोड़ दें, चरण 11-20 को सामान्य रूप से करें, चरण 21-25 को दो बार दोहराएं, फिर बाकी को छोड़ दें।"
  • जादू: मुख्य शेफ (बड़ा LLM) बिल्कुल नहीं बदलता है। वह अभी भी फ्रीज़्ड और प्री-ट्रेन्ड है। प्रेडिक्टर बस उसे उस विशिष्ट क्षण के लिए अपने मौजूदा कौशल का उपयोग करने का तरीका बताता है।

परिणाम:
जब उन्होंने गणित की समस्याओं पर इसका परीक्षण किया:

  • सटीकता बढ़ गई: शेफ ने अधिक समस्याओं को सही ढंग से हल किया, यहाँ तक कि उन गलतियों को भी ठीक किया जो मानक रेसिपी ने की थीं।
  • गति बढ़ गई: आसान समस्याओं पर, शेफ अनावश्यक चरणों को छोड़कर तेजी से काम पूरा कर सका।
  • यह नई चीजों पर भी काम करता है: जब उन्होंने शेफ का परीक्षण उन गणित की समस्याओं पर किया जिन्हें उसने पहले कभी नहीं देखा था, तब भी प्रेडिक्टर को अच्छी रेसिपी प्राप्त करने के लिए रेसिपी को समायोजित करना पता था।

सारांश में:
एक बुद्धिमान मॉडल को हर कार्य के लिए एक कठोर, निश्चित पथ का पालन करने के लिए मजबूर करने के बजाय, यह शोध पत्र हमें सिखाता है कि मॉडल को एक "रिमोट कंट्रोल" कैसे दिया जाए। यह रिमोट कंट्रोल हमें उबाऊ हिस्सों को छोड़ने या कठिन हिस्सों पर "रिपीट" बटन दबाने की अनुमति देता है, जिससे मॉडल को बिना उसे फिर से प्रशिक्षित किए या उसके मस्तिष्क को बदले, अधिक स्मार्ट, तेज़ और कुशल बनाया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →