LLM REgression with a Latent Iterative State Head
RELISH एक हल्का, पैरामीटर-कुशल आर्किटेक्चर है जो फ्रोजन (frozen) LLM रिप्रजेंटेशन्स से सीधे स्केलर मानों की भविष्यवाणी करने के लिए एक पुनरावृत्ति लेटेंट स्टेट रिफाइनमेंट प्रक्रिया के माध्यम से टेक्स्ट रिग्रेशन के लिए मौजूदा तरीकों से बेहतर प्रदर्शन करता है, जिसमें केवल अतिरिक्त ट्रेन करने योग्य पैरामीटर्स का एक नगण्य अंश आवश्यक होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार, विश्व स्तरीय लाइब्रेरियन (एक लार्ज लैंग्वेज मॉडल, या LLM) है जिसने अस्तित्व की हर किताब पढ़ रखी है। यह लाइब्रेरियन कहानियों को समझने, कविताएँ लिखने और पूर्ण वाक्यों में उत्तर देने में अद्भुत है।
लेकिन अब, आपको उनके लिए एक अलग काम है: आपको उन्हें एक एकल संख्या (single number) देनी है।
शायद आप जानना चाहते हैं:
- ये दो वाक्य कितने समान हैं? (स्कोर: 0 से 5)
- यह मशीन अनुवाद कितना अच्छा है? (स्कोर: 0 से 100)
- इस फिल्म के हिट होने की कितनी संभावना है? (स्कोर: 0 से 10)
समस्या: "शब्दों वाली" लाइब्रेरियन
समस्या यह है कि हमारा लाइब्रेरियन शब्दों में बोलने के लिए प्रशिक्षित है, न कि संख्याओं के लिए। यदि आप उनसे पूछेंगे, "इन वाक्यों में कितनी समानता है?", तो वे शायद एक संख्या को लिखने की कोशिश करेंगे जैसे कि "4.5"।
यह वैसा ही है जैसे किसी शेफ से नमक को लिखने के लिए कहने के बजाय कि वह कागज पर "नमक" शब्द लिख दे, बल्कि उसे सही मात्रा में चुटकी भर नमक लेने के लिए कहना। यह अक्षम है और इसमें गलतियों की संभावना अधिक होती है।
- "शब्दों वाला" दृष्टिकोण (ऑटोरेग्रेसिव डिकोडिंग): लाइब्रेरियन "4.5" लिखता है। लेकिन क्या होगा अगर उन्होंने "4.49" या "4.500" लिखा हो? कंप्यूटर के लिए, ये पूरी तरह से अलग शब्द हैं, भले ही उनका अर्थ लगभग समान हो। लाइब्रेरियन फॉर्मेटिंग को लेकर भ्रमित हो जाता है।
- "मतदान" दृष्टिकोण (रिग्रेशन-अवेयर इन्फरेंस): आप लाइब्रेरियन को 16 अलग-अलग अनुमान ("4.5", "4.6", "4.4"...) लिखने के लिए कहते हैं, और फिर आप उनका औसत लेते हैं। यह सटीक तो है, लेकिन यह धीमा और थकाऊ है।
- "सरल सारांश" दृष्टिकोण (प्रेडिक्टिव हेड्स): आप लाइब्रेरियन से कहते हैं, "कुछ भी मत लिखो। बस किताब को देखो और उस छिपे हुए स्विच की ओर इशारा करो जो संख्या को नियंत्रित करता है।" पिछले तरीकों ने एक बहुत ही सरल स्विच (जैसे एक सिंगल लाइटबल्ब) का उपयोग किया था जो पूरी किताब का सारांश एक चमक (glow) में करने की कोशिश करता था। यह अक्सर सूक्ष्म विवरणों को चूक जाता था।
समाधान: RELISH (द "इटरेटिव रिफाइनर")
लेखकों ने एक नया टूल बनाया है जिसे RELISH कहा जाता है। RELISH को एक विशेषज्ञ, उच्च-तकनीकी आवर्धक लेंस (magnifying glass) के रूप में समझें जो लाइब्रेरियन के मस्तिष्क के ऊपर स्थित है।
यह इस प्रकार कार्य करता है, एक सरल उपमा का उपयोग करते हुए:
1. "मौन पर्यवेक्षक" (फ्रोजन बैकबोन)
लाइब्रेरियन (LLM) बिल्कुल वैसा ही रहता है। हम उन्हें फिर से प्रशिक्षित नहीं करते या उनके व्यक्तित्व को नहीं बदलते। वे "फ्रोजन" (स्थिर) हैं क्योंकि वे पहले से ही भाषा के बारे में सब कुछ जानते हैं।
2. "पुनरावृत्ति जासूस" (लेटेंट इटरेटिव स्टेट)
लाइब्रेरियन को संख्या लिखने के लिए कहने के बजाय, RELISH लाइब्रेरियन के मन में एक मौन जासूस (एक "लेटेंट स्टेट") भेजता है।
- राउंड 1: जासूस वाक्य के पहले कुछ शब्दों को देखता है और एक मोटा अनुमान बनाता है।
- राउंड 2: जासूस वापस जाता है, पूरे वाक्य को फिर से देखता है, और पूछता है, "रुको, क्या मैंने बीच में कुछ छोड़ दिया? मुझे अपने अनुमान को समायोजित करने दें।"
- राउंड 3: जासूस एक और बार गुजरता है, और अपने अनुमान को अंतिम बार परिष्कृत (refine) करता है।
यही "इटरेटिव" (पुनरावृत्ति) वाला हिस्सा है। पिछले तरीकों के विपरीत जो केवल एक त्वरित, एक नज़र वाले सारांश (जैसे पेंटिंग को घूरना) को लेते थे, RELISH तीन सावधानीपूर्वक, केंद्रित दृश्यों को लेता है, हर पास के साथ अपनी समझ को परिष्कृत करता है।
3. "अनुवादक" (लीनियर रिग्रेसर)
एक बार जब जासूस के पास एक पूर्ण, परिष्कृत आंतरिक समझ हो जाती है, तो वह उस समझ को एक साधारण कैलकुलेटर (एक लीनियर रिग्रेसर) को सौंप देता है जो तुरंत उस "एहसास" को एक सटीक संख्या (जैसे 4.7) में बदल देता है।
RELISH एक गेम चेंजर क्यों है?
1. यह गति का सौदागर है (दक्षता)
- प्रतिद्वंद्वी: "मतदान" विधि ऐसी है जैसे एक संख्या प्राप्त करने के लिए लाइब्रेरियन को 16 निबंध लिखने के लिए कहना। यह धीमा है और बहुत ऊर्जा खर्च करता है।
- RELISH: यह एक एकल, केंद्रित बातचीत की तरह है। यह एक ही पास में होता है। यह अविश्वसनीय रूप से तेज़ है।
2. यह एक हल्का चैंपियन है (पैरामीटर दक्षता)
- प्रतिद्वंद्वी: "मतदान" विधि को बेहतर बनाने के लिए, आपको अक्सर लाइब्रेरियन को नए करतब सिखाने पड़ते हैं, जिसके लिए उनके मस्तिष्क में बहुत अधिक नई मेमोरी (पैरामीटर्स) जोड़ने की आवश्यकता होती है। यदि लाइब्रेरियन विशाल (32 बिलियन पैरामीटर्स) है, तो आपको गणित करने के लिए उनके मस्तिष्क का 0.4% हिस्सा जोड़ने की आवश्यकता हो सकती है।
- RELISH: यह केवल एक बहुत ही छोटा "एड-ऑन" जोड़ता है (मस्तिष्क के आकार का लगभग 0.01% से 0.04%)। यह एक विशाल रोबोट को एक विशेष जोड़ी चश्मे लगाने जैसा है। यह इतना छोटा है कि इसका वजन लगभग कुछ भी नहीं है, फिर भी यह रोबोट को संख्याएं पूरी तरह से देखने में सक्षम बनाता है।
3. यह दिखने में जितना है उससे कहीं अधिक स्मार्ट है (प्रदर्शन)
पेपर के परीक्षणों में, RELISH ने हर अन्य विधि को पछाड़ दिया।
- यह वाक्यों की "समानता" का अनुमान लगाने में बेहतर था।
- यह अनुवाद की गुणवत्ता को आंकने में बेहतर था।
- इसने विभिन्न आकारों के लाइब्रेरियन (छोटे 8B मॉडल से लेकर विशाल 32B मॉडल तक) में यह प्रदर्शन किया।
निचोड़ (The Bottom Line)
कल्पना कीजिए कि आपको सूप का तापमान मापने की आवश्यकता है।
- पुराना तरीका 1: शेफ से तापमान को शब्दों में वर्णित करने के लिए कहें ("गर्म," "बहुत गर्म," "उबलता हुआ") और अनुमान लगाएं। (अचूक नहीं)।
- पुराना तरीका 2: शेफ को 16 बार स्वाद लेने और परिणामों का औसत निकालने के लिए कहें। (धीमा)।
- पुराना तरीका 3: सूप में एक साधारण थर्मामीटर लगा दें जो केवल "गर्म" या "ठंडा" पढ़ता है। (बहुत साधारण)।
- RELISH: आप एक हाई-टेक प्रोब का उपयोग करते हैं जो अंदर जाता है, गर्मी की जांच करता है, अपने सेंसर को समायोजित करता है, फिर से जांच करता है, और एक सेकंड में आपको सटीक तापमान देता है।
RELISH वही हाई-टेक प्रोब है। यह हमें दुनिया के सबसे स्मार्ट AI मॉडल का उपयोग सटीक संख्या-गणना कार्यों के लिए करने देता है, बिना उन्हें धीमा किए या उनके मस्तिष्क को फिर से बनाए बिना। यह तेज़, सस्ता और आश्चर्यजनक रूप से सटीक है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।