← नवीनतम पेपर
🤖 machine learning

Review Residuals: Update-Conditioned Residual Gating for Transformers

यह शोध पत्र 'रिव्यू रेसिडुअल्स' (Review Residuals) को प्रस्तुत करता है, जो एक नवीन गेटिंग तंत्र है जो वर्तमान अवस्था और प्रस्तावित अपडेट दोनों के आधार पर ट्रांसफॉर्मर अपडेट को स्केल करता है, यह प्रदर्शित करते हुए कि यह योगात्मक, पहचान-संरक्षण वाला रूप सभी गहराइयों पर स्थिर प्रशिक्षण सक्षम बनाता है और विशेष रूप से बड़े मॉडल पैमानों पर मानक रेसिडुअल्स और हाईवे गेट्स की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्रदान करता है।

मूल लेखक: Kyle Kramer

प्रकाशित 2026-07-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kyle Kramer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ऊँचा टॉवर बना रहे हैं, एक-एक परत करके। AI मॉडल्स (ट्रांसफॉर्मर्स) के मानक तरीके में, हर नई परत एक कार्यकर्ता की तरह काम करती है जो कहता है, "मेरे पास टॉवर को ठीक करने का एक विचार है," और बॉस तुरंत उस विचार को संरचना में एक गुणांक (coefficient) के एक के साथ जोड़ देता है। बॉस कभी नहीं पूछता, "क्या यह एक अच्छा विचार है?" या "क्या यह सुरक्षित है?" वह बस इसे जोड़ देता है।

"रिव्यू रेसिडुअल्स" (Review Residuals) पेपर सुझाव देता है कि यह "अंधविश्वास" एक समस्या है। यह एक नए नियम का प्रस्ताव करता है जो उच्च-जोखिम वाले मानव उद्योगों (जैसे विमानन या परमाणु ऊर्जा) में उपयोग किए जाने वाले सिद्धांत पर आधारित है: स्वतंत्र सत्यापन (Independent Verification)। किसी भी कार्य को करने से पहले, आपको पहले उसकी जांच करनी चाहिए।

यहाँ उनके नए विचार का विवरण, उन्होंने इसका परीक्षण कैसे किया, और उन्हें क्या मिला, सरल उपमाओं (analogies) का उपयोग करते हुए दिया गया है।

1. नया नियम: "अपना काम जमा करने से पहले उसे जाँचें"

पुराने सिस्टम में, एक परत बदलाव (uu) प्रस्तावित करती है और उसे वर्तमान स्थिति (hh) में सीधे जोड़ देती है।
hnew=hold+uh_{new} = h_{old} + u

नए रिव्यू रेसिडुअल सिस्टम में, परत बदलाव प्रस्तावित तो करती है, लेकिन उसे जोड़ने से पहले, एक "द्वारपाल" (gatekeeper) टॉवर की वर्तमान स्थिति और प्रस्तावित किए जा रहे विशिष्ट बदलाव दोनों को देखता है।

  • द्वारपाल: एक छोटा, स्मार्ट फ़िल्टर जो पूछता है, "अभी हम जहाँ हैं, और आपके इस विशिष्ट विचार को देखते हुए... क्या यह विचार बनाने लायक है?"
  • निर्णय: द्वारपाल 0 और 1 के बीच एक स्कोर देता है। यदि विचार शानदार है, तो यह इसे पूरी तरह से जोड़ देता है। यदि विचार बुरा या जोखिम भरा है, तो यह इसे कम कर देता है या अनदेखा कर देता है।
  • मुख्य अंतर: पिछले तरीकों में केवल "वर्तमान स्थिति" (हम कहाँ हैं) को देखा जाता था। यह नया तरीका प्रस्ताव स्वयं (हम क्या करने की कोशिश कर रहे हैं) को देखता है। यह एक मैनेजर द्वारा यह कहने के बीच का अंतर है कि, "हम मीटिंग में हैं, इसलिए शांत रहें," बनाम एक मैनेजर द्वारा यह कहना कि, "आपने चिल्लाने का सुझाव दिया है, इसलिए हम ऐसा नहीं करेंगे।"

2. "गहराई" की समस्या: क्यों पहला विचार विफल रहा

शोधकर्ताओं ने पहले इसे करने का एक "कॉन्वेक्स" (convex) तरीका आज़माया (एक गणितीय सूत्र जहाँ पुराने राज्य और नए विचार को एक स्मूदी की तरह मिला दिया जाता है)।

  • उपमा: कल्पना कीजिए कि 40 लोगों की एक कतार में एक फुसफुसाहट भेजी जा रही है। यदि हर व्यक्ति आगे भेजने से पहले फुसफुसाहट को थोड़ा सा पतला (dilute) कर देता है, तो अंत तक पहुँचते-पहुँचते संदेश गायब हो जाएगा।
  • परिणाम: यह "स्मूदी" वाला तरीका छोटे टॉवरों (लगभग 20 परतों) के लिए काम करता था, लेकिन गहरे (deep) टॉवरों के लिए पूरी तरह विफल रहा। सिग्नल बहुत कमजोर हो गया, और मॉडल सीख नहीं पाया।
  • समाधान: वे एक "एडिटिव" (additive) तरीके पर स्विच हो गए (मूल पथ को 100% स्पष्ट रखते हुए, बस ऊपर से स्केल्ड विचार को जोड़ना)। यह एक सीधा फोन लाइन खुला रखने जैसा है जबकि साथ ही नए विचार को भी सुन रहे हैं। इसने मॉडल को अत्यधिक गहराई (40+ परतों) पर सफलतापूर्वक प्रशिक्षित होने में सक्षम बनाया।

3. "स्केल" का आश्चर्य: यह तभी काम करता है जब टीम बड़ी हो

शोधकर्ताओं ने इन मॉडल्स को पाँच अलग-अलग आकारों पर स्क्रैच से प्रशिक्षित किया, जो एक बहुत छोटे "खिलौना" मॉडल (60 मिलियन पैरामीटर्स) से लेकर एक बड़े "प्रोफेशनल" मॉडल (1 बिलियन पैरामीटर्स) तक थे।

  • छोटे पैमाने पर (60M – 320M): नया तरीका काम नहीं आया। वास्तव में, छोटे मॉडल्स पुराने, अंधविश्वास वाले तरीके के साथ थोड़े बेहतर काम करते थे। यह एक दो लोगों की टीम को एक जटिल सुरक्षा चेकलिस्ट देने जैसा है; यह बस उन्हें धीमा कर देता है बिना किसी मूल्य को जोड़े।
  • मध्यम पैमाने पर (590M): जादू हुआ। नया तरीका पुराने तरीके को महत्वपूर्ण रूप से हराने लगा। "अपना काम चेक करने" का नियम उपयोगी हो गया।
  • बड़े पैमाने पर (1 बिलियन): लाभ और भी बढ़ गया। मॉडल जितना बड़ा होता गया, नया तरीका उतना ही अधिक मदद करता गया।

बड़ी सीख: अधिकांश नए AI ट्रिक्स छोटे मॉडल्स पर सबसे अच्छा काम करते हैं और जैसे-जैसे मॉडल्स विशाल होते जाते हैं, वे फीके पड़ जाते हैं। यह इसके बिल्कुल विपरीत है। लाभ उभरता है और मॉडल के बड़ा होने के साथ बढ़ता है।

4. यह क्यों मायने रखता है (पेपर के अनुसार)

लेखक तर्क देते हैं कि बुद्धिमत्ता "सीमित" (bounded) है—भले ही सिस्टम स्मार्ट हों, वे अनुमानित गलतियाँ करते हैं क्योंकि उनका ध्यान सीमित होता है (जैसे बास्केटबॉल गेम के दौरान एक गोरिल्ला सूट पहने व्यक्ति को मिस कर देना)।

  • दर्शन: आप केवल यह मांग नहीं कर सकते कि एक सिस्टम पूर्ण हो। इसके बजाय, आपको सिस्टम में विश्वसनीयता (reliability) को इंजीनियर करना होगा।
  • उपमा: एक उच्च-विश्वसनीयता वाले उद्योग में, आप केवल सबसे स्मार्ट पायलट को काम पर नहीं रखते; आप उन्हें एक चेकलिस्ट और एक को-पायलट देते हैं जो हर चाल को सत्यापित करता है। रिव्यू रेसिडुअल्स उसी चेकलिस्ट का AI संस्करण हैं। मॉडल अपने अपडेट को प्रतिबद्ध करने से पहले स्वयं की "समीक्षा" करना सीखता है।

परिणामों का सारांश

  • क्या यह छोटे मॉडल्स पर काम करता है? नहीं, यह वास्तव में थोड़ा बदतर या तटस्थ है।
  • क्या यह बड़े मॉडल्स पर काम करता है? हाँ, मानक तरीके की तुलना में काफी बेहतर।
  • क्या यह एक बहुत बड़ा सुधार है? पेपर स्वीकार करता है कि सुधार पूर्ण संख्या में छोटा है (लॉस रिडक्शन में लगभग 0.016 "नैट्स"), लेकिन ट्रेंड (रुझान) ही मायने रखता है: यह बेहतर होता जाता है जैसे-जैसे मॉडल बड़ा होता है।
  • आगे क्या है? लेखक इसे और भी बड़े मॉडल्स (फ्रंटियर स्केल) और वास्तविक दुनिया के टेक्स्ट डेटा पर टेस्ट करने की योजना बना रहे हैं ताकि यह देखा जा सके कि क्या यह ट्रेंड जारी रहता है।

संक्षेप में: यह पेपर एक तरीका पेश करता है जिससे AI मॉडल्स अपना होमवर्क जमा करने से पहले उसे "दोबारा चेक" कर सकें। हालांकि यह छोटे मॉडल्स की मदद नहीं करता है, लेकिन जैसे-जैसे मॉडल्स बड़े और अधिक जटिल होते जाते हैं, यह और भी महत्वपूर्ण होता जाता है, जो यह सुझाव देता है कि "सत्यापन" (verification) वास्तव में विश्वसनीय, बड़े-स्तर की बुद्धिमत्ता बनाने के लिए एक प्रमुख घटक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →