← नवीनतम पेपर
🤖 machine learning

Ouroboros: Dynamic Weight Generation for Recursive Transformers via Input-Conditioned LoRA Modulation

ऊरोबोरोस (Ouroboros) रिकर्सिव ट्रांसफॉर्मर्स के लिए एक गतिशील वेट जनरेशन सिस्टम पेश करता है जो प्रत्येक रिकरेंस स्टेप पर फ्रोजन लोरा (LoRA) बेस को मॉड्युलेट करने के लिए एक इनपुट-कंडीशन्ड कंट्रोलर हाइपरनेटवर्क का उपयोग करता है, जो प्रशिक्षण हानि (training loss) को काफी कम करता है और संकुचित आर्किटेक्चर में प्रदर्शन के अंतर को पुनः प्राप्त करता है, जबकि गेटेड रिकरेंस की महत्वपूर्ण भूमिका और होल्ड-आउट डेटा पर सामान्यीकरण की वर्तमान सीमाओं को भी उजागर करता है।

मूल लेखक: Jaber Jaber, Osama Jaber

प्रकाशित 2026-04-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jaber Jaber, Osama Jaber

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, 36-मंजिला गगनचुंबी इमारत (एक बड़ा AI मॉडल) है जो जटिल समस्याओं को हल कर सकती है। लेकिन 36-मंजिला इमारत बनाना और उसका रखरखाव करना बेहद महंगा है। आप इसे घटाकर केवल 17 मंजिला बनाना चाहते हैं ताकि पैसे बचा सकें, लेकिन आपको डर है कि यह ठीक से काम नहीं करेगा क्योंकि इसकी आधी ऊंचाई कम हो गई है।

आमतौर पर, जब आप किसी इमारत को छोटा करते हैं, तो आप बीच की मंजिलें काट देते हैं। समस्या यह है कि बची हुई मंजिलें अब बार-बार बिल्कुल एक ही काम कर रही हैं, जो इसे अक्षम बनाता है।

OUROBOROS एक नया सिस्टम है जो इसे इस तरह हल करता है कि वह 17-मंजिला इमारत को एक "टाइम-लूप" मशीन में बदल देता है। 17 अलग-अलग मंजिलों के बजाय, आपके पास एक विशेष मंजिल है जिसे आप लगातार 17 बार देखते हैं। लेकिन यहाँ असली जादू है: हर बार जब आप उस मंजिल पर जाते हैं, तो वह कमरे को उस विशिष्ट कार्य के अनुसार थोड़ा बदल लेता है जो आप कर रहे हैं।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. "टाइम-लूप" लिफ्ट (रिकर्सिव ट्रांसफॉर्मर्स)

सामान्य रूप से, एक AI एक वाक्य को 36 अलग-अलग "सोचने" वाली परतों (layers) के माध्यम से गुजरकर पढ़ता है।

  • पुराना तरीका: इमारत को आधा काट दें। आप 19 मंजिलों की सोचने की शक्ति खो देते हैं।
  • OUROBOROS का तरीका: शीर्ष 8 मंजिलों (प्रस्तावना/Prelude) और निचली 8 मंजिलों (उपसंहार/Coda) को रखें। बीच में, 19 अलग-अलग मंजिलों के बजाय, आपके पास एक ही मंजिल है जिसे आप 17 बार देखते हैं।
  • समस्या: यदि आप बिना कुछ बदले एक ही कमरे में 17 बार जाते हैं, तो आप बस वही परिणाम 17 बार प्राप्त करेंगे। यह एक किताब के एक ही पन्ने को बार-बार पढ़ने जैसा है; आप कुछ भी नया नहीं सीखेंगे।

2. "गिरगिट जैसा" कमरा (कंट्रोलर)

यही मुख्य नवाचार है। OUROBOROS में, एकल मध्य मंजिल स्थिर नहीं है। इसमें एक छोटा, अत्यंत बुद्धिमान सहायक है जिसे कंट्रोलर (Controller) कहा जाता है।

  • यह कैसे काम करता है: हर बार जब AI इस मंजिल में प्रवेश करता है, तो कंट्रोलर यह देखता है कि AI ने अब तक क्या "सोचा" है (हिडन स्टेट)।
  • जादू: जो कुछ भी वह देखता है, उसके आधार पर, कंट्रोलर तुरंत कमरे का फर्नीचर पुनर्व्यवस्थित कर देता है। यह नई दीवारें नहीं बनाता; यह बस मौजूदा फर्नीचर को इस तरह खिसकाता है कि वह इस विशिष्ट क्षण के लिए एक आदर्श सेटअप बना सके।
  • उपमा: एक रसोई में एक शेफ की कल्पना करें।
    • स्थिर AI (Static AI): शेफ के पास एक निश्चित रेसिपी है। चाहे आप स्टेक ऑर्डर करें या सलाद, वे हर बार प्याज को बिल्कुल एक ही तरह से काटते हैं।
    • OUROBOROS: शेफ आपके ऑर्डर को देखता है। यदि आप स्टेक चाहते हैं, तो वे भारी कुल्हाड़ी उठाते हैं। यदि आप सलाद चाहते हैं, तो वे नाजुक चाकू उठाते हैं। रसोई (वेट्स) वही है, लेकिन औजार और क्रियाएं आपकी जरूरत के आधार पर तुरंत बदल जाती हैं।

3. "मेमोरी एंकर" (SVD-इनिशियलाइज्ड LoRA)

आप पूछ सकते हैं: "यदि कमरा बार-बार बदल रहा है, तो यह उस ज्ञान को कैसे याद रखता है जो इसे इमारत काटने के दौरान खो गया था?"

  • यह सिस्टम उन गायब 19 मंजिलों का एक "स्नैपशॉट" लेता है जिन्हें हटाने से पहले लिया गया था। यह उस स्नैपशॉट को उसके सबसे महत्वपूर्ण दिशाओं में तोड़ देता है (जैसे कि सबसे महत्वपूर्ण सड़कों का एक नक्शा)।
  • ये "सड़कें" अपनी जगह पर जमी हुई (frozen) हैं। कंट्रोलर को यह सीखने की ज़रूरत नहीं है कि सड़कें कहाँ हैं; उसे बस यह सीखना है कि प्रत्येक सड़क पर कितना ट्रैफिक भेजना है।
  • इसका मतलब है कि सिस्टम बहुत तेज़ी से सीखता है क्योंकि यह पहिए का पुनरुद्धार नहीं कर रहा है; यह बस मौजूदा पहिए को मोड़ रहा है।

4. "सेफ्टी ब्रेक" (गेटेड रिकरेंस)

जब आप एक प्रक्रिया को 17 बार लूप करते हैं, तो यह जोखिम होता है कि AI भ्रमित हो सकता है या अपने रास्ते से "भटक" (drift) सकता है (जैसे कि कार गोल-गोल घूम रही हो)।

  • OUROBOROS एक "गेट" का उपयोग करता है जो एक सुरक्षा ब्रेक की तरह काम करता है। जब AI वापस लूप करता है, तो यह अपने पिछले विचारों का लगभग 88% बनाए रखता है और केवल 12% नए बदलावों को ही अंदर आने देता है।
  • यह सुनिश्चित करता है कि गहराई से सोचने की कोशिश करते समय AI यह न भूल जाए कि वह कहाँ से शुरू हुआ था। यह एक गहरा सांस लेने और नया कदम उठाने से पहले अपना संतुलन बनाए रखने जैसा है।

परिणाम: उन्होंने क्या पाया?

  • यह बहुत अच्छा काम करता है (ट्रेनिंग डेटा पर): जिस डेटा पर इसे प्रशिक्षित किया गया था, उस पर परीक्षण करने पर, OUROBOROS ने मॉडल को आधा करने से होने वाले प्रदर्शन के नुकसान का 51% हिस्सा वापस पा लिया। यह केवल एक स्थिर, अपरिवर्तित लूप होने की तुलना में काफी बेहतर था।
  • "वन-पास" सरप्राइज: उन्होंने पाया कि भले ही आप लूप को केवल एक बार (डेप्थ 1) देखते हैं, तो भी सिस्टम उतना ही अच्छा प्रदर्शन करता है जितना कि 16 बार देखने पर। यह बहुत बड़ी बात है क्योंकि इसका मतलब है कि आप AI के लंबे समय तक "सोचने" का इंतज़ार किए बिना उच्च प्रदर्शन प्राप्त कर सकते हैं।
  • चुनौती (जनरलाइजेशन): जबकि यह उस डेटा पर पूरी तरह से काम करता है जिसका इसने अध्ययन किया है, जब इसे ऐसे नए प्रकार के टेक्स्ट पढ़ने के लिए कहा जाता है जो इसने पहले नहीं देखे हैं, तो इसे थोड़ा संघर्ष करना पड़ता है।
    • क्यों? "निचली 8 मंजिलें" (कोडा/Coda) जमी हुई (frozen) हैं। वे सोचने की पुरानी शैली के आदी हैं। जब कंट्रोलर बीच में सोचने की शैली को बदलता है, तो निचली मंजिलें भ्रमित हो जाती हैं।
    • समाधान: लेखक सुझाव देते हैं कि यदि वे निचली मंजिलों को "अनफ्रीज" कर देते हैं ताकि वे नई शैली के अनुकूल हो सकें, तो सिस्टम नए टेक्स्ट पर भी पूरी तरह से काम करेगा।

सारांश

OUROBOROS एक विशाल, महंगी लाइब्रेरी को छोटा करने जैसा है। इमारतों को फेंकने के बजाय, यह एक "जादुई कमरे" को रखता है जहाँ किताबें तुरंत खुद को पुनर्व्यवस्थित कर लेती हैं, जो इस बात पर निर्भर करता है कि आप क्या खोज रहे हैं। यह AI मॉडल्स को छोटा और सस्ता बनाने का एक तरीका है, बिना उनकी गहराई से सोचने की क्षमता खोए, बशर्ते हम मस्तिष्क के अंतिम "आउटपुट" वाले हिस्से को थोड़ा अधिक अनुकूल होने की लचीलापन दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →