← नवीनतम पेपर
🤖 machine learning

Compositional Generalization in Autoregressive Models via Logit Composition

यह शोधपत्र डिफ्यूजन विधियों से प्रेरित, ऑटोरेग्रेसिव मॉडलों के लिए एक सिद्धांत-आधारित लॉजिट कंपोजिशन रणनीति प्रस्तुत करता है, जो आउटपुट सबस्पेस पर प्रक्षेपिक नियंत्रण सुनिश्चित करता है और फैक्टराइज्ड-कंडीशनल्स धारणाओं के तहत लंबाई सामान्यीकरण को संरक्षित करता है।

मूल लेखक: Aakash Kumar, Maria Sofia Bucarelli, Emanuele Natale

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aakash Kumar, Maria Sofia Bucarelli, Emanuele Natale

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक रसोई में काम करने वाली तीन बहुत ही विशिष्ट शेफ की एक टीम है।

  • शेफ बेस (पृष्ठभूमि/Background): यह शेफ रेसिपी को ठीक वैसे ही फॉलो करने में माहिर है जैसा कि लिखा गया है। यदि आप उनसे एक सादा सैंडविच मांगते हैं, तो वे एक परफेक्ट सादा सैंडविच बनाएंगे। वे इसमें कुछ भी अतिरिक्त नहीं जोड़ते।
  • शेफ मैथ (गणित): यह शेफ चीज़ (cheese) और मसाले जोड़ने में जादूगर है, लेकिन केवल तभी जब रेसिपी में इसकी मांग की गई हो। यदि रेसिपी कहती है "चीज़ डालें," तो वे इसे पूरी तरह से करते हैं। यदि नहीं कहा गया है, तो वे सैंडविच को अकेला छोड़ देते हैं।
  • शेफ कोड (कोडिंग): यह शेफ लेट्यूस (lettuce) और टमाटर जोड़ने में विशेषज्ञ है, लेकिन केवल तभी जब रेसिपी इसके लिए कहती है।

समस्या:
आमतौर पर, यदि आपको चीज़ और लेट्यूस दोनों वाला सैंडविच चाहिए, तो आपको एक विशाल शेफ को काम पर रखना पड़ता है जो एक साथ सब कुछ करना जानता हो। या, आप इन तीनों शेफ को उनके एप्रन (weights) को मिलाकर या बारी-बारी से काम करने (routing) के लिए कहकर मिलाने की कोशिश करते हैं। लेकिन अक्सर, इससे अराजकता फैलती है: शेफ मैथ चीज़ डालने की कोशिश कर सकते हैं जब शेफ कोड लेट्यूस डालने की कोशिश कर रहा हो, या वे सैंडविच को खत्म करने के तरीके पर बहस कर सकते हैं, जिसके परिणामस्वरूप भोजन का एक गंदा, खाने लायक न रहने वाला ढेर बन जाता है।

पेपर का समाधान: "लॉगिट कंपोजिशन" (Logit Composition)
इस पेपर के लेखक इन शेफों को मिलाने का एक नया तरीका प्रस्तावित करते हैं। उनके एप्रन को मिलाने या उन्हें बारी-बारी से काम करने के बजाय, वे सभी तीन शेफों को एक साथ अगले घटक (ingredient) के लिए अपने सुझाव चिल्लाने की अनुमति देते हैं, लेकिन एक विशेष नियम के साथ:

  1. नियम: वे शेफ मैथ के सुझाव को लेते हैं, उसमें शेफ कोड का सुझाव जोड़ते हैं, और फिर शेफ बेस के सुझाव को घटाते हैं।
  2. जादू: क्योंकि शेफ बेस सिर्फ "साधारण" संस्करण है, इसलिए उनका स्वर घटाने से शोर खत्म हो जाता है।
    • जब रेसिपी में चीज़ की आवश्यकता होती है, तो शेफ मैथ ऊंचे स्वर में होते हैं, शेफ कोड शांत होता है (क्योंकि वह चीज़ के बारेв नहीं जानता), और शेफ बेस तटस्थ (neutral) होता है। गणित इस तरह काम करता है कि अंतिम निर्णय "चीज़ डालें" होता है।
    • जब रेसिपी में लेट्यूस की आवश्यकता होती है, तो शेफ कोड ऊंचे स्वर में होता है, शेफ मैथ शांत होता है, और शेफ बेस तटस्थ होता। गणित का परिणाम "लेट्यूस डालें" होता है।
    • जब कुछ भी विशेष नहीं चाहिए होता, तो सभी शांत रहते हैं, और सैंडविच सादा रहता है।

यह क्यों काम करता है ( "डिस्जॉइंट" का रहस्य)
पेपर का तर्क है कि यह केवल तभी पूरी तरह से काम करता है जब शेफ के काम डिस्जॉइंट (disjoint - अलग-अलग) हों।

  • शेफ मैथ केवल "चीज़ वाले स्टेप्स" को छूते हैं।
  • शेफ कोड केवल "लेट्यूस वाले स्टेप्स" को छूते हैं।
  • वे कभी भी एक ही समय में दूसरे का काम करने की कोशिश नहीं करते।

यदि शेफ मैथ लेट्यूस डालते समय चीज़ डालने की कोशिश करते हैं, तो वे आपस में टकरा सकते हैं। लेकिन यदि वे जानते हैं कि कब कार्य करना है (जैसे, "मैं केवल स्टेप 3 पर कार्य करता हूँ, तुम स्टेप 5 पर"), तो वे बिना लड़े सहजता से एक साथ काम कर सकते हैं। पेपर इसे "फैक्टराइज्ड कंडीशनल्स" (Factorized Conditionals) कहता है।

"प्रोजेक्टिव" गारंटी (The "Projective" Guarantee)
पेपर यह सिद्ध करता है कि यदि शेफ अपने विशिष्ट क्षेत्रों पर टिके रहते हैं, तो अंतिम सैंडविच (आउटपुट) बिल्कुल वैसा ही होगा जैसा कि आपको तब मिलता यदि आपने एक सुपर-शेफ को काम पर रखा होता जो दोनों कौशल पूरी तरह से जानता हो।

  • सैंडविच का "चीज़" वाला हिस्सा 100% शेफ मैथ से आता है।
  • सैंडविच का "लेट्यूस" वाला हिस्सा 100% शेफ कोड से आता है।
  • "ब्रेड" वाला हिस्सा 100% शेफ बेस से आता है।

वे एक-दूसरे में हस्तक्षेप नहीं करते हैं। यह एक प्रोजेक्शन की तरह है: यदि आप केवल चीज़ वाले हिस्से को देखते हैं, तो यह बिल्कुल वैसा ही दिखता है जैसे शेफ मैथ ने इसे बनाया हो। यदि आप लेट्यूस को देखते हैं, तो यह शेफ कोड जैसा दिखता है।

क्या यह लंबी रेसिपी के लिए काम करता है? (लंबाई सामान्यीकरण - Length Generalization)
पेपर ने यह भी जांचा कि क्या यह बहुत लंबी रेसिपी (जैसे 100 पन्नों की कुकबुक) के लिए काम करता है जिसे शेफों ने पहले नहीं देखा है। उन्होंने पाया कि जब तक शेफ अपने विशिष्ट "क्षेत्रों" (जैसे, "मैं स्टेप 10-20 संभालता हूँ") को जानते हैं और रेसिपी उसी पैटर्न का पालन करती है, तब तक संयुक्त टीम लंबी रेसिपी को उतनी ही अच्छी तरह से संभाल सकती है जितनी कि छोटी रेसिपी को। वे केवल इसलिए भ्रमित नहीं होते क्योंकि किताब मोटी है।

वास्तविक दुनिया का परीक्षण
लेखकों ने वास्तविक AI मॉडल के साथ इसका परीक्षण किया:

  • उन्होंने एक बेस मॉडल (Gemma 2) लिया।
  • उन्होंने मैथ (Math) के लिए फाइन-ट्यून किया गया एक वर्ज़न लिया।
  • उन्होंने कोडिंग (Coding) के लिए फाइन-ट्यून किया गया एक वर्ज़न लिया।
  • उन्होंने उनके "चिल्लाने वाले" नियम का उपयोग करके उन्हें मिला दिया।

परिणाम:
नया संयुक्त मॉडल अकेले कोडिंग विशेषज्ञ से बेहतर कोडिंग कर सका, और इसने मैथ विशेषज्ञ के लगभग सभी कौशल बनाए रखे। इसने अपनी मैथ क्षमता को नहीं खोया क्योंकि इसने कोडिंग सीखी। यह बिना पूरे टीम को फिर से प्रशिक्षित किए, "दोनों दुनियाओं का सर्वश्रेष्ठ" (best of both worlds) वाला मामला था।

एक कमी (The Catch)
पेपर स्वीकार करता है कि यह तब सबसे अच्छा काम करता है जब कार्य स्पष्ट रूप से अलग हों। यदि आप बहुत अधिक विशेषज्ञों (जैसे, एक "कविता" शेफ और एक "इतिहास" शेफ को मिलाने) को मिलाने की कोशिश करते हैं, तो टीम इस बात को लेकर भ्रमित हो सकती है कि कब बोलना बंद करना है, जिससे अर्थहीन शब्द (gibberish) बन सकते हैं। लेकिन स्पष्ट, अलग कौशल के लिए, यह "लॉगिट कंपोजिशन" मॉड्यूलर AI सिस्टम बनाने का एक शक्तिशाली, सिद्धांत आधारित तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →