← नवीनतम पेपर
💬 NLP

Focus on the Core: Empowering Diffusion Large Language Models by Self-Contrast

यह शोध पत्र FoCore को पेश करता है, जो डिफ्यूजन लार्ज लैंग्वेज मॉडल्स के लिए एक प्रशिक्षण-मुक्त डिकोडिंग रणनीति है, जो उच्च-सूचना-घनत्व वाले टोकन के शीघ्र अभिसरण (early convergence) का स्व-तुलना (self-contrast) के माध्यम से लाभ उठाती है ताकि जनरेशन की गुणवत्ता में सुधार और इन्फरेंस गति में तेजी लाने को एक साथ प्राप्त किया जा सके।

मूल लेखक: Jinyuan Feng, Xin Yu, Yiqun Chen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Zhiqiang Pu

प्रकाशित 2026-05-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinyuan Feng, Xin Yu, Yiqun Chen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Zhiqiang Pu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि कोई गणित की समस्या या कोड लिखना। आपके पास एक बहुत ही स्मार्ट सहायक है (एक डिफ्यूजन लार्ज लैंग्वेज मॉडल) जो एक समय में पूरी तस्वीर देख सकता है, बजाय इसके कि वह एक पारंपरिक रोबोट की तरह एक-एक ईंट करके उसे बनाए। यह एक सुपरपावर है: यह "बड़ी तस्वीर" (big picture) देख सकता है और समझ सकता है कि सभी हिस्से एक साथ कैसे फिट होते हैं।

हालाँकि, इसमें एक पेच है। जब यह सहायक खाली जगहों को भरने की कोशिश करता है, तो यह अपने आस-पास के परिवेश से विचलित हो जाता है। यह उन शब्दों पर बहुत अधिक ध्यान केंद्रित करता है जो खाली स्थान के ठीक बगल में हैं और वाक्य के अन्य हिस्सों में छिपे महत्वपूर्ण सुरागों (critical clues) को अनदेखा कर देता है। यह एक रहस्य सुलझाने की कोशिश करने जैसा है जहाँ आप केवल पीड़ित के ठीक बगल में मौजूद पदचिह्नों को देखते हैं, जबकि उस महत्वपूर्ण नोट को अनदेखा कर देते हैं जो दूसरे कमरे में मिला था और जो बताता है कि अपराध क्यों हुआ।

इस शोध पत्र के लेखकों ने, FoCore (Focus on the Core), पाया कि एक वाक्य के सभी शब्द समान नहीं होते हैं।

"हाई-डेंसिटी" बनाम "लो-डेंसिटी" टोकन

एक वाक्य को एक परिदृश्य (landscape) के रूप में सोचें।

  • लो-डेंसिटी (LD) टोकन: ये "परिदृश्य" हैं। जैसे "the," "is," "and," या "in" जैसे शब्द। ये व्याकरण के लिए महत्वपूर्ण हैं, लेकिन यदि आप इन्हें हटा देते हैं, तो तर्क का मूल अर्थ आमतौर पर वैसा ही रहता है। वे एक जंगल में घास और पेड़ों की तरह हैं; वे स्थान भरते हैं लेकिन वे मंजिल नहीं हैं।
  • हाई-डेंसिटी (HD) टोकन: ये "लैंडमार्क्स" (यानी मील के पत्थर) हैं। ये संख्याएँ, विशिष्ट नाम, मुख्य क्रियाएँ, या महत्वपूर्ण तर्क वाले शब्द हैं (जैसे समय की समस्या में "in 4 years")। यदि आप इन्हें मिस कर देते हैं, तो पूरा उत्तर गलत हो जाएगा। वे पर्वत शिखर या लाइटहाउस की तरह हैं; वे पूरी यात्रा का मार्गदर्शन करते हैं।

शोध पत्र में पाया गया कि वर्तमान AI मॉडल अक्सर इन लैंडमार्क्स को अनदेखा कर देते हैं क्योंकि वे अपने बगल की घास को देखने में बहुत व्यस्त होते हैं।

समस्या: विवरणों में खो जाना

जब AI उत्तर उत्पन्न करने की कोशिश करता है, तो वह आमतौर पर अपने आस-पास के आधार पर अगले "सुरक्षित" शब्द को चुनता है। शोध पत्र दिखाता है कि इसके कारण AI HD टोकन को मिस कर देता है।

  • उदाहरण: वाक्य "Sarah will be 20 in 4 years" में, शब्द "in" एक HD टोकन है। यह बताता है कि गणित भविष्य (future) के बारे में है। यदि AI "20" और "4" को देखकर इसे अनदेखा कर देता है, तो वह सोच सकता है कि आपको उन्हें जोड़ना है (20 + 4 = 24) बजाय इसके कि उसकी वर्तमान आयु खोजने के लिए घटाया जाए। AI एक स्थानीय जाल (local trap) में फंस जाता है और वैश्विक सत्य को मिस कर देता है।

समाधान: FoCore (Focus on the Core)

लेखकों ने AI के सोचने का एक नया तरीका बनाया, जिसे FoCore कहा जाता है। इसके लिए AI को फिर से प्रशिक्षित (retraining) करने की आवश्यकता नहीं है; यह बस इस बात को बदल देता है कि AI काम करते समय कैसे "सोचता" है।

यहाँ उपमा (analogy) है: "सेल्फ-कॉन्ट्रास्ट" (Self-Contrast) गेम।

कल्पना कीजिए कि AI एक पहेली सुलझाने की कोशिश कर रहा है।

  1. सामान्य तरीका: AI जो कुछ भी देखता है उसके आधार पर अगले शब्द का अनुमान लगाता है।
  2. FoCore का तरीका: AI "क्या होगा अगर?" (What if?) का खेल खेलता है।
    • यह उन सबसे महत्वपूर्ण शब्दों (HD टोकन) की पहचान करता है जिन्हें उसने पहले ही समझ लिया है।
    • यह उन महत्वपूर्ण शब्दों को अस्थायी रूप से छिपा (mask) देता है, यह नाटक करते हुए कि वह उन्हें नहीं जानता।
    • यह पूछता है: "यदि मुझे यह मुख्य सुराग नहीं पता होता, तो मैं क्या अनुमान लगाता?" (यह "नेगेटिव" अनुमान है)।
    • फिर, यह अपने मूल अनुमान की तुलना उस गलत अनुमान से करता है।
    • परिणाम: उस सुराग को जानने और न जानने के बीच के अंतर को देखकर, AI को एहसास होता है, "ओह! वह सुराग बहुत महत्वपूर्ण है। मुझे सुनिश्चित करना होगा कि मैं उसी पथ पर टिका रहूँ।"

यह प्रक्रिया AI को शोर (noise) में भटकने के बजाय महत्वपूर्ण तर्क (HD टोकन) पर अपना ध्यान केंद्रित करने के लिए मजबूर करती है।

बोनस: FoCore_A (द स्पीडस्टर)

शोध पत्र में उन्होंने एक दिलचस्प बात भी देखी: एक बार जब AI "HD टोकन" (लैंडमार्क्स) को समझ लेता है, तो वह वास्तव में उन्हें बहुत जल्दी और आत्मविश्वास के साथ जान लेता है। आसपास के "LD टोकन" (परिदृश्य) को तय करने में अधिक समय लगता है।

FoCore_A इस जानकारी का उपयोग गति बढ़ाने के लिए करता है।

  • उपमा: कल्पना कीजिए कि आप एक जंगल में चल रहे हैं। आप जल्दी से एक पर्वत शिखर (HD टोकन) देख लेते हैं। एक बार जब आप शिखर देख लेते हैं, तो आपको पता होता है कि किस दिशा में जाना है। आपको रास्ते में हर एक पेड़ (LD टोकन) को चेक करने के लिए रुकने की जरूरत नहीं है।
  • यह कैसे काम करता है: जैसे ही AI पता लगाता है कि "लैंडमार्क्स" स्थिर (stable) हैं, वह उन्हें एक-एक करके चेक करना बंद कर देता है। इसके बजाय, वह बाकी के "परिदृश्य" वाले शब्दों को समानांतर (parallel - एक साथ) में भर देता है।
  • लाभ: यह AI को काफी तेज बनाता है। शोध पत्र का दावा है कि यह बिना कोई गलती किए उत्तर उत्पन्न करने में लगने वाले समय को आधे से अधिक (लगभग 20 सेकंड से घटकर ~8 सेकंड) कम कर सकता है।

उन्होंने क्या सिद्ध किया?

लेखकों ने इसका परीक्षण किया:

  • गणित की समस्याएं: ऐसी वर्ड प्रॉब्लम्स को हल करना जहाँ तर्क (logic) मायने रखता है।
  • कोडिंग: कंप्यूटर कोड लिखना जहाँ सिंटैक्स और लॉजिक का एकदम सही होना आवश्यक है।
  • तर्क (Reasoning): तर्क संबंधी पहेलियों को हल करना।

परिणाम:

  • बेहतर गुणवत्ता: AI ने कम गलतियाँ कीं और कठिन समस्याओं को सही ढंग से हल किया। उदाहरण के लिए, एक कोडिंग टेस्ट (HumanEval) पर, सफलता दर लगभग 39% से बढ़कर 42% हो गई।
  • तेज गति: त्वरित संस्करण (FoCore_A) बहुत तेज़ था, जिसने उत्तर उत्पन्न करने के समय को लगभग 58% तक कम कर दिया।

सारांश

शोध पत्र का तर्क है कि डिफ्यूजन AI मॉडल के पास एक सुपरपावर है (पूरी तस्वीर देखना), लेकिन वे वर्तमान में एक ऐसी रणनीति का उपयोग कर रहे हैं जो उन्हें उस तस्वीर के सबसे महत्वपूर्ण हिस्सों के प्रति अंधा बना देती है। FoCore इसे इस तरह से ठीक करता है कि यह AI को लगातार यह जांचने के लिए सिखाता है: "क्या मैं महत्वपूर्ण सुरागों पर ध्यान केंद्रित कर रहा हूँ?"—और यह काम उन सुरागों के साथ और उनके बिना अपने अनुमानों की तुलना करके किया जाता है। इससे AI अधिक स्मार्ट, अधिक सटीक और तेज़ उत्तर देने में सक्षम होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →