← नवीनतम पेपर
🤖 machine learning

Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding

यह शोध पत्र 'सेट डिफ्यूजन' (Set Diffusion) को प्रस्तुत करता है, जो भाषा मॉडलों का एक नया वर्ग है जो मौजूदा ऑटोरिग्रेसिव (autoregressive) और ब्लॉक डिफ्यूजन दृष्टिकोणों की तुलना में तेज़ इन्फरेंस और बेहतर गति-गुणवत्ता ट्रेडऑफ़ प्राप्त करने के लिए KV कैश सपोर्ट के साथ लचीले, मनमाने क्रम वाले टोकन सेट जनरेशन को जोड़ता है।

मूल लेखक: Marianne Arriola, Volodymyr Kuleshov

प्रकाशित 2026-07-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Marianne Arriola, Volodymyr Kuleshov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "सेट डिफ्यूजन" (Set Diffusion) पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी तस्वीर: "क्रम" (Order) की समस्या

कल्पना कीजिए कि आप एक कहानी लिखने या गणित की समस्या हल करने की कोशिश कर रहे हैं। इसे करने के दो मुख्य तरीके हैं:

  1. कठोर लेखक (Autoregression): आप एक समय में एक शब्द लिखते हैं, सख्ती से बाएँ से दाएँ। आप अंत लिखने से पहले शुरुआत खत्म नहीं कर सकते। यह बहुत उच्च गुणवत्ता वाला और सटीक है, लेकिन यह धीमा है क्योंकि आप एक साथ दो काम नहीं कर सकते।
  2. अराजक कलाकार (Standard Diffusion): आप एक पन्ने को ढेर सारे शोर (gibberish/noise) से शुरू करते हैं और उसे एक साथ ठीक करने की कोशिश करते हैं। आप एक साथ कई शब्दों का अनुमान लगा सकते हैं, जो तेज़ है, लेकिन कहानी को तार्किक रखना कठिन होता है। साथ ही, आप आसानी से यह "याद" नहीं रख सकते कि आपने पहले क्या लिखा था ताकि अगले भाग को लिखने में मदद मिल सके, इसलिए आपको हर बार बदलाव करने के लिए पूरा पन्ना फिर से पढ़ना पड़ता है।

समस्या: इन दोनों को मिलाने के प्रयास (जिसे "ब्लॉक डिफ्यूजन" कहा जाता है) कठोर टुकड़ों में लिखने जैसे थे। आप एक शब्द के बजाय एक वाक्य के समय लिख सकते थे, लेकिन फिर भी आपको अगले भाग पर जाने से पहले उस पूरे ब्लॉक को समाप्त करना पड़ता था। यदि आप कहानी के बीच में किसी शब्द को सुधारना चाहते थे, तो आपको पूरे ब्लॉक के खत्म होने का इंतज़ार करना पड़ता था।

समाधान: सेट डिफ्यूजन (Set Diffusion)

लेखक सेट डिफ्यूजन पेश करते हैं। इसे एक लाइन में लिखने के बजाय, लचीले टुकड़ों के साथ एक पहेली (puzzle) भरने के रूप में सोचें।

शब्दों को एक-एक करके लिखने (बहुत धीमा) या ब्लॉक-दर-ब्लॉक लिखने (बहुत कठोर) के बजाय, सेट डिफ्यूजन आपको एक विशिष्ट नियमों के समूह का पालन करते हुए, शब्दों के किसी भी समूह को चुनने और उन्हें जनरेट करने की अनुमति देता है।

"स्लाइडिंग विंडो" (Sliding Window) की उपमा

कल्पना कीजिए कि आप एक लंबी दीवार पर भित्ति चित्र (mural) पेंट कर रहे हैं।

  • पुराना तरीका (Block Diffusion): आप 4 फीट का एक हिस्सा पेंट करते हैं, उसे पूरी तरह सूखने का इंतज़ार करते हैं, और फिर अगले 4 फीट के हिस्से पर जाते हैं। आप पूरे ब्लॉक के पूरा होने तक पहले हिस्से को दोबारा छू नहीं सकते।
  • नया तरीका (Set Diffusion): आपके पास पेंट का एक "स्लाइडिंग विंडो" है। आप पहले 4 फीट पेंट कर सकते हैं, लेकिन फिर आप अपनी विंडो को आगे खिसका सकते हैं और 5वें, 6वें और 7वें फीट के साथ-साथ 2रे, 3रे और 4थे फीट को भी एक साथ पेंट कर सकते हैं। आप विंडो के किनारे को पेंट करते समय बीच में किसी जगह को ठीक करने के लिए पीछे भी कूद सकते हैं।

मुख्य विशेषताओं का सरल स्पष्टीकरण

1. लचीले "टोकन सेट" (पहेली के टुकड़े)
इस मॉडल में, एक "टोकन" केवल एक शब्द या कोड का हिस्सा है।

  • नवाचार: मॉडल केवल अगले शब्द का अनुमान नहीं लगाता। यह शब्दों के एक सेट (समूह) का अनुमान लगाता है।
  • जादू: आप मॉडल को बता सकते हैं, "अगले 3 शब्द गेस करो," या "स्थिति 5 और स्थिति 10 पर शब्द गेस करो।" यह अलग-अलग आकार के समूहों और अलग-अलग क्रमों को संभाल सकता है। यह इसे तेज़ बनाता है (एक साथ कई चीज़ों का अनुमान लगाना) लेकिन स्मार्ट भी रखता है (क्रम का ध्यान रखना)।

2. "मेमोरी बैंक" (KV Caching)
AI में, "KV कैशिंग" एक रफ नोटपैड की तरह है जहाँ मॉडल उस संदर्भ (context) को लिख देता है जो उसने पहले ही जनरेट कर लिया है, ताकि उसे हर बार पुनर्गणना न करनी पड़े।

  • पुरानी समस्या: स्टैंडर्ड डिफ्यूजन में, मॉडल को हर बार अनुमान लगाने के लिए पूरे टेक्स्ट को फिर से पढ़ना पड़ता था। यह मुख्य पात्र का नाम याद रखने के लिए पूरी किताब पढ़ने जैसा था।
  • नया समाधान: सेट डिफ्यूजन हर एक स्टेप के बाद अपने "रफ नोटपैड" को अपडेट करता है। जैसे ही यह शब्दों का एक सेट गेस करता है, यह उन्हें मेमोरी में सहेज लेता है। यह इसे अविश्वसनीय रूप से तेज़ बनाता है, जो 'कठोर लेखक' की तरह सटीक और 'अराजक कलाकार' की तरह तेज़ है।

3. "स्लाइडिंग विंडो" रणनीति
पेपर एक विशिष्ट तरीका पेश करता है जिससे यह तय किया जाता है कि अगले कौन से शब्द गेस किए जाएँ, जिसे स्लाइडिंग-विंडो दृष्टिकोण कहा जाता है।

  • एक स्टेज पर चलती हुई स्पॉटलाइट की कल्पना करें। स्पॉटलाइट एक अभिनेता को कवर कर सकती है, या यह एक साथ तीन अभिनेताओं को कवर कर सकती है।
  • मॉडल इस स्पॉटलाइट का उपयोग यह तय करने के लिए करता है: "मैं अभी इस स्पॉटलाइट के अंदर के शब्दों को जनरेट करूँगा।"
  • स्पॉटलाइट के आकार को बदलकर, आप गति (बड़ी स्पॉटलाइट, कई शब्दों का अनुमान लगाना) और सटीकता (छोटी स्पॉटलाइट, कम शब्दों का अनुमान लगाकर अधिक सावधानी बरतना) के बीच संतुलन को नियंत्रित कर सकते हैं।

उन्होंने क्या सिद्ध किया?

लेखकों ने तीन मुख्य कार्यों पर इस नए तरीके का परीक्षण किया:

  1. गणितीय तर्क (Math Reasoning): गणित की समस्याओं को हल करना (जैसे GSM8K डेटासेट)।
  2. सारांश (Summarization): लंबे लेखों को संक्षिप्त सारांश में बदलना।
  3. इन्फिलिंग (Infilling): कहानी के छूटे हुए हिस्सों को भरना (जैसे "मैड लिब्स" गेम)।

परिणाम:

  • गति बनाम गुणवत्ता: सेट डिफ्यूजन ने वह "स्वीट स्पॉट" (आदर्श संतुलन) खोज लिया जो पिछले मॉडल्स चूक गए थे। यह कठोर ब्लॉक मॉडल्स से तेज़ था और अराजक डिफ्यूजन मॉडल्स की तुलना में अधिक सटीक था।
  • इन्फिलिंग: यह पिछले "ब्लॉक डिफ्यूजन" तरीके की तुलना में कहानी के छूटे हुए हिस्सों को भरने में काफी बेहतर था।
  • लचीलापन: यह किसी भी लंबाई और किसी भी क्रम में टेक्स्ट जनरेट कर सकता है, जो दस्तावेज़ को एडिट करने या फ़ाइल के बीच में कोड को ठीक करने जैसे कार्यों के लिए महत्वपूर्ण है।

सारांश रूपक (Summary Metaphor)

यदि ऑटोरिग्रेसन (Autoregression) एक रिले रेस है (एक धावक बारी-बारी से अगला धावक बनता है, सख्ती से क्रम में), और स्टैंडर्ड डिफ्यूजन एक सबकी अपनी मर्जी (free-for-all) है (हर कोई एक साथ दौड़ता है, लेकिन यह अराजक है), तो सेट डिफ्यूजन एक सुव्यवस्थित डांस ट्रूप (नर्तक दल) है।

नर्तक (टोकन) समूहों (सेट्स) में चल सकते हैं। वे बाएँ-से-दाएँ चल सकते हैं, या वे अंतराल भरने के लिए इधर-उधर कूद सकते हैं, लेकिन वे हमेशा जानते हैं कि उनके बगल में कौन है और उनके पिछले कदम क्या थे, क्योंकि उनके पास एक साझा मेमोरी (KV कैश) है। यह उन्हें रिले टीम की तुलना में अधिक तेज़ और फ्री-फॉर-ऑल की तुलना में अधिक लचीले ढंग से जटिल रूटीन (गणित, कहानियाँ) करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →