← नवीनतम पेपर
💻 computer science

DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse

DiTango एक लागत प्रभावी समानांतर डिफ्यूजन फ्रेमवर्क है जो संदर्भ विभाजनों (context partitions) की विषमता का लाभ उठाकर और अटेंशन स्टेट्स को रणनीतिक रूप से पुन: उपयोग करके मल्टी-नोड DiT जनरेशन को त्वरित करता है, जिससे जनरेशन की गुणवत्ता को बनाए रखते हुए लगभग रैखिक स्केलिंग के साथ 3.2x तक की गति वृद्धि प्राप्त होती है।

मूल लेखक: Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai

प्रकाशित 2026-07-20
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल स्थिर चित्रों को ही नहीं, बल्कि मिनटों तक चलने वाली बहती हुई, उच्च-परिभाषा (high-definition) वाली कहानियों को भी सपने की तरह रच सकते हैं। यह "डिफ्यूजन ट्रांसफॉर्मर" (Diffusion Transformers) का जादू है, जो एक प्रकार का कृत्रिम बुद्धिमत्ता (AI) है जो छवियों और वीडियो को चरण-दर-चरण बनाता है, धीरे-धीरे स्थिर शोर (static noise) को एक स्पष्ट, सुंदर दृश्य में बदल देता है। इसे एक मूर्तिकार की तरह समझें जो संगमरमर के एक ब्लॉक से धीरे-धीरे तराश कर आकृति निकालता है; AI पिक्सेल के एक अराजक बादल से शुरू होता है और कई चरणों के परिष्करण (refinement) के बाद, एक आदर्श वीडियो को प्रकट करता है।

हालाँकि, इसमें एक पेंच है: ये डिजिटल मूर्तिकार अविश्वसनीय रूप से धीमे हैं। एक शक्तिशाली कंप्यूटर पर एक पांच सेकंड का एकल वीडियो बनाने में एक घंटे से अधिक का समय लग सकता है। गति बढ़ाने के लिए, इंजीनियर अक्सर कई कंप्यूटरों को मिलकर काम करने के लिए प्रेरित करते हैं, लंबे वीडियो अनुक्रम को टुकड़ों में विभाजित करते हैं और उन्हें एक रिले रेस की तरह बांट देते हैं। लेकिन समस्या यह है कि जब ये कंप्यूटर अपना काम साझा करने की कोशिश करते हैं, तो वे ट्रैफिक जाम में फंस जाते हैं। डेटा को वापस और आगे भेजने के लिए प्रतीक्षा करने में लगने वाला समय उस गति को खत्म कर देता है जो अधिक श्रमिकों को रखने से मिली थी। यह एक निराशाजनक बाधा (bottleneck) पैदा करता है जहाँ अधिक कंप्यूटर जोड़ने से वास्तव में वीडियो के खत्म होने की गति नहीं बढ़ती है, और कभी-कभी यह उसे और धीमा भी कर देता है।

यहाँ आता है DiTango, एक नया सिस्टम जिसे इस ट्रैफिक जाम को ठीक करने के लिए डिज़ाइन किया गया है। DiTango के पीछे के शोधकर्ताओं ने गौर किया कि ये AI मॉडल वीडियो के विभिन्न हिस्सों पर कैसे "ध्यान केंद्रित" (pay attention) करते हैं। उन्होंने पाया कि वीडियो के सभी हिस्से हर क्षण समान रूप से महत्वपूर्ण नहीं होते हैं। ठीक वैसे ही जैसे आप अपने ठीक सामने बोलने वाले व्यक्ति पर तो ध्यान केंद्रित करते हैं, लेकिन तीन कमरे दूर खड़े व्यक्ति पर शायद ही ध्यान देते हैं, AI का ध्यान वीडियो के नजदीकी हिस्सों के लिए सबसे मजबूत और दूर के हिस्सों के लिए बहुत कमजोर होता है।

DiTango इस अंतर्दृष्टि का उपयोग "छोड़ो और पुन: उपयोग करो" (skip and reuse) का एक चतुर खेल खेलने के लिए करता है। हर कंप्यूटर को हर दूसरे कंप्यूटर से हर एक डेटा के टुकड़े को लगातार प्राप्त करने और गणना करने के लिए मजबूर करने के बजाय (जो ट्रैफिक जाम का कारण बनता है), DiToma का स्मार्ट प्लानर यह तय करता है कि कौन से हिस्से नए सिरे से गणना करने के लिए महत्वपूर्ण हैं और कौन से हिस्से इतने महत्वहीन हैं कि कंप्यूटर बस कुछ सेकंड पहले के पुराने, कैश किए गए (cached) परिणाम का उपयोग कर सकता है। यह एक विशाल रसोई में रसोइयों के एक समूह की तरह है: हर बार मसालों के डिब्बे को लेने के लिए पेंट्री की ओर दौड़ने के बजाय, वे महसूस करते हैं कि मेज के दूसरी ओर रखी सजावट के लिए, पास के काउंटर पर रखा मसालों का डिब्बा "काफी अच्छा" है और इसके लिए ताज़ा चक्कर लगाने की आवश्यकता नहीं है।

चुनिंद होकर, DiTango कंप्यूटरों के आपस में बात करने में लगने वाले समय को नाटकीय रूप से कम कर देता है। शक्तिशाली वीडियो मॉडल का उपयोग करके किए गए परीक्षणों में, इस दृष्टिकोण ने पूरी प्रक्रिया (end-to-end) को लगभग दोगुना तेज़ बना दिया और 32 कंप्यूटरों का उपयोग करते समय मुख्य "अटेंशन" गणनाओं को तीन गुना से अधिक तेज़ कर दिया। महत्वपूर्ण रूप से, शोधकर्ताओं ने पाया कि इस गति वृद्धि ने वीडियो की गुणवत्ता को खराब नहीं किया; अंतिम फिल्में उतनी ही स्पष्ट और सुसंगत दिखीं जितनी कि धीमी, पारंपरिक विधियों द्वारा बनाई गई फिल्में। DiTango यह सिद्ध करता है कि यह समझकर कि AI को वास्तव में कहाँ देखने की आवश्यकता है, हम इसे उन चीजों पर ऊर्जा बर्बाद करने से रोक सकते हैं जिन पर वह शायद ही ध्यान दे, जिससे तत्काल, उच्च-गुणवत्ता वाले AI वीडियो निर्माण का सपना वास्तविकता के थोड़ा और करीब आ जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →