VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation
यह शोध पत्र VDE को प्रस्तुत करता है, जो कि रेक्टिफाइड फ्लो मॉडल्स के लिए एक प्रशिक्षण-मुक्त त्वरण विधि है, जो स्थिर कैश किए गए फीचर्स का पुन: उपयोग करने के बजाय वेग घटकों (velocity components) को विघटित और अनुमानित करके अनुमान गति (inference speed) में सुधार करती है, जिससे दृश्य गुणवत्ता में न्यूनतम हानि के साथ महत्वपूर्ण त्वरण प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल चित्र बनाने की कोशिश कर रहे हैं, जैसे कि एक हलचल भरी शहर की सड़क, लेकिन आपको इसे एक बार में एक छोटा सा ब्रशस्ट्रोक करके बनाना है। एक सटीक परिणाम पाने के लिए, आपको शायद 50 कदम उठाने पड़ सकते हैं, जिसमें हर एक स्ट्रोक के बाद अपने काम की जाँच करना और पेंट को एडजस्ट करना शामिल है। इसमें बहुत समय लगता है।
यह बिल्कुल वैसा ही है जैसे आधुनिक AI इमेज और वीडियो जनरेटर (जिन्हें रेक्टिफाइड फ्लो मॉडल्स कहा जाता है) काम करते हैं। वे अविश्वसनीय रूप से प्रतिभाशाली कलाकार हैं, लेकिन वे धीमे हैं क्योंकि उन्हें एक छवि बनाने के लिए कई छोटे-छोटे कदम उठाने पड़ते हैं।
लेखक एक नई ट्रिक पेश करते हैं जिसे VDE (वेलोसिटी डिकंपोजिशन एंड एस्टीमेशन) कहा जाता है, जो इन AI कलाकारों को उनकी पेंटिंग की गुणवत्ता खराब किए बिना बहुत तेज़ी से काम करने में मदद करती है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
पुराना तरीका: "द फ्रोजन ब्लूप्रिंट" (जमा हुआ खाका)
पिछले तरीकों ने चीज़ों को तेज़ करने के लिए पिछले चरण से ड्राइंग के हिस्सों को कैशिंग (सेव करना) करने और बस उन्हें पुन: उपयोग करने की कोशिश की।
- उपमा: कल्पना कीजिए कि आप एक रास्ते पर चल रहे हैं। पुराना तरीका कहता है, "मैं बस उस जगह का नक्शा कॉपी कर लूंगा जहाँ मैं 10 सेकंड पहले था और मान लूँगा कि रास्ता नहीं बदला है।"
- समस्या: दुनिया गतिशील है। यदि आप एक मोड़ लेते हैं या दृश्य बदल जाता है, तो वह पुराना नक्शा अब गलत है। AI उन पुराने फीचर्स को फिर से उपयोग करने की कोशिश करता है जो वर्तमान तस्वीर में फिट नहीं बैठते, जिससे धुंधली बनावट या अजीब विरूपण (distortions) पैदा होते हैं। यह कल के आकार के कोट को आज पहनने जैसा है; यह शायद आज फिट न बैठे।
नया तरीका (VDE): "द स्मार्ट नेविगेटर" (स्मार्ट नेविगेटर)
लेखकों ने महसूस किया कि पुराने नक्शों को कॉपी करने के बजाय, AI वास्तव में अपनी गति को दो सरल भागों में तोड़कर यह अनुमान लगा सकता है कि वह आगे कहाँ जा रहा है।
AI की गति (उसकी "वेलोसिटी") को एक सड़क पर चलती कार के रूप में सोचें। VDE इस गति को दो घटकों में विभाजित करता है:
"फॉरवर्ड" पुश (पैरेलल कंपोनेंट): यह वह है जिससे कार सीधे आगे बढ़ रही है।
- खोज: पेपर में पाया गया कि यह "फॉरवर्ड पुश" बहुत सहजता और पूर्वानुमान के साथ बदलता है। यह एक कार के त्वरण (acceleration) की तरह है; यदि आप पिछले दो सेकंड की गति जानते हैं, तो आप सरल गणित (जैसे एक सीधी रेखा खींचना) का उपयोग करके अगले सेकंड की गति का आसानी से अनुमान लगा सकते हैं।
- ट्रिक: पूरे इंजन की दोबारा गणना करने के बजाय, VDE बस पिछले कुछ चरणों के आधार पर एक त्वरित गणितीय अनुमान लगाता है।
"साइडवेज" ड्रिफ्ट (ऑर्थोगोनल कंपोनेंट): यह वह सूक्ष्म दाएं-बाएं समायोजन है जो कार लेन में रहने के लिए करती है।
- खोज: पेपर में पाया गया कि थोड़े समय के लिए, यह "साइडवेज ड्रिफ्ट" बिल्कुल भी नहीं बदलता है। यह कार के स्टीयरिंग व्हील के कुछ सेकंड तक बिल्कुल उसी स्थिति में रहने जैसा है।
- ट्रिक: VDE बिना दोबारा गणना किए कुछ चरणों के लिए इसी "साइडवेज" दिशा का पुन: उपयोग करता है।
व्यवहार में VDE कैसे काम करता है
VDE एक "चेक-इन एंड एस्टीमेट" रणनीति का उपयोग करता है:
- द एंकर (चेक-इन): हर कुछ चरणों में, AI पूर्ण, धीमी गणना करता है ताकि सटीक, वास्तविक डेटा प्राप्त हो सके। यह ड्राइवर द्वारा जीपीएस चेक करने और आगे के रास्ते की पुष्टि करने के समान है।
- द एस्टीमेट (द शॉर्टकट): बीच के चरणों के लिए, AI भारी काम नहीं करता है। इसके बजाय, यह "फॉरवर्ड" गणितीय अनुमान और "साइडवेज" पुन: उपयोग का उपयोग करके तुरंत अगला कदम तय कर लेता है।
- परिणाम: AI पहले की तुलना में 2 से 3 गुना तेज़ी से काम पूरा करता है।
यह बेहतर क्यों है
लेखक ने इमेज और वीडियो बनाने के लिए तीन अलग-अलग AI मॉडल्स (Flux, Qwen-Image, और Wan2.1) पर इसका परीक्षण किया।
- गति: इसने AI को 2 से 3 गुना तेज़ बना दिया। उदाहरण के लिए, एक इमेज जिसे बनाने में 12 सेकंड लगते थे, वह लगभग 4 सेकंड में पूरी हो गई।
- गुणवत्ता: क्योंकि VDE मूवमेंट की गणना वर्तमान इनपुट (वास्तविक सड़क जिस पर कार अभी है) के आधार पर करता है, न कि किसी पुराने, स्थिर नक्शे के आधार पर, इसलिए तस्वीरें लगभग धीमी, उच्च-गुणवत्ता वाली संस्करण के समान ही दिखती हैं।
- तुलना: अन्य तरीके जो केवल पुराने हिस्सों को "पुन: उपयोग" करते हैं, अक्सर धुंधली या टूटी हुई छवियां पैदा करते हैं (जैसे कि खिंचा हुआ चेहरा या पिघली हुई बनावट)। VDE विवरणों को शार्प रखता है।
संक्षेप में
पेपर का दावा है कि AI की गति को एक "पूर्वानुमानित फॉरवर्ड भाग" और एक "स्थिर साइडवेज भाग" में तोड़कर, हम AI को अनावश्यक भारी गणना करने से रोक सकते हैं। पुराने काम को अंधाधुंध कॉपी करने के बजाय, AI अगले कदम का अनुमान लगाने के लिए स्मार्ट, हल्के गणित का उपयोग करता है, जिससे यह कम समय में उच्च-गुणवत्ता वाली इमेज और वीडियो बना पाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।