← नवीनतम पेपर
💻 computer science

Divergence-Suppressing Couplings for Rectified Flow

यह शोध पत्र रेक्टिफाइड फ्लो (Rectified Flow) के लिए एक ऑफलाइन सुधार विधि प्रस्तावित करता है जो विकृत प्रक्षेप पथों (trajectories) को सीधा करने के लिए सीखे गए वेग क्षेत्र (velocity field) के अपसारी घटक (divergent component) को दबा देता है, जिससे इन्फरेंस लागत बढ़ाए बिना सिंथेटिक और इमेज बेंचमार्क दोनों पर जनरेशन की गुणवत्ता में सुधार होता है।

मूल लेखक: Yimeng Min, Carla P. Gomes

प्रकाशित 2026-05-19
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yimeng Min, Carla P. Gomes

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक खाली कैनवास पर रैंडम शोर (noise) से शुरू करके एक सटीक चित्र, जैसे कि चेकरबोर्ड या एक चेहरा, बनाना सिखाने की कोशिश कर रहे हैं।

समस्या: "लहराता हुआ" रास्ता (The "Wobbly" Path)
यह शोध पत्र रेक्टिफाइड फ्लो (Rectified Flow) नामक एक तकनीक के बारे में चर्चा करता है। इसे एक जीपीएस नेविगेशन सिस्टम की तरह समझें। लक्ष्य "शोर" (शुरुआत) से "चित्र" (अंत) तक सबसे सीधा और सीधा रास्ता खोजना है।

इस तकनीक के मानक संस्करण में, रोबोट एक नक्शा सीखता है। लेकिन कभी-कभी, नक्शा थोड़ा अस्त-व्यस्त होता है। नक्शे पर सड़कें मुड़ती हैं, घूमती हैं और आपस में उलझ जाती हैं, जैसे उलझे हुए हेडफ़ोन। जब रोबोट इन घुमावदार रास्तों का पीछा करने की कोशिश करता है, तो वह भ्रमित हो जाता है। वह अपने गंतव्य से भटक सकता है, लक्ष्य से आगे निकल सकता है, या गलत पड़ोस में पहुँच सकता है (जैसे कि जहाँ काला वर्ग होना चाहिए वहाँ सफेद वर्ग बना देना)।

लेखकों ने पाया कि ये "घुमाव" डाइवर्जेंस (divergence) के कारण होते हैं। सरल शब्दों में, कल्पना कीजिए कि रोबary का रास्ता एक नदी है।

  • डाइवर्जेंस एक ऐसा हिस्सा है जहाँ नदी अचानक चौड़ी (विस्तारित) होती है या संकरी (सिकुड़ती) होती है।
  • जब नदी चौड़ी होती है, तो पानी फैल जाता है, और रोबोट अतिरिक्त स्थान में खो जाता है।
  • जब नदी संकरी होती है, तो पानी दब जाता है, और रोबोट को ऐसे कोने में धकेल दिया जाता है जहाँ उसे नहीं होना चाहिए।
    ये विस्तार और संकुचन रोबोट के रास्ते को मोड़ देते हैं और बिगाड़ देते हैं, जिससे अंतिम चित्र धुंधला या गलत हो जाता है।

समाधान: "डाइवर्जेंस-सप्रेसिंग" फ़िल्टर (The "Divergence-Suppressing" Filter)
यह शोध पत्र DS-RectFlow नामक एक नई विधि पेश करता है।

रोबोट के प्रशिक्षण की प्रक्रिया को चित्र बनाना सीखने वाले एक छात्र की तरह समझें।

  1. पुराना तरीका: छात्र नक्शे पर टेढ़े-मेढ़े, घुमावदार रास्तों का पालन करके अभ्यास करता है। वे चित्र बनाना सीखते हैं, लेकिन वे वही गलतियाँ करते रहते हैं क्योंकि नक्शा खुद ही दोषपूर्ण है।
  2. नया तरीका (DS-RectFlow): अभ्यास करने से पहले, एक शिक्षक (नया एल्गोरिदम) नक्शे को देखता है। शिक्षक देखता है कि नक्शे में कहाँ नदी बहुत अधिक चौड़ी या संकरी हो रही है। फिर शिक्षक छात्र के शुरुआती बिंदु को थोड़ा सा बगल में, नदी के एक चिकने, सीधे हिस्से पर धीरे से धकेल देता है।

महत्वपूर्ण बात यह है कि शिक्षक नक्शे को नहीं बदलता है। नक्शा (AI मॉडल) बिल्कुल वैसा ही रहता है। शिक्षक बस प्रत्येक अभ्यास सत्र के लिए छात्र की यात्रा का प्रारंभिक बिंदु बदल देता है। एक सीधे रास्ते से शुरू करके, छात्र एक बहुत ही साफ और सीधा मार्ग सीखता है।

जादुई ट्रिक: "मुफ्त" गति (The Magic Trick: "Free" Speed)
आमतौर पर, यदि आप चाहते हैं कि एक रोबोट तेज़ या अधिक सटीक रूप से चले, तो आपको उसे अधिक शक्तिशाली इंजन (अधिक कंप्यूटिंग पावर) देना होगा या हर कदम पर उसे अधिक सोचने के लिए कहना होगा।

यह शोध पत्र एक "जादुई ट्रिक" का दावा करता है:

  • "धकेलना" (घुमावों की जाँच करना और शुरुआत को समायोजित करना) केवल एक बार होता है, प्रशिक्षण चरण के दौरान, जब रोबोट सीख रहा होता है।
  • एक बार जब रोबोट प्रशिक्षित हो जाता है, तो वह धकेलने के बारे में भूल जाता है।
  • जब आप वास्तव में रोबोट को चित्र बनाने के लिए कहते हैं (इन्फरेंस/inference), तो यह पुराने, अस्त-व्यस्त संस्करण की तरह ही ठीक उसी गति से चलता है। इसे किसी अतिरिक्त गणित या अतिरिक्त चरणों की आवश्यकता नहीं होती है।

परिणाम (The Results)
लेखकों ने सरल 2D आकृतियों (जैसे चेकरबोर्ड) और वास्तविक छवियों (जैसे CelebA से चेहरे और CIFAR-10 से कारें) पर इसका परीक्षण किया।

  • बेहतर गुणवत्ता: उत्पन्न चित्र बहुत अधिक स्पष्ट और सटीक थे।
  • कम चरण: रोबोट केवल एक चरण (जैसे एक छलांग) में उच्च गुणवत्ता वाली छवियां बना सकता था, बजाय इसके कि उसे 20 छोटे चरणों की आवश्यकता हो।
  • कोई अतिरिक्त लागत नहीं: क्योंकि "सुधार" केवल प्रशिक्षण के दौरान लागू किया जाता है, इसलिए अंतिम उत्पाद उपयोग के लिए मूल संस्करण जितना ही तेज़ है, लेकिन बहुत बेहतर है।

संक्षेप में (In a Nutshell)
शोध पत्र कहता है: "वर्तमान AI इमेज जनरेटर कभी-कभी धीमे या धुंधले क्यों होते हैं, इसका कारण यह है कि उनके आंतरिक 'रास्ते' बहुत घुमावदार हैं। हमने एक तरीका खोजा है जिससे हम उन रास्तों को AI के सीखते समय सुचारू बना सकते हैं, ताकि जब वह सीखना समाप्त कर ले, तो वह बिना किसी अतिरिक्त ईंधन के सीधा और तेज़ चल सके।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →