← नवीनतम पेपर
🤖 machine learning

MixFlow: Mixed Source Distributions Improve Rectified Flows

यह शोध पत्र MixFlow को प्रस्तुत करता है, जो एक प्रशिक्षण रणनीति है जो जनरेटिव पाथ कर्वेचर (generative path curvature) को कम करने के लिए एक निश्चित अनकंडीशनल डिस्ट्रीब्यूशन (unconditional distribution) को सिग्नल-अलाइन्ड सोर्स डिस्ट्रीब्यूशन (signal-aligned source distribution) के साथ जोड़ती है, जिससे रेक्टिफाइड फ्लो मॉडल्स (rectified flow models) में सैंपलिंग दक्षता, जनरेशन की गुणवत्ता और प्रशिक्षण अभिसरण (training convergence) में महत्वपूर्ण सुधार होता है।

मूल लेखक: Nazir Nayal, Christopher Wewer, Jan Eric Lenssen

प्रकाशित 2026-04-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nazir Nayal, Christopher Wewer, Jan Eric Lenssen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को बिल्ली की एक बेहतरीन तस्वीर बनाना सिखाने की कोशिश कर रहे हैं।

वर्तमान में, सबसे अच्छे रोबोट एक विधि का उपयोग करते हैं जिसे डिफ्यूजन मॉडल्स (Diffusion Models) कहा जाता है। इसे "गर्म और ठंडा" (Hot and Cold) के खेल की तरह समझें। रोबोट शुद्ध स्टैटिक शोर (जैसे टीवी पर आने वाली बर्फ जैसी झिलमिलाहट) की एक बाल्टी से शुरुआत करता है और धीरे-धीरे उस शोर को एक बिल्ली में बदलने की कोशिश करता है।

हालाँकि, एक समस्या है: रोबoret जिस रास्ते पर चलता है वह बहुत टेढ़ा-मेढ़ा और अराजक (chaotic) है। यह ऐसा है जैसे आप अपने घर के दरवाजे से रसोई तक जाने की कोशिश कर रहे हों, लेकिन फर्श पर ऊन का एक विशाल, उलझा हुआ गोला पड़ा हो। रोबोट को वहां पहुँचने के लिए सैकड़ों छोटे, घुमावदार कदम उठाने पड़ते हैं, जिससे यह प्रक्रिया धीमी और गणनात्मक रूप से महंगी हो जाती है।

समस्या: रास्ता इतना टेढ़ा-मेढ़ा क्यों है?

पेपर तर्क देता है कि रास्ता इसलिए टेढ़ा-मेढ़ा है क्योंकि रोबोट ऐसी जगह से शुरू कर रहा है जिसका बिल्ली से कोई लेना-देना नहीं है। यह "स्टैंडर्ड गॉसियन नॉइज़" (शुद्ध यादृच्छिकता/randomness) से शुरू होता है। चूंकि शुरुआती बिंदु (रैंडम शोर) और अंतिम बिंदु (एक बिल्ली) एक-दूसरे से पूरी तरह असंबंधित हैं, इसलिए रोबोट को उन्हें जोड़ने के लिए बड़े, भ्रमित करने वाले चक्कर लगाने पड़ते हैं।

समाधान: MixFlow

लेखक MixFlow नामक एक नई विधि पेश करते हैं। वे उस उलझे हुए ऊन के रास्ते को सीधा करने के लिए दो मुख्य विचार प्रस्तावित करते हैं।

1. "जीपीएस" (GPS) का विचार (κ-FC)

कल्पना कीजिए कि आप एक जंगल में खो गए हैं।

  • पुराना तरीका: आपके पास एक नक्शा है जो कहता है "आप दुनिया में कहीं हैं," और आपको अंदाज़ा लगाना है कि उत्तर दिशा कौन सी है। आप चक्कर काटते रहते हैं।
  • MixFlow तरीका: आपके पास एक नक्शा है जो कहता है, "आप वर्तमान में ठीक उसी पेड़ के पास खड़े हैं जो उस फोटो में दिखने वाले पेड़ जैसा ही है जिसे आप बनाना चाहते हैं।"

लेखक κ-FC नामक एक अवधारणा पेश करते हैं। यह रोबोट को एक "संकेत" या "जीपीएस सिग्नल" (जिसे वे κ\kappa कहते हैं) देने जैसा है जो उसे बताता है, "हे, जिस शोर से आप शुरुआत कर रहे हैं, वह पहले से ही थोड़ा बहुत उस बिल्ली जैसा दिखना चाहिए जिसे आप बनाने की कोशिश कर रहे हैं।"

यदि रोबोट जानता है कि मंजिल एक बिल्ली है, तो उसे शुद्ध रैंडम शोर से शुरुआत नहीं करनी चाहिए। उसे ऐसे शोर से शुरुआत करनी चाहिए जो पहले से ही बिल्ली के आकार जैसा हो। यह रास्ते को बहुत सीधा बना देता है।

चुनौती: यदि आप इस संकेत पर बहुत अधिक निर्भर करते हैं, तो रोबोट भ्रमित हो जाता है। यदि संकेत बहुत विशिष्ट है, तो रोबोट बिल्ली बनाना भूल सकता है यदि आप उसे बाद में संकेत न दें। यह एक ऐसे छात्र की तरह है जो उत्तर कुंजी (answer key) को रट लेता है लेकिन बिना संकेत के समस्या हल नहीं कर पाता। इसे "प्रायर होल" (Prior Hole) समस्या कहा जाता है।

2. "स्मूदी" रणनीति (MixFlow)

"जीपीएस" समस्या को ठीक करने के लिए, लेखकों ने MixFlow बनाया है।

कल्प diजिये कि आप एक स्मूदी बना रहे हैं।

  • सामग्री A: शुद्ध पानी (स्टैंडर्ड रैंडम नॉइज़)।
  • सामग्री B: एक केंद्रित फलों का रस जिसका स्वाद बिल्कुल उस बिल्ली जैसा है जिसे आप बनाना चाहते हैं (वह "संकेत" वितरण)।

रोबोट को केवल फलों का रस (जो जोखिम भरा है) या केवल पानी (जो धीमा है) पीने के लिए मजबूर करने के बजाय, MixFlow उसे दोनों का एक मिश्रण पीना सिखाता है।

ट्रेनिंग के दौरान, रोबोट हर संभव मिश्रण को संभालना सीखता है:

  • 100% पानी (शुद्ध शोर)
  • 50% पानी / 50% जूस
  • 100% जूस (संकेत)

यह जादू क्यों है?
क्योंकि रोबोट ट्रेनिंग के दौरान "जूस" वाला रास्ता (स्मार्ट, सीधा रास्ता) सीखता है, वह अनजाने में उस सीधे तर्क को "पानी" वाले रास्ते पर भी लागू करना सीख जाता है।

जब वास्तव में तस्वीर बनाने का समय आता है (inference), तो आप बस उसे पानी (शुद्ध शोर) दे सकते हैं। क्योंकि उसने ट्रेनिंग के दौरान "जूस" वाला रास्ता सीखा है, वह जानता है कि बिना संकेत के भी उस पानी को बिल्ली में सीधे रास्ते से कैसे बदलना है।

परिणाम: तेज़ और बेहतर

इस "स्मूदी" ट्रेनिंग पद्धति का उपयोग करके:

  1. रास्ता सीधा है: रोबोट को चक्कर नहीं काटने पड़ते।
  2. यह तेज़ है: इसे उच्च गुणवत्ता वाली छवि बनाने के लिए बहुत कम चरणों की आवश्यकता होती है।
  3. गुणवत्ता बेहतर है: कम चरणों के साथ भी चित्र बेहतर दिखते हैं।

एनालॉजी (उपमा) सारांश

  • पुराना तरीका: समुद्र के किसी यादृच्छिक स्थान से एक विशिष्ट द्वीप तक जाने की कोशिश करना। आपको बड़े, भ्रमित करने वाले घेरे बनाकर तैरना पड़ता है।
  • MixFlow: आप तैराक को एक पास की नाव (संकेत) से द्वीप तक के मार्ग का अभ्यास कराकर प्रशिक्षित करते हैं। एक बार जब तैराक उस छोटे, सीधे मार्ग में महारत हासिल कर लेता है, तो वह समुद्र के बीच से द्वीप तक सीधे तैरने का तरीका भी सीख जाता है, क्योंकि उसने केवल शुरुआती बिंदु नहीं, बल्कि दिशा सीखी है।

संक्षेप में: MixFlow एआई मॉडल्स को ट्रेनिंग के दौरान "लंबा रास्ता" सीखने के लिए प्रेरित करता है ताकि वे वास्तविक काम करते समय "हाईवे" का उपयोग कर सकें। यह उन्हें तेज़, सस्ता और उनके काम में बेहतर बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →