← नवीनतम पेपर
🤖 AI

CMT: Mid-Training for Efficient Learning of Consistency, Mean Flow, and Flow Map Models

यह शोध पत्र कंसिस्टेंसी मिड-ट्रेनिंग (CMT) को प्रस्तुत करता है, जो एक नवीन मध्यवर्ती प्रशिक्षण चरण है जो कंसिस्टेंसी मॉडल्स और मीन फ्लो जैसे फ्लो मैप मॉडल्स के सीखने की प्रक्रिया को स्थिर और त्वरित बनाता है, जिससे मौजूदा विधियों की तुलना में काफी कम प्रशिक्षण डेटा और कम्प्यूटेशनल लागत के साथ अत्याधुनिक (state-of-the-art) कुछ-चरणों वाली जनरेशन गुणवत्ता प्राप्त होती है।

मूल लेखक: Zheyuan Hu, Chieh-Hsin Lai, Yuki Mitsufuji, Stefano Ermon

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zheyuan Hu, Chieh-Hsin Lai, Yuki Mitsufuji, Stefano Ermon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "इंस्टेंट ट्रैवल" (तुरंत यात्रा) की समस्या

कल्पना कीजिए कि आप अपने घर (शोर/noise के एक रैंडम बादल) से एक विशिष्ट गंतव्य (एक बिल्ली की सुंदर, हाई-रिज़ॉल्यूशन इमेज) तक यात्रा करना चाहते हैं।

पुराना तरीका (डिफ्यूजन मॉडल्स - Diffusion Models):
पुराने तरीके को एक बहुत ही सावधान हाइकर (पगडंडी पर चलने वाले) के रूप में सोचें। शोर से बिल्ली तक पहुँचने के लिए, हाइकर हजारों छोटे और धीमे कदम उठाता है। हर एक कदम पर, वह रुकता है, नक्शा देखता है, अपने जूते ठीक करता है और पूछता है, "क्या मैं करीब पहुँच रहा हूँ?"

  • फायदे: वे लगभग हमेशा सही जगह पहुँच जाते हैं।
  • नुकसान: इसमें बहुत समय लगता है। यदि आप रियल-टाइम में इमेज जेनरेट करना चाहते हैं, तो यह बहुत धीमा है।

नया लक्ष्य (फ्लो मैप मॉडल्स - Flow Map Models):
शोधकर्ताओं ने एक "टेलीपोर्टर" बनाने की कोशिश की। हजारों कदम उठाने के बजाय, मॉडल को शोर से सीधे बिल्ली तक केवल एक या दो बड़ी छलांगों में पहुँचने का हुनर सीखना चाहिए। इसे "फ्लो मैप" कहा जाता है।

समस्या:
टेलीपोर्टर बनाना अविश्वीय रूप से कठिन है। यदि आप मॉडल को तुरंत बिंदु A से बिंदु Z तक कूदना सिखाने की कोशिश करते हैं, तो वह अक्सर भ्रमित हो जाता है। वह रास्ते का अनुमान लगाने की कोशिश करता है, लेकिन क्योंकि उसने "इलाका" (यात्रा के बीच का सफर) नहीं सीखा है, इसलिए वह अक्सर क्रैश हो जाता है, धुंधली इमेज बनाता है, या सीखने में बहुत अधिक समय लेता है।

समाधान: CMT (द "स्काउट" स्ट्रैटेजी)

लेखक CMT (कंसिस्टेंसी मिड-ट्रेनिंग) पेश करते हैं।

CMT को समझने के लिए, कल्पना करें कि आप एक छात्र को मास्टर नेविगेटर बनने के लिए प्रशिक्षित कर रहे हैं।

  1. चरण 1: विशेषज्ञ (प्री-ट्रेनिंग - Pre-training)
    आप एक विश्व स्तरीय विशेषज्ञ हाइकर (एक मानक डिफ्यूजन मॉडल) को काम पर रखते हैं। यह विशेषज्ञ इलाके को पूरी तरह जानता है। वे शोर से बिल्ली तक 35 धीमे और सावधानी भरे कदमों में चल सकते हैं। वे कभी रास्ता नहीं भटकते।

  2. चरण 2: स्काउट (मिड-ट्रेनिंग / CMT)
    यह इस पेपर का सबसे बड़ा नवाचार है।
    छात्र को सीधे गहरे पानी में डालने के बजाय, आप उसे एक "स्काउट" चरण में रखते हैं।

    • आप विशेषज्ञ के रास्ते (35 कदमों) को लेते हैं।
    • आप छात्र को दिखाते हैं: "देखो, अगर तुम विशेषज्ञ की यात्रा के 10वें कदम पर हो, तो अंतिम गंतव्य ठीक यहाँ है।"
    • आप छात्र को सिखाते हैं कि विशेषज्ञ के पथ के किसी भी बिंदु को देखकर तुरंत अंतिम गंतव्य को कैसे पहचाना जाए।
    • जादू: छात्र अब केवल अनुमान नहीं लगा रहा है। वह एक ऐसे रास्ते के आधार पर सीधा नक्शा सीख रहा है जो पहले से ही सफल साबित हुआ है। वह खुद धीमे कदम उठाए बिना यात्रा के "आकार" को सीख रहा है।
  3. चरण 3: टेलीपोर्टर (पोस्ट-ट्रेनिंग - Post-Training)
    अब, आप उस "स्काउट" छात्र को एक अंतिम टेलीपोर्टर के रूप में प्रशिक्षित करते हैं। चूंकि वह पहले से ही इलाके को बहुत अच्छी तरह समझता है (स्काउट चरण की बदौलत), वह शोर से बिल्ली तक की बड़ी छलांग अविश्वसनीय रूप से तेज़ और सटीक रूप से लगाना सीख जाता है।

यह गेम-चेंजर क्यों है?

यह पेपर टेलीपोर्टर को प्रशिक्षित करने के पुराने तरीकों की तुलना इस नए तरीके से करता है:

  • रैंडम स्टार्ट (Random Start): शून्य से टेलीपोर्टर सिखाना ऐसा है जैसे किसी को पहाड़ से नीचे गिराकर उड़ना सिखाना। वे क्रैश हो जाएंगे।
  • एक्सपर्ट ट्रांसफर (Expert Transfer): केवल विशेषज्ञ के वेट्स (weights) को कॉपी करने की कोशिश करना ऐसा है जैसे किसी हाइकर को टेलीपोर्टर सूट दे देना बिना यह समझाए कि यह कैसे काम करता है। वे फिर भी लड़खड़ाएंगे क्योंकि एक टेलीपोर्टर का "फिजिक्स" एक हाइकर से अलग होता है।
  • CMT (द स्काउट): यह छात्र को इलाके का एक "चीट शीट" देता है।

परिणाम (द "वाओ" फैक्टर):
पेपर दिखाता है कि CMT का उपयोग करना साइकिल से सुपरसोनिक जेट में अपग्रेड करने जैसा है:

  • गति (Speed): यह प्रशिक्षण के समय को 98% तक कम कर देता है। कुछ मामलों में, जिसमें पहले 4,000 घंटे कंप्यूटर का समय लगता था, अब केवल 400 घंटे लगते हैं।
  • गुणवत्ता (Quality): जनरेट की गई इमेज पहले के तरीकों की तुलना में अधिक शार्प और रियलिस्टिक (कम FID स्कोर) हैं, भले ही वे कम स्टेप्स (35 के बजाय 1 या 2 स्टेप्स) का उपयोग करती हों।
  • स्थिरता (Stability): यह प्रशिक्षण प्रक्रिया को "डाइवर्ज" होने से (क्रैश होने या पागल होने से) रोकता है, जो शोधकर्ताओं के लिए पहले एक बड़ी समस्या थी।

एक सरल सादृश्य: गाड़ी चलाना सीखना

  • डिफ्यूजन मॉडल: पार्किंग लॉट में 10,000 घंटे अभ्यास करके गाड़ी चलाना सीखना, जहाँ आप 1 इंच आगे बढ़ते हैं, रुकते हैं, शीशे देखते हैं, फिर 1 इंच आगे बढ़ते हैं। सुरक्षित, लेकिन धीमा।
  • पुराना फ्लो मैप ट्रेनिंग: तुरंत 200 मील प्रति घंटे की रफ्तार से रेस कार चलाना सीखना। आप क्रैश हो जाएंगे।
  • CMT:
    1. आप एक पेशेवर ड्राइवर को ट्रैक पर गाड़ी चलाते हुए देखते हैं।
    2. मिड-ट्रेनिंग: आप बगल वाली सीट पर बैठते हैं और सीखते हैं: "अगर हम इस मोड़ पर हैं, तो फिनिश लाइन वहाँ है।" आप अभी तेज़ गाड़ी चलाए बिना मोड़ और फिनिश लाइन के बीच के संबंध को सीखते हैं।
    3. पोस्ट-ट्रेनिंग: अब आप स्टीयरिंग संभालते हैं। क्योंकि आप पहले से ही सड़क और फिनिश लाइन के बीच के संबंध को जानते हैं, आप बिना क्रैश हुए पूरी गति से रेस कार चला सकते हैं।

सारांश

यह पेपर इस समस्या का समाधान करता है कि AI इमेज जनरेटर को खराब बनाए बिना उन्हें तेज़ कैसे बनाया जाए। उन्होंने यह एक "मिडल स्कूल" चरण (मिड-ट्रेनिंग) डालकर किया है जहाँ मॉडल दौड़ शुरू करने से पहले यात्रा के नक्शे को पढ़ना सीखता है। यह पूरी प्रक्रिया को सस्ता, तेज़ और बहुत अधिक विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →