← नवीनतम पेपर
🤖 machine learning

Post-Hoc Guidance for Consistency Models by Joint Flow Distribution Learning

यह शोध पत्र जॉइंट फ्लो डिस्ट्रीब्यूशन लर्निंग (JFDL) का प्रस्ताव करता है, जो एक हल्का पोस्ट-हॉक अलाइनमेंट (post-hoc alignment) तरीका है जो प्री-ट्रेंड कंसिस्टेंसी मॉडल्स को किसी अलग डिफ्यूजन मॉडल टीचर से नॉलेज डिस्टिलेशन की आवश्यकता के बिना प्रभावी क्लासिफायर-फ्री गाइडेंस करने में सक्षम बनाता है, जिससे जनरेशन की गुणवत्ता में महत्वपूर्ण सुधार होता है और वर्तमान कंसिस्टेंसी मॉडल विधियों के बीच एक प्रमुख अंतर को पाट दिया जाता है।

मूल लेखक: Chia-Hong Hsu, Randall Balestriero

प्रकाशित 2026-04-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chia-Hong Hsu, Randall Balestriero

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को पेंटिंग करना सिखाने की कोशिश कर रहे हैं।

समस्या: धीमा बनाम तेज़

AI आर्ट की दुनिया में, दो मुख्य प्रकार के रोबोट हैं:

  1. डिफ्यूजन मॉडल (धीमा, पूर्णतावादी चित्रकार): यह रोबोट अद्भुत है। यह एक मास्टरपीस बना सकता है, लेकिन इसमें बहुत समय लगता है। यह स्टैटिक (शोर/नॉइज़) से भरे कैनवास से शुरू करता है और धीरे-धीरे, स्टेप-दर-स्टेप, इसे साफ करता है जब तक कि एक तस्वीर उभर न आए। इस रोबोट को ठीक वैसा ही पेंट करने के लिए जैसा आप चाहते हैं (जैसे "टोपी पहने हुए एक बिल्ली"), आपको उसे एक विशेष "गाइडेंस" (मार्गदर्शन) नॉब देना होता है। लेकिन क्योंकि रोबोट बहुत धीमा है, उस नॉब को घुमाने से प्रक्रिया और भी धीमी हो जाती है।

  2. कंसिस्टेंसी मॉडल (तेज़, प्रभाववादी चित्रकार): यह रोबोट गति का बादशाह है। यह शोर से भरे कैनवास को देख सकता है और तुरंत एक या दो स्टेप्स में एक तैयार तस्वीर को अस्तित्व में ला सकता है। हालाँकि, एक पेच है: अधिकांश तेज़ रोबोटों को केवल "अपना सर्वश्रेष्ठ देने" के लिए प्रशिक्षित किया गया था, बिना किसी विशिष्ट निर्देश के। यदि आप चाहते हैं कि वे किसी विशिष्ट प्रॉम्प्ट (जैसे "एक बिल्ली") का पालन करें, तो उन्हें एक "शिक्षक" रोबोट (धीमे डिफ्यूजन मॉडल) का उपयोग करके शून्य से फिर से प्रशिक्षित करना पड़ता है, जो कि कैसे सीखना है। यह महंगा और जटिल है।

दुविधा: हमें तेज़ रोबोट की गति चाहिए, लेकिन हमें धीमे रोबोट का नियंत्रण भी चाहिए। अब तक, आप तेज़ रोबोट को निर्देशों को सुनने के लिए एक शिक्षक के साथ फिर से प्रशिक्षित किए बिना सीधे नहीं सिखा सकते थे। आपको इसे एक शिक्षक के साथ शुरू से बनाना पड़ता था।

समाधान: JFDL (तेज़ रोबोट के लिए "मानसिक जिम")

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे जॉइंट फ्लो डिस्ट्रीब्यूशन लर्निंग (JFDL) कहा जाता है। इसे एक चतुर "पोस्ट-हॉक" (बाद में किया जाने वाला) प्रशिक्षण सत्र के रूप में सोचें जो आपको पहले से प्रशिक्षित तेज़ रोबोट को निर्देशों को सुनने के लिए ट्यून करने की अनुमति देता है, बिना किसी धीमे शिक्षक के।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. "क्या होगा अगर" का खेल

कल्पना कीजिए कि तेज़ रोबोट एक बिखरे हुए कमरे (शोर वाली छवि) के सामने खड़ा है।

  • परिदृश्य A (कंडीशनल/शर्त आधारित): आप उसे कहते हैं, "इसे एक बिल्ली की तरह साफ करो।" रोबोट एक साफ बिल्ली तक पहुँचने का रास्ता कल्पना करता है।
  • परिści परिदृश्य B (अनकंडीशनल/बिना शर्त): आप उसे कहते हैं, "इसे साफ करो ताकि यह... कुछ भी लगे।" रोबोट एक सामान्य साफ कमरे का रास्ता कल्पना करता है।

पुराने दिनों में, तेज़ रोबोट केवल परिदृश्य A या परिदृश्य B को अलग-अलग जानता था। "गाइडेंस" प्राप्त करने के लिए, आपको उन्हें कैसे मिलाना है, यह दिखाने के लिए एक शिक्षक की आवश्यकता थी।

2. JFDL की ट्रिक: "घोस्ट" एंकर (भूतिया लंगर)

JFDL एक जादू की तरह है। यह रोबोट से कहता है:

  1. एक बिल्ली तक पहुँचने का रास्ता कल्पना करें।
  2. कुछ भी (भले ही रोबोट को इसे पूरी तरह से करने के लिए स्पष्ट रूप से प्रशिक्षित न किया गया हो) तक पहुँचने का रास्ता कल्पना करें।
  3. जादू: पेपर गणितीय रूप से सिद्ध करता है कि यदि आप "बिल्ली" वाले पथ और "कुछ भी" वाले पथ को लेते हैं, और उन्हें एक विशिष्ट तरीके से मिलाते हैं, तो "कुछ भी" वाला हिस्सा स्वाभाविक रूप से एक आदर्श "शोर" बेसलाइन के रूप में कार्य करता है। यह ऐसा है जैसे रोबोट शोर के गणित को देखकर "कुछ भी" वाले अनकंडीशनल पथ का एक "भूतिया" संस्करण कल्पना कर सकता है।

3. "स्टीयरिंग व्हील" (स्टीयरिंग पहिया)

एक बार जब रोबोट इन दोनों पथों को समझ लेता है, तो JFDL एक स्टीयरिंग व्हील (गाइडेंस स्केल, ω\omega) पेश करता है।

  • यदि आप पहिये को थोड़ा घुमाते हैं, तो रोबोट "बिल्ली" के पथ और "कुछ भी" के पथ को मिला देता है।
  • यदि आप इसे पूरा घुमा देते हैं, तो रोबोट "कुछ भी" वाले पथ को अनदेखा कर देता है और पूरी तरह से "बिल्ली" के पथ पर ध्यान केंद्रित करता है, जिससे छवि बहुत स्पष्ट और विशिष्ट (हाई फिडेलिटी) बनती है, लेकिन शायद कम विविधतापूर्ण होती है।
  • यदि आप इसे छोड़ देते हैं, तो यह एक सुखद मध्य मार्ग ढूंढ लेता है।

यह एक बड़ी बात क्यों है?

  • शिक्षक की आवश्यकता नहीं: आपको तेज़ रोबोट को सिखाने के लिए धीमे डिफ्यूजन मॉडल की आवश्यकता नहीं है। आप एक पहले से प्रशिक्षित तेज़ रोबोट को ले सकते हैं जो बस "अपना काम" कर रहा था और उसे निर्देशों को सुनने के लिए एक त्वरित, हल्का ट्यून-अप (JFDL) दे सकते हैं।
  • गति + नियंत्रण: आपको दोनों दुनियाओं का सर्वश्रेष्ठ मिलता है। आप पलक झपकते ही चित्र बना सकते हैं, लेकिन आप अभी भी नियंत्रित कर सकते हैं कि वे वास्तव में कैसे दिखते हैं।
  • बेहतर गुणवत्ता: पेपर दिखाता है कि इस तरीके का उपयोग करके, छवियां वास्तव में मूल अनगाइडेड रोबोट की तुलना में बेहतर दिखती हैं (कम FID स्कोर, जो गुणवत्ता का एक माप है)।

"नॉर्मलिटी" चेक

पेपर का एक डरावना हिस्सा "गौसियन नॉइज़" (Gaussian Noise) के बारे में गणित है। सरल शब्दों में, लेखकों को यह सिद्ध करना था कि रोबोट द्वारा कल्पना किया गया "भूतिया" पथ गणितीय रूप से "सामान्य" (जैसे कि एक आदर्श बेल कर्व) है। उन्होंने परीक्षण चलाए (एक सांख्यिकीय स्वास्थ्य जांच की तरह) और पुष्टि की: हाँ, रोबोट की "कुछ भी" की कल्पना सांख्यिकीय रूप से पूर्ण है। यह उन्हें इस विश्वास के साथ उपयोग करने का भरोसा देता है कि इसे स्टीयरिंग के लिए एक विश्वसनीय बेसलाइन के रूप में उपयोग किया जा सकता है।

सारांश

कंसिस्टेंसी मॉडल्स को एक ऐसी रेस कार के रूप में सोचें जो 200 मील प्रति घंटे की रफ्तार से चल सकती है लेकिन उसमें स्टीयरिंग व्हील नहीं है।
JFDL एक मैकेनिक है जो आता है, एक स्टीयरिंग व्हील लगाता है, और ड्राइवर को स्टीयर करना सिखाता है, बिना पूरी कार को फिर से बनाए या ड्राइविंग इंस्ट्रक्टर को नियुक्त किए। अब, कार अभी भी तेज़ है, लेकिन आप वास्तव में इसे वहां ले जा सकते हैं जहां आप चाहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →