← नवीनतम पेपर
🤖 machine learning

Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging

Any-OPD एक अभूतपूर्व ढांचा पेश करता है जो एक फ्रीज़्ड, मॉडल-अज्ञेय विज़न रिप्रेजेंटेशन और निरंतर नॉइज़-लेवल मैचिंग के माध्यम से उन्हें जोड़कर मनमाने लेटेंट फ्लो-मैचिंग मॉडल्स के बीच हेट्रोजेनियस ऑन-पॉलिसी डिस्टिलेशन को सक्षम बनाता है, जिससे एक 2.5B स्टूडेंट पारंपरिक लेटेंट रिग्रेशन की विफलता वाले क्षेत्रों में भी 12B टीचर के प्रदर्शन का मुकाबला करने में सक्षम होता है।

मूल लेखक: Siming Fu, Zheming Fu, Ruizhe He, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Haojun Xu

प्रकाशित 2026-08-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Siming Fu, Zheming Fu, Ruizhe He, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Haojun Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कलाकार केवल ब्रश से नहीं, बल्कि गणित से पेंट करते हैं। यह AI इमेज जनरेशन का क्षेत्र है, जहाँ कंप्यूटर लाखों उदाहरणों का अध्ययन करके शून्य से चित्र बनाना सीखते हैं। ऐसा करने के लिए, आधुनिक AI मॉडल फ्लो मैचिंग (flow matching) नामक एक चतुर तकनीक का उपयोग करते हैं। इसे एक ऐसी नदी की तरह समझें जो एक अराजक, शोर भरे झरने (शुद्ध स्टैटिक) से नीचे एक शांत, स्पष्ट झील (एक पूर्ण चित्र) की ओर बह रही है। AI उस नदी के सटीक मार्ग को सीखता है ताकि वह पानी की किसी भी बूंद को शोर से एक सुंदर चित्र तक निर्देशित कर सके।

हालाँकि, इसमें एक पेंच है। सबसे शक्तिशाली AI कलाकार विशाल, धीमी गति से चलने वाले हाथियों की तरह हैं: वे बहुत बड़े हैं, उन्हें चलाने के लिए सुपरकंप्यूटर की आवश्यकता होती है, और उन्हें एक एकल चित्र बनाने में बहुत समय लगता है। हम एक फुर्तीले गिलहरी जैसी गति और दक्षता चाहते हैं, लेकिन हम हाथी की कलात्मक प्रतिभा भी चाहते हैं। इसका समाधान है डिस्टिलेशन (distillation): एक छोटे, तेज़ छात्र मॉडल को एक बड़े, धीमे शिक्षक की नकल करना सिखाना। लेकिन यहाँ समस्या यह है कि आमतौर पर, शिक्षक और छात्र को बिल्कुल एक ही भाषा बोलनी चाहिए, एक ही आंतरिक मानचित्र का उपयोग करना चाहिए और एक ही घड़ी का पालन करना चाहिए। यदि वे AI के अलग-अलग "परिवारों" से हैं, तो वे अलग-अलग बोलियाँ बोलने या अलग-अलग टाइम ज़ोन में रहने के समान हैं। अब तक, एक गिलहरी को हाथी बनना सिखाना तब असंभव था जब उनके ब्लूप्रिंट पूरी तरह से अलग हों।

यह शोध पत्र Any-OPD पेश करता है, जो एक सार्वभौमिक अनुवादक और एक समय-बदलने वाले कोच की तरह कार्य करता है। शोधकर्ताओं ने पाया कि आपको एक-दूसरे से सीखने के लिए शिक्षक और छात्र को अपने आंतरिक मानचित्र या घड़ियों को साझा करने की आवश्यकता नहीं है। उनके गुप्त आंतरिक नोट्स की तुलना करने के बजाय (जो दूसरे के लिए निरर्थक होंगे), Any-OPD उन्हें उनके द्वारा बनाए गए अंतिम चित्रों की तुलना एक तीसरे पक्ष के "कला समीक्षक" (एक फ्रीज्ड विज़न मॉडल जिसे DINOv2 कहा जाता है) का उपयोग करके करने देता है जो पिक्सेल के बजाय छवि के अर्थ को समझता है।

टीम ने इसे एक छोटे, 2.5-बिलियन-पैरामीटर वाले छात्र मॉडल (SD3.5-Medium) को एक विशाल, 12-बिलियन-पैरामीटर वाले शिक्षक (FLUX.1-dev) की नकल करना सिखाकर परखा। ये दोनों मॉडल पूरी तरह से अलग हैं: वे अलग आंतरिक संरचनाओं, शोर को संभालने के अलग तरीकों और अलग शेड्यूल का उपयोग करते हैं। मानक विधियों ने उनके आंतरिक डेटा की सीधी तुलना करने की कोशिश की, जिससे प्रशिक्षण एक धुंधले मलबे में बदल गया। हालाँकि, Any-OPD ने इस प्रक्रिया को दरकिनार कर दिया क्योंकि इसने केवल एक साझा "मीनिंग स्पेस" (अर्थ स्थान) में अंतिम चित्रों की तुलना की।

परिणाम आश्चर्यजनक थे। छोटा छात्र, Any-OPD के साथ प्रशिक्षित होने के बाद, केवल थोड़ा बेहतर नहीं हुआ; वह एक मास्टर कलाकार बन गया। इसने उन छवियों को बनाने की अपनी क्षमता में सुधार किया जिन्हें मनुष्य पसंद करते हैं (जिसे PickScore नामक स्कोर से मापा जाता है) जो 0.846 से बढ़कर 0.884 हो गई, और इसका मानव प्राथमिकता स्कोर (HPSv3) 9.12 से बढ़कर 10.97 हो गया। वास्तव में, इस छोटे छात्र ने अपने विशाल 12-बिलियन-पैरामीटर वाले शिक्षक के प्रदर्शन की बराबरी करना, और कुछ मामलों में उससे भी आगे निकलना शुरू कर दिया, जबकि वह इसके एक अंश आकार और लागत पर काम कर रहा था।

यह शोध पत्र इस विचार को स्पष्ट रूप से खारिज करता है कि आप केवल कच्चे आंतरिक डेटा (latents) या छवियों के पिक्सेल-दर-पिक्सेल विवरण की तुलना कर सकते हैं जब मॉडल अलग हों। उन्होंने दिखाया कि अलग-अलग मॉडल परिवारों के बीच सीधे "पिक्सेल रिग्रेशन" करने की कोशिश करने से प्रशिक्षण पूरी तरह से विफल हो जाता है। इसके बजाय, उन्होंने सिद्ध किया कि छात्र को पहले एंकर (anchor) करके और फिर उनके चरणों को समय में संरेखित करने के लिए एक नॉइज़-लेवल मैचिंग सिस्टम का उपयोग करके, आप किन्से भी दो मॉडलों के बीच सफलतापूर्वक ज्ञान स्थानांतरित कर सकते हैं, चाहे वे कितने भी भिन्न क्यों न हों। यह सुझाव देता है कि भविष्य में, हम केवल एक विशाल AI तक सीमित नहीं रहेंगे; हम उपलब्ध सर्वश्रेष्ठ शिक्षक को ले सकते हैं, चाहे उसे किसी ने भी बनाया हो, और किसी भी छोटे मॉडल को तैनात करने के लिए उसे उतना ही अच्छा बनने के लिए सिखा सकते हैं जिसकी हमें आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →