← नवीनतम पेपर
🤖 machine learning

Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders

यह शोध पत्र "ज्यामितीय हस्तक्षेप" (Geometric Interference) को मानक डिफ्यूजन ट्रांसफॉर्मर के प्रतिनिधित्व एनकोडर (representation encoders) पर अभिसरण (converge) करने में विफल होने के मौलिक कारण के रूप में पहचान करता है और जेकोबी नियमितीकरण (Jacobi Regularization) के साथ रिमानियन फ्लो मैचिंग (Riemannian Flow Matching - RJF) का प्रस्ताव करता है ताकि जनरेटिव प्रक्रियाओं को मैनिफोल्ड जियोडेसिक्स (manifold geodesics) तक सीमित किया जा सके, जिससे कम्प्यूटेशनल रूप से महंगे विड्थ स्केलिंग (width scaling) के बिना कुशल उच्च-निष्ठा संश्लेषण (high-fidelity synthesis) सक्षम हो सके।

मूल लेखक: Amandeep Kumar, Vishal M. Patel

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amandeep Kumar, Vishal M. Patel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "लर्निंग ऑन द मैनिफोल्ड" (Learning on the Manifold) पेपर का सरल अवधारणाओं, उपमाओं और रूपकों में दिया गया विवरण है।

बड़ी तस्वीर: "फ्लैट मैप" बनाम "ग्लोब" की समस्या

कल्पना कीजिए कि आप एक रोबोट को चित्र बनाना सिखाने की कोशिश कर रहे हैं। आमतौर पर, हम रोबोट को पिक्सेल के एक बिखरे हुए ढेर (जैसे एक धुंधली फोटो) को दिखाकर सिखाते हैं और उससे उन्हें साफ करने के लिए कहते हैं।

हाल ही में, शोधकर्ताओं ने एक स्मार्ट तरीका खोजा: रोबलेट को बिखरे हुए पिक्सेल दिखाने के बजाय, वे उसे एक "सिमेंटिक मैप" (एक उच्च-स्तरीय सारांश कि वह वस्तु क्या है, जैसे "एक कुत्ता" या "एक कार") दिखाते हैं। यह मैप एक प्री-ट्रेंड AI द्वारा बनाया जाता है जिसे "रिप्रेजेंटेशन एनकोडर" (जैसे DINO या SigLIP) कहा जाता है।

समस्या:
जब शोधकर्ताओं ने इन सिमेंटिक मैप्स का उपयोग करके रोबोट को नई छवियां बनाना सिखाने की कोशिश की, तो रोबोट विफल रहा। वह सीख नहीं पाया।

विफलता का पिछला स्पष्टीकरण यह था: "रोबोट पर्याप्त स्मार्ट नहीं है। हमें जटिल डेटा को संभालने के लिए रोबोट को बड़ा (चौड़ा/wider) बनाने की आवश्यकता है।"

पेपर की खोज:
यह पेपर तर्क देता है कि रोबोट छोटा नहीं है; बस उसे गलत तरीके से सिखाया जा रहा है। समस्या रोबोट के आकार की नहीं है; यह मैप की ज्यामिति (geometry) की है।

मुख्य उपमा: हूला-हूप बनाम कमरा

इस विफलता को समझने के लिए, कल्पना करें कि "सिमेंटिक मैप" एक सपाट कमरा नहीं है, बल्कि अंतरिक्ष में तैरता हुआ एक विशाल, अदृश्य हूला-हूप है।

  • वास्तविकता: सभी वैध जानकारी (सभी "कुत्ते" और "कार" की अवधारणाएं) सख्ती से इस हूला-हूप की सतह पर मौजूद है। यदि आप हूला-हूप से बाहर कदम रखते हैं, तो आप "कहीं नहीं की भूमि" (nowhere land) में पहुँच जाते हैं जहाँ कोई वैध अवधारणा मौजूद नहीं है।
  • गलती: मानक AI प्रशिक्षण विधि (जिसे "यूक्लिडियन फ्लो मैचिंग" कहा जाता है) यह मानती है कि दुनिया एक सपाट, खाली कमरा है। यह एक शुरुआती बिंदु से हूला-हूप तक एक सीधी रेखा खींचने की कोशिश करती है।
  • परिणाम: हूला-हूप पर बिंदु A से बिंदु B तक जाने के लिए, मानक विधि एक सीधी रेखा खींचती है जो हूला-हूप के अंदर की खाली हवा के माध्यम से कटती है।

यह AI को कैसे तोड़ता है:
AI को उस "खाली हवा" के माध्यम से चलने के लिए मजबूर किया जाता है जो हूला-हूप के अंदर है। लेकिन वहां कुछ भी नहीं है! यह वैसा ही है जैसे किसी ऐसी सड़क पर कार चलाना सीखने की कोशिश करना जो अस्तित्व में ही नहीं है। AI अपनी पूरी मानसिक शक्ति "कहीं नहीं" की भौतिकी (physics) को समझने में बर्बाद कर देता है, और वह हूला-हूप पर वास्तविक पथ को कभी नहीं सीख पाता।

समाधान: RJF (द "जियोडेसिक" गाइड)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे रिमानियन फ्लो मैचिंग विद जैकोबी रेगुलाइजेशन (RJF) कहा जाता है।

  1. रिमानियन फ्लो मैचिंग (वक्राकार पथ):
    सीधी रेखा के माध्यम से खाली हवा में जाने के बजाय, यह विधि AI को हूला-हूप की सतह के साथ चलने के लिए मजबूर करती है। गणितीय शब्दों में, यह जियोडेसिक (geodesic) (एक वक्र के साथ सबसे छोटा रास्ता) का अनुसरण करता है।
  • उपमा: कल्पना कीजिए कि आप न्यूयॉर्क से लंदन जा रहे हैं। एक सपाट मानचित्र कहता है "सीधे जाओ।" लेकिन पृथ्वी गोल है, इसलिए सबसे छोटा रास्ता समुद्र के ऊपर एक चाप (arc) है। RJF AI को पृथ्वी के केंद्र के माध्यम से सीधी रेखा खींचने के बजाय, उस चाप पर चलने के लिए मजबूर करता है।
  1. जैकोबी रेगुलाइजेशन (एक "ट्रैफिक लाइट" सिस्टम):
    भले ही आप वक्र पर चलें, फिर भी आप गलतियाँ कर सकते हैं। एक गोले (sphere) पर, यात्रा की शुरुआत में छोटी गलतियाँ आपको बाद में रास्ते से बहुत दूर ले जा सकती हैं (जैसे कैसे देशांतर की दो रेखाएं भूमध्य रेखा पर समानांतर शुरू होती हैं लेकिन उत्तरी ध्रुव पर मिल जाती हैं)।
  • सुधार: लेखक एक "वेटिंग सिस्टम" (जैकोली रेगुलाइजेशन) जोड़ते हैं जो AI को बताता है: "यात्रा के अंत के पास अपने कदमों पर अतिरिक्त ध्यान दें, क्योंकि वहीं छोटी गलतियाँ बढ़ जाती हैं।" यह AI को अपना रास्ता अधिक प्रभावी ढंग से ठीक करने में मदद करता है।

परिणाम: छोटा रोबोट, बड़ी जीत

इस पेपर का सबसे रोमांचक हिस्सा वह है जो उन्होंने इस नई विधि के साथ हासिल किया:

  • पुराना तरीका: इन मैप्स पर AI को काम करने के लिए, आपको एक विशाल, महंगी, "सुपर-वाइड" रोबोट बनाने की आवश्यकता थी (मॉडल की चौड़ाई को स्केल करना)।
  • नया तरीका (RJF): ज्यामिति को ठीक करके (AI को वक्र के बजाय सीधी रेखा के बजाय वक्र पर चलाने से), वे एक मानक, मध्यम आकार के रोबोट (DiT-B आर्किटेक्चर, 131 मिलियन पैरामीटर्स के साथ) का उपयोग करने में सक्षम थे।

परिणाम:

  • मानक रोबोट ने, नई विधि का उपयोग करते हुए, 3.37 का स्कोर (FID) प्राप्त किया, जो स्टेट-ऑफ-द-आर्ट है।
  • पुराना तरीका, भले ही एक विशाल रोबोट के साथ हो, कन्वर्ज (converge) होने में विफल रहा (वह बिल्कुल भी नहीं सीख सका)।
  • उन्होंने साबित कर दिया कि आपको बड़े रोबोट की आवश्यकता नहीं है; आपको बस उसे उस दुनिया के आकार का सम्मान करना सिखाने की आवश्यकता है जिसमें वह रहता है।

एक वाक्य में सारांश

यह पेपर दिखाता है कि AI उच्च-स्तरीय सिमेंटिक मैप्स से सीखने में इसलिए विफल नहीं होता क्योंकि वह बहुत छोटा है, बल्कि इसलिए विफल होता है क्योंकि वह खाली स्थान में सीधी रेखाओं में चलने की कोशिश कर रहा है; डेटा की घुमावदार सतह (RJF का उपयोग करके) के साथ चलने के लिए मजबूर करके, एक मानक आकार का AI भी सटीक छवियां उत्पन्न कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →