← नवीनतम पेपर
💻 computer science

CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

यह शोध पत्र CreFlow प्रस्तुत करता है, जो एक नवीन ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो स्पार्स-रिवॉर्ड एम्बोडीड वीडियो डिफ्यूजन मॉडल में भौतिक बाधा उल्लंघन को प्रभावी ढंग से सुधारने के लिए एक कंपोजिशनल लीनियर टेम्पोरल लॉजिक-आधारित रिवॉर्ड मॉडल और विशिष्ट लॉस फंक्शन्स का उपयोग करता है, जिससे डाउनस्ट्रीम मैनिपुलेशन कार्यों की सफलता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Zhenyang Ni, Yijiang Li, Ruochen Jiao, Simon Sinong Zhan, Sipeng Chen, Zhenfei Yin, Minshuo Chen, Philip Torr, Zhaoran Wang, Qi Zhu

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenyang Ni, Yijiang Li, Ruochen Jiao, Simon Sinong Zhan, Sipeng Chen, Zhenfei Yin, Minshuo Chen, Philip Torr, Zhaoran Wang, Qi Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ CreFlow पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

बड़ी समस्या: वे रोबोट जो "भ्रम" (Hallucinate) पाल लेते हैं

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली कलाकार (एक वीडियो जनरेशन मॉडल) है जो एक रोबोटिक हाथ द्वारा कप उठाने और उसे दराज में रखने के सुंदर चित्र बना सकता है। वह कलाकार लाइटिंग को असली दिखाने और रोबोट के हाथ को चमकदार बनाने में माहिर है।

हालाँकि, इस कलाकार की एक कमी है: भौतिक विज्ञान (Physics)
कभी-कभी, कलाकार रोबोट के हाथ को मेज के आर-पार जाते हुए दिखाता है (जैसे कोई भूत हो), या कप बिना हिले-डुले जादू से मेज से दराज में टेलीपोर्ट हो जाता है। कलाकार के लिए, वह चित्र एकदम सही दिखता है। लेकिन यदि आप उस चित्र के आधार पर एक वास्तविक रोबोट बनाने की कोशिश करेंगे, तो वह तुरंत टकराकर खराब हो जाएगा।

वर्तमान तरीके इसे एक वीडियो के अंत में एक "स्कोर" दिखाकर ठीक करने की कोशिश करते हैं: "अच्छा काम किया!" या "बुरा काम किया!" समस्या यह है कि यह स्कोर बहुत अस्पष्ट है। यह एक शिक्षक की तरह है जो एक छात्र को उसके 10 पन्नों के निबंध पर केवल पेज 7 पर एक टाइपो (गलती) के कारण फेल कर देता है, लेकिन छात्र को यह नहीं बताता कि गलती कहाँ है। इसके बाद छात्र पूरे निबंध को फिर से लिखने की कोशिश करता है, जिससे अनजाने में पेज 1-6 के अच्छे हिस्से भी बिगड़ जाते हैं।

समाधान: CreFlow

लेखकों ने CreFlow (Corrective Reflow) नामक एक नया सिस्टम प्रस्तावित किया है। इसे एक स्मार्ट संपादक (Editor) के रूप में समझें जो केवल पास या फेल का ग्रेड नहीं देता, बल्कि एक जासूस की तरह काम करता है ताकि यह पता लगा सके कि वीडियो कहाँ और क्यों विफल हुआ, और फिर केवल उन्हीं विशिष्ट हिस्सों को ठीक करता है।

CreFlow इसे दो मुख्य चरणों में करता है:

1. "लॉजिक डिटेक्टिव" (कंपोजिशनल कंस्ट्रेंट मॉनिटर)

वीडियो को देखकर केवल यह अंदाजा लगाने के बजाय कि वह कैसा दिखता है, CreFlow रोबोट के कार्य को नियमों के एक सख्त सेट में बदल देता है, जो एक सुरक्षा गार्ड द्वारा उपयोग की जाने वाली चेकलिस्ट की तरह है।

  • उपमा: कल्पना कीजिए कि कार्य है "कप को दराज में रखना।"
    • नियम 1 (निरंतरता/Persistence): कप हर फ्रेम में मौजूद होना चाहिए। (कोई टेलीपोर्टेशन नहीं!)
    • नियम 2 (काइनेमैटिक्स/Kinematics): रोबोट का हाथ सुचारू रूप से चलना चाहिए। (दीवारों के आर-पार नहीं जाना चाहिए!)
    • नियम 3 (कारणता/Causality): कप अंदर जाने से पहले दराज खुलनी चाहिए।
    • नियम 4 (लक्ष्य/Goal): कप दराज के अंदर होना चाहिए।

सिस्टम वीडियो की इन नियमों के विरुद्ध जांच करता है। यदि वीडियो विफल होता है, तो सिस्टम केवल "फेल" नहीं कहता। यह उंगली उठाकर कहता है: "आप फ्रेम 15 पर नियम 2 में विफल रहे क्योंकि हाथ मेज के आर-पार चला गया।" यह एक मास्क (एक डिजिटल हाइलाइटर) बनाता है जो केवल रोबोट के हाथ और मेज को कवर करता है, बैकग्राउंड, लाइटिंग या कप के रंग को अनदेखा कर देता है।

2. "स्मार्ट एडिटर" (दो-भाग वाला प्रशिक्षण)

एक बार जब सिस्टम जान जाता है कि गलती कहाँ हुई है, तो वह बाकी हिस्से को खराब किए बिना वीडियो को ठीक करने के लिए दो चतुर तकनीकों का उपयोग करता है।

भाग अ: "क्रेडिट-अवेयर" सुधार (अच्छे हिस्से को न छुएं)

  • पुराना तरीका: यदि कोई वीडियो विफल होता है, तो पुराने तरीके AI को बेहतर स्कोर पाने के लिए वीडियो के हर एक पिक्सेल को बदलने के लिए कहते हैं। यह एक टाइपो के कारण पूरे 10 पन्नों के निबंध को फिर से लिखने जैसा है। इससे समय बर्बाद होता है और अक्सर अच्छे हिस्से भी खराब हो जाते हैं।
  • CreFlow का तरीका: "लॉजिक डिटेक्टिव" से मिले "हाइलाइटर" का उपयोग करते हुए, CreFlow AI को बताता है: "केवल इस हाइलाइट किए गए बॉक्स (रोबोट का हाथ और मेज) के भीतर के पिक्सेल को बदलें। बाकी के वीडियो को बिल्कुल वैसा ही रहने दें जैसा वह है।"
  • परिणाम: बैकग्राउंड सुंदर और स्थिर रहता है, जबकि रोबोट सही ढंग से चलना सीखता है।

भाग ब: "ग्रुप हग" सुधार (सफलता से सीखें)

  • पुराना तरीका: जब AI विफल होता है, तो वह कल्पना करके अनुमान लगाता है कि एक "अच्छा" वीडियो कैसा दिखता होगा। यह अक्सर एक अस्थिर अनुमान होता है।
  • CreFlow का तरीका: कल्पना कीजिए कि AI पहेली को 10 बार हल करने की कोशिश करता है। 7 बार वह विफल होता है, लेकिन 3 बार सफल होता है। अनुमान लगाने के बजाय, CreFlow उन 3 सफल वीडियो को देखता है, उन्हें एक साथ जोड़कर एक "परफेक्ट उदाहरण" बनाता है, और विफल वीडियो को बताता है: "इस परफेक्ट उदाहरण को देखें। हाइलाइट किए गए क्षेत्र में सफल वीडियो ने बिल्कुल वैसे ही कैसे काम किया, उसकी नकल करें।"
  • परिणाम: AI बहुत तेज़ी से सीखता है क्योंकि उसे केवल यह बताने के बजाय कि क्या नहीं करना है, एक स्पष्ट और वास्तविक सफलता का उदाहरण दिखाया जा रहा है।

परिणाम

लेखकों ने इस परीक्षण को आठ अलग-अलग रोबोट कार्यों (जैसे कटोरे रखना या बोतलों को बिन में डालना) पर परखा।

  • बेहतर निर्णय: CreFlow का "लॉजिक डिटेक्टिव" पिछले तरीकों की तुलना में वास्तविक विफलताओं को पहचानने में बहुत बेहतर था, जो 88% बार मानवीय निर्णय के समान था।
  • बेहतर रोबोट: जब उन्होंने वीडियो मॉडल को प्रशिक्षित करने के लिए CreFlow का उपयोग किया, तो रोबोट वास्तव में भौतिक कार्यों में पहले की तुलना में 23.8% अधिक बार सफल हुए।

सारांश

CreFlow एक ऐसे शिक्षक की तरह है जो अस्पष्ट ग्रेड देना बंद कर देता है। इसके बजाय, यह रोबोट की योजना में सटीक गलती खोजने के लिए एक तार्किक चेकलिस्ट का उपयोग करता है, केवल उस गलती को हाइलाइट करता है, और रोबोट को उसे ठीक करने के लिए एक आदर्श उदाहरण दिखाता है, जिससे बाकी सब कुछ वैसा ही रहता है। यह रोबोट को तेज़ी से सीखने में मदद करता है और उसे असंभव भौतिकी (physics) के "भ्रम" पालने से रोकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →