← नवीनतम पेपर
💻 computer science

Action Images: End-to-End Policy Learning via Multiview Video Generation

यह शोध पत्र "एक्शन इमेजेस" (Action Images) का परिचय देता है, जो एक एकीकृत वर्ल्ड एक्शन मॉडल है जो रोबोट पॉलिसी लर्निंग को 7-DoF एक्शन्स को पिक्सेल-ग्राउंडेड एक्शन वीडियो में अनुवादित करके मल्टीव्यू वीडियो जनरेशन के रूप में तैयार करता है, जिससे वीडियो बैकबोन बिना किसी अलग कंट्रोल मॉड्यूल के ज़ीरो-शॉट पॉलिसी के रूप में कार्य करने में सक्षम होता है और ज़ीरो-शॉट टास्क सफलता तथा वीडियो-एक्शन जनरेशन की गुणवत्ता दोनों में बेहतर प्रदर्शन प्राप्त करता है।

मूल लेखक: Haoyu Zhen, Zixian Gao, Qiao Sun, Yilin Zhao, Yuncong Yang, Yilun Du, Tsun-Hsuan Wang, Yi-Ling Qiao, Chuang Gan

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoyu Zhen, Zixian Gao, Qiao Sun, Yilin Zhao, Yuncong Yang, Yilun Du, Tsun-Hsuan Wang, Yi-Ling Qiao, Chuang Gan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका (द "ट्रांसलेटर" समस्या):
पारंपरिक रूप से, जब हम रोबोट को सिखाते हैं, तो हमारे पास दो अलग-अलग भाग होते हैं। पहले, एक "विज़न सिस्टम" दुनिया को देखता है और कहता है, "मुझे ब्रेड का एक टुकड़ा दिख रहा है।" फिर, एक अलग "ब्रेन" (पॉलिसी) को इस विज़ुअल जानकारी को संख्याओं के एक गुप्त कोड में अनुवाद करना होता है, और रोबोट के हाथ को बताना होता है कि उसे बिल्कुल कैसे हिलना है।

समस्या यह है कि यह वैसा ही है जैसे किसी व्यक्ति को मैप दिखाकर गाड़ी चलाना सिखाना और फिर उससे स्टीयरिंग व्हील के मूवमेंट का अनुमान लगाने के लिए कहना। यदि मैप थोड़ा अलग है (एक नया कमरा, या अलग रोशनी), तो "ब्रेन" भ्रमित हो जाता है क्योंकि उसे कभी स्टीयरिंग व्हील को चलते हुए देखना नहीं सिखाया गया था; उसने केवल अमूर्त (abstract) संख्याओं को सीखा था।

नया तरीका (एक्शन इमेजेस):
"एक्शन इमेजेस" नामक यह पेपर एक शानदार शॉर्टकट प्रस्तावित करता है। रोबोट की गति को संख्याओं में अनुवाद करने के बजाय, लेखक कहते हैं: "बस गति को ड्रा कर दो।"

वे रोबोट के 7-जॉइंट आर्म मूवमेंट को चमकते हुए डॉट्स के एक वीडियो में बदल देते हैं जो एक सामान्य वीडियो की तरह ही दिखता है।

रचनात्मक सादृश्य: द "घोस्टली पपेटियर" (एक काल्पनिक कठपुतली नचाने वाला)

कल्पना कीजिए कि आप एक रोबोटिक आर्म के हिलने का एक मूवी देख रहे हैं। अब, कल्पना कीजिए कि उस मूवी के ऊपर, प्रकाश से बनी एक भूतिया, चमकती हुई कठपुतली है जो रोबोट के हाथ की सटीक नकल करती है।

  • लाल रोशनी: दिखाती है कि रोबोट का हाथ कहाँ है।
  • हरी रोशनी: दिखाती है कि हाथ किस दिशा में इशारा कर रहा है।
  • नीली रोशनी: दिखाती है कि रोबोट की "उंगलियां" खुली हैं या बंद।

इस पेपर में, रोबोट केवल मूवी को देखता नहीं है; वह खुद उस चमकती कठपुतली के वीडियो को बनाना (जनरेट करना) सीखता है।

यह कैसे काम करता है (जादुई ट्रिक)

  1. एक बड़ा दिमाग, दो नहीं:
    एक "विज़न ब्रेन" और एक "मूवमेंट ब्रेन" होने के बजाय, यह मॉडल एक विशाल वीडियो जनरेटर का उपयोग करता है (जैसे वह AI जो नाचती हुई बिल्लियों के वायरल वीडियो बनाता है)।

    • सामान्यतः, ये AI यह अनुमान लगाने के लिए प्रशिक्षित होते हैं: "यदि मैं एक गेंद को बाईं ओर लुढ़कते हुए देखता हूँ, तो अगला फ्रेम कैसा दिखेगा?"
    • यह पेपर AI को सिखाता है: "यदि मैं एक गेंद को बाईं ओर लुढ़कते हुए देखता हूँ, और मैं उसके साथ चलती हुई एक चमकती लाल बिंदी देखता हूँ, तो अगला फ्रेम कैसा दिखेगा?"
  2. "पिक्सेल-ग्राउंडेड" का रहस्य:
    क्योंकि मूवमेंट को पिक्सेल (स्क्रीन पर डॉट्स) के रूप में ड्रा किया गया है, न कि अमूर्त संख्याओं के रूप में, AI को एक नई भाषा सीखने की आवश्यकता नहीं है। वह पहले से ही जानता है कि पिक्सेल को कैसे चलाना है क्योंकि उसे लाखों वीडियो पर प्रशिक्षित किया गया है।

    • सादृश्य: यह एक बच्चे को कार का आकार ट्रेस करके कार बनाना सिखाने जैसा है, बजाय इसके कि उसे पहियों के घूमने का गणितीय फॉर्मूला दिया जाए। बच्चा सीधे गति के आकार को सीखता है।
  3. "ज़ीरो-शॉट" सुपरपावर:
    "ज़ीरो-शॉट" का अर्थ है कि रोबोट बिना किसी अतिरिक्त प्रशिक्षण के वह कार्य कर सकता है जो उसने पहले कभी नहीं देखा है।

    • क्योंकि AI ने कई अलग-अलग कैमरा एंगल्स (मल्टीव्यू) में "चमकते डॉट्स" की गति को सीखा है, इसलिए वह मूवमेंट के 3D आकार को समझता है।
    • यदि आप उसे एक नया कमरा या नई वस्तु दिखाते हैं, तो वह घबराता नहीं है। वह बस कहता है, "ठीक है, मुझे इस लाल बिंदु को यहाँ से वहाँ ले जाना है," और वह स्वाभाविक रूप से रास्ता निकाल लेता है, ठीक वैसे ही जैसे वह एक वीडियो गेम में करेगा।

डिकोडर: मैप को वापस पढ़ना

एक बार जब AI चमकते डॉट्स का वीडियो जनरेट कर देता है, तो रोबोट वास्तव में कैसे चलता है?
पेपर में एक सरल "डिकोडर" शामिल है जो वीडियो में चमकते डॉट्स को देखता है और कहता है:

  • "लाल बिंदु X कोऑर्डिनेट पर है।"
  • "नीला बिंदु Y कोऑर्डिनेट पर है।"
  • "नीली तीव्रता (intensity) कम है, इसलिए ग्रिपर बंद है।"

यह ड्राइंग को वापस रोबोट के निर्देशों में बदल देता है। यह एक खजाने के नक्शे को देखने जैसा है जिसमें एक "X" का निशान है और आप जानते हैं कि ठीक कहाँ खुदाई करनी है।

यह एक बड़ी बात क्यों है

  • कोई "अनुवाद" त्रुटियाँ नहीं: मूवमेंट को विज़न (दृष्टि) की समान "भाषा" (पिक्सेल) में रखकर, रोबोट विज़न और एक्शन के बीच अनुवाद करते समय कोई जानकारी नहीं खोता है।
  • यह एक स्विस आर्मी नाइफ है: एक ही मॉडल एक साथ तीन चीजें कर सकता है:
    1. भविष्य की भविष्यवाणी करना: "यदि मैं यह करता हूँ, तो वीडियो कैसा दिखेगा?"
    2. एक्शन की योजना बनाना: "मैं चाहता हूँ कि यह वीडियो बने, तो मुझे क्या एक्शन लेना चाहिए?"
    3. एक्शन को लेबल करना: "मैं यह वीडियो देख रहा हूँ, तो कौन सा एक्शन किया गया था?"
  • सामान्यीकरण (Generalization): यह नए वातावरण में बेहतर काम करता है क्योंकि इसने केवल विशिष्ट कार्यों के गणित को नहीं, बल्कि विज़ुअली मूवमेंट के भौतिकी (physics) को सीखा है।

संक्षेप में

लेखकों ने महसूस किया कि रोबोटिक्स सिर्फ एक वीडियो गेम है। इस गेम को खेलने के लिए एक जटिल कंट्रोलर बनाने के बजाय, उन्होंने AI को गेमप्ले वीडियो को खुद जनरेट करना सिखाया। रोबोटिक एक्शन को चमकते डॉट्स के विज़ुअल "मूवी" में बदलकर, उन्होंने AI को अपनी प्राकृतिक वीडियो-जनरेशन शक्तियों का उपयोग करके वास्तविक रोबोट को नियंत्रित करने दिया, जिससे यह अधिक स्मार्ट, अधिक अनुकूलन योग्य और तुरंत नए करतब सीखने में सक्षम बन गया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →