← नवीनतम पेपर
🤖 machine learning

TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance

TimeRewarder एक स्केलेबल विधि है जो फ्रेम-वार टेम्पोरल दूरियों को मॉडल करके पैसिव वीडियो से डेंस रिवॉर्ड सिग्नल सीखती है, जिससे सुदृढीकरण सीखने वाले (reinforcement learning) एजेंट स्पार्स-रिवॉर्ड रोबोटिक कार्यों पर उच्च सैंपल दक्षता के साथ और बिना मैनुअल रिवॉर्ड इंजीनियरिंग के लगभग पूर्ण सफलता प्राप्त करने में सक्षम होते हैं।

मूल लेखक: Yuyang Liu, Chuan Wen, Yihang Hu, Dinesh Jayaraman, Yang Gao

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuyang Liu, Chuan Wen, Yihang Hu, Dinesh Jayaraman, Yang Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कॉफी का एक बेहतरीन कप बनाना सिखाने की कोशिश कर रहे हैं। रोबोट बुद्धिमान है, लेकिन उसे अभी तक यह नहीं पता कि इसे कैसे करना है।

रोबोटिक्स की दुनिया में, एक रोबोट को सिखाने के लिए आमतौर पर एक मानव शिक्षक को एक बहुत ही विशिष्ट नियम पुस्तिका (जिसे "रिवॉर्ड फंक्शन" कहा जाता है) लिखने की आवश्यकता होती है। शिक्षक को कहना होगा, "यदि आप कप को 1 इंच बाईं ओर ले जाते हैं, तो 1 अंक प्राप्त करें। यदि आप कॉफी गिरा देते हैं, तो 100 अंक काट लें।" यह अविश्वसनीय रूप से कठिन, समय लेने वाला और अक्सर असंभव होता है। यदि नियम थोड़े भी गलत हो जाएं, तो रोबोट या तो गलत चीज़ सीख लेता है या पूरी तरह से हार मान लेता है।

TimeRewarder एक नया तरीका है जो इस समस्या का समाधान करता है। यह रोबोट को वीडियो देखकर सीखने की अनुमति देता है, ठीक वैसे ही जैसे एक मानव प्रशिक्षु (apprentice) एक मास्टर बरिस्ता को देखकर सीखता है।

यह कैसे काम करता है, यहाँ सरल उपमाओं के साथ समझाया गया है:

1. समस्या: "मूक" (Silent) वीडियो

आमतौर पर, जब हम किसी को कॉफी बनाते हुए देखते हैं, तो हम क्रियाएं (जैसे डालना, मिलाना) तो देखते हैं, लेकिन हम स्कोर नहीं देख पाते। वीडियो रोबोट को यह नहीं बताता कि, "अच्छा काम किया, आप काम पूरा होने के 5% करीब हैं।" इस फीडबैक के बिना, रोबोट एक ऐसे छात्र की तरह है जो बिना उत्तर कुंजी (answer key) के परीक्षा दे रहा है; उसे अंत तक पता नहीं चलता कि वह बेहतर कर रहा है या खराब हो रहा है (जब तक कि कॉफी आखिरकार बन नहीं जाती या गिर नहीं जाती)।

2. समाधान: "टाइम-ट्रैवल" जासूस

TimeRewarder एक वीडियो को देखता है और एक सरल प्रश्न पूछता है: "समय में इन दो क्षणों के बीच कितनी दूरी है?"

  • उपमा: कल्पना कीजिए कि आप एक व्यक्ति को पहाड़ी पर चढ़ते हुए देखने का एक वीडियो देख रहे हैं।
    • यदि आप एक फ्रेम देखते हैं जहाँ वे नीचे हैं और एक फ्रेम जहाँ वे ऊपर हैं, तो TimeRewarder सीखता है कि ये समय में दूर (far apart) हैं।
    • यदि आप दो फ्रेम देखते हैं जहाँ वे बस एक कदम चल रहे हैं, तो TimeRewarder सीखता है कि ये समय में बहुत करीब (very close) हैं।
    • यदि व्यक्ति फिसल जाता है और पहाड़ी से नीचे की ओर लुढ़क जाता है, तो TimeRewarder सीखता है कि यह नकारात्मक समय (negative time) है (पीछे की ओर जाना)।

समय की इस "दूरी" का अनुमान लगाकर, रोबोट स्वचालित रूप से प्रगति (progress) को समझ जाता है। वह समझ जाता है: "आह, जिस फ्रेम में कप आधा भरा है, वह उस फ्रेम की तुलना में लक्ष्य के अधिक करीब है जिसमें वह खाली है।"

3. समय को अंकों में बदलना (The Reward)

एक बार जब रोबोट "समय की दूरी" को समझ लेता है, तो वह हर एक कदम के लिए एक स्कोर में बदल देता है।

  • आगे बढ़ रहे हैं? आपको थोड़े सकारात्मक अंक मिलते हैं।
  • स्थिर हैं? आपको शून्य अंक मिलते हैं।
  • पीछे जा रहे हैं (फिसल रहे हैं)? आपको नकारात्मक अंक मिलते हैं।

यह एक सघन पुरस्कार (dense reward) बनाता है। कार्य के अंत में "अच्छा काम किया!" या "असफल!" मिलने का इंतज़ार करने के बजाय, रोबोट को हर एक क्षण में एक छोटा सा "अच्छा काम किया!" या "फिर से प्रयास करें" का संकेत मिलता है। यह एक GPS की तरह है जो केवल यह नहीं कहता कि "आपने मोड़ छोड़ दिया," बल्कि लगातार फुसफुसाता रहता है, "आप मार्ग से 10 फीट दूर हैं, अब बाईं ओर मुड़ें," और लगातार मार्गदर्शन करता है।

4. यह विशेष क्यों है: "उल्टा" (Backwards) वाला तरीका

अधिकांश AI तरीके यह अनुमान लगाने की कोशिश करते हैं कि "लक्ष्य" कैसा दिखता है। TimeRewarder इसलिए चतुर है क्योंकि इसे पहले से लक्ष्य जानने की आवश्यकता नहीं है। यह बस इतना जानता है कि समय आगे बढ़ता है।

  • उपमा: कल्पना कीजिए कि आप एक कांच के टूटने का वीडियो देख रहे हैं। भले ही आप नहीं जानते कि वह क्यों टूटा, आप जानते हैं कि फर्श पर बिखरे हुए टुकड़े कांच के साबुत होने के बाद आए।
  • TimeRewarder इसी तर्क का उपयोग करता है। यदि रोबोट कुछ ऐसा करने की कोशिश करता है जो कार्य को "उल्टा करने" जैसा दिखता है (जैसे नट को खोलने के बजाय उसे वापस लगा देना), तो मॉडल पहचान लेता है कि यह "समय में पीछे जाने" जैसा है और इसे नकारात्मक स्कोर देता है। यह रोबोट को बिना किसी के यह बताए कि गलती क्या है, गलतियाँ करने से रोकता है।

5. परिणाम: अजनबियों से सीखना

शोधकर्ताओं ने इसका परीक्षण 10 अलग-अलग रोबोट कार्यों (जैसे दराज खोलना, बटन दबाना, या बास्केटबॉल खेलना) पर किया।

  • जादू: उन्होंने रोबोट को मनुष्यों द्वारा किए गए कार्यों के वीडियो दिखाए (भले ही वे अलग कैमरों या कोणों से लिए गए हों)। रोबोट ने पहले कभी मानव हाथ नहीं देखा था, केवल रोबोट का हाथ देखा था।
  • परिणाम: रोबोट ने उन रोबोटों की तुलना में तेजी से और बेहतर सीखा जिन्हें जटिल नियम पुस्तिकाएं लिखने वाले मनुष्यों द्वारा सिखाया गया था। वास्तव में, 10 में से 9 कार्यों में, रोबोट ने केवल 200,000 प्रयासों में कार्य को पूरी तरह से करना सीख लिया, जो "परफेक्ट" मानव-निर्मित नियमों को भी पीछे छोड़ गया।

सारांश

TimeRewarder एक ऐसे रोबोट की तरह है जो एक फिल्म देखकर और कहानी को सहजता से समझकर सीखता है। इसे स्क्रिप्ट राइटर की आवश्यकता नहीं है जो इसे बताए कि "सही" चालें क्या हैं। यह बस इतना समझता है कि समय आगे की ओर बहता है, और यदि यह कहानी की दिशा में आगे बढ़ता है, तो यह अच्छा कर रहा है। यदि यह पीछे की ओर जाता है, तो यह बुरा कर रहा है।

यह रोबोट को सिखाना बहुत सस्ता, तेज़ और स्केलेबल बनाता है, क्योंकि अब हम उन्हें नए कौशल सिखाने के लिए इंटरनेट से कोई भी वीडियो उपयोग कर सकते हैं, बजाय इसके कि उन्हें यह बताने के लिए महीनों तक कोड लिखा जाए कि उन्हें कैसे हिलना-डुलना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →