Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning
यह शोध पत्र VOTP को प्रस्तुत करता है, जो एक अर्ध-पर्यवेक्षित (semi-supervised) फ्रेमवर्क है जो न्यूनतम मानवीय फीडबैक से उच्च-सटीक छद्म-लेबल (pseudo-labels) उत्पन्न करने के लिए वीडियो फाउंडेशन मॉडल और ऑप्टिमल ट्रांसपोर्ट का लाभ उठाता है, जिससे ऑफलाइन प्राथमिकता-आधारित सुदृढीकरण सीखने (offline preference-based reinforcement learning) के लिए कुशल और सुदृढ़ रिवॉर्ड लर्निंग सक्षम होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कोई जटिल कार्य करना सिखाने की कोशिश कर रहे हैं, जैसे कि दराज खोलना या लड़खड़ाए बिना चलना। रोबोटिक्स की दुनिया में, रोबोट को एक "रिवॉर्ड सिस्टम" (पुरस्कार प्रणाली) की आवश्यकता होती है ताकि उसे पता चल सके कि वह क्या सही कर रहा है। आमतौर पर, मानव इंजीनियरों को बड़ी मेहनत से कोड लिखना पड़ता है ताकि वे रोबोट को बता सकें, "अच्छा काम किया, तुमने अपना हाथ ऊपर उठाया," या "बुरा काम किया, तुमने वस्तु गिरा दी।" यह उस व्यंजन की रेसिपी लिखने जैसा है जिसे आपने पहले कभी नहीं पकाया है; यह कठिन है, और हो सकता है कि आप निर्देश गलत लिख दें।
इसे ठीक करने के लिए, वैज्ञानिक प्रिफरेंस-बेस्ड रीइन्फोर्समेंट लर्निंग (PbRL) का उपयोग करते हैं। कोड लिखने के बजाय, वे रोबोट को दो वीडियो दिखाते हैं जिसमें वह कार्य कर रहा होता है और एक इंसान से पूछते हैं, "इनमें से कौन सा बेहतर दिखता है?" रोबोट इन विकल्पों से सीखता है।
समस्या:
इंसान को वीडियो देखने और उनमें से "बेहतर" वाले को चुनने के लिए कहना धीमा और महंगा है। रोबोट को अच्छी तरह से सिखाने के लिए, आपको शायद हजारों तुलनाओं की आवश्यकता होगी। यह एक बच्चे को साइकिल चलाना सिखाने जैसा है जहाँ हर बार उसके डगमगाने पर उसे रोककर पूछना, "क्या वह अच्छा था?" इसमें बहुत समय लगता है।
समाधान: VOTP
यह शोध पत्र एक नई विधि पेश करता है जिसे VOTP (वीडियो-बेस्ड ऑप्टिमल ट्रांसपोर्ट प्रिफरेंस) कहा जाता है। VOTP को एक चतुर शिक्षण सहायक (टीचिंग असिस्टेंट) के रूप में समझें जो आपको बहुत कम मानवीय प्रश्नों के साथ रोबोट को सिखाने में मदद करता है।
यह इस प्रकार काम करता है, एक सरल उपमा (analogy) का उपयोग करते हुए:
1. "स्मार्ट आँख" (वीडियो फाउंडेशन मॉडल्स)
सबसे पहले, VOTP एक पूर्व-प्रशिक्षित "स्मार्ट आँख" (वीडियो फाउंडेशन मॉडल) का उपयोग करता है। कल्पना कीजिए कि इस आँख ने लाखों घंटों के मानव वीडियो देखे हैं—लोग नाच रहे हैं, खाना बना रहे हैं, दौड़ रहे हैं और खेल रहे हैं। क्योंकि इसने बहुत कुछ देखा है, यह समझता है कि "अच्छा मूवमेंट" कैसा दिखता है, भले ही इसने पहले कभी रोबोट न देखा हो। यह एक वीडियो को एक गणितीय "फिंगरप्रिंट" में बदल सकता है जो क्रिया के सार को पकड़ लेता है।
2. "मैचमेकर" (ऑप्टिमल ट्रांसपोर्ट)
यही जादुई हिस्सा है।
- सेटअप: आप सिस्टम को उदाहरणों का एक छोटा सा समूह देते हैं (मान लीजिए 10 वीडियो जोड़े) जहाँ एक इंसान ने पहले ही कहा है, "वीडियो A, वीडियो B से बेहतर है।"
- डेटा का पहाड़: आपके पास अनलेबल (unlabeled) वीडियो का एक विशाल पहाड़ भी है (हजारों जोड़े) जहाँ अभी तक किसी इंसान ने कुछ नहीं कहा है।
- मैचमेकिंग: VOTP एक गणितीय उपकरण का उपयोग करता है जिसे ऑप्टिमल ट्रांसपोर्ट कहा जाता है। कल्पना कीजिए कि आपके पास अपने 10 मानवीय उदाहरणों से "अच्छे" फिंगरप्रिंट्स का एक ढेर है। अब, आपके पास "अज्ञात" फिंगरप्रिंट्स का एक बड़ा ढेर है जो अनलेबल वीडियो से आते हैं।
- संबंध: ऑप्टिमल ट्रांसपोर्ट एक सुपर-एफिशिएंट मैचमेकर की तरह काम करता है। यह एक "अज्ञात" वीडियो को देखता है और पूछता है, "यह उन 10 मानव-अनुमोदित वीडियोओं में से किससे सबसे अधिक मिलता-जुलता है?" यह केवल अनुमान नहीं लगाता; यह अज्ञात वीडियो को ज्ञात वीडियो से जोड़ने का सबसे अच्छा तरीका गणना करता है, यह इस आधार पर कि उनके "फिंगरप्रिंट" कितने समान हैं।
3. "इन्फरेंस" (स्यूडो-लेबल्स)
एक बार जब मैचमेकर एक अज्ञात वीडियो को एक ज्ञात "अच्छे" वीडियो से जोड़ देता है, तो VOTP कहता है, "यदि यह अज्ञात वीडियो उस वीडियो जैसा दिखता है जिसे इंसान ने पसंद किया था, तो यह अज्ञात वीडियो भी अच्छा ही होगा!" यह स्वचालित रूप से उन हजारों वीडियो को एक लेबल (एक "स्यूडो-लेबल") असाइन कर देता है जिन्हें देखने का आपके पास समय नहीं था।
4. परिणाम
अब, केवल 10 मानवीय उदाहरणों के साथ रोबोट को सिखाने के बजाय, रोबोट 10 मानवीय उदाहरणों और हजारों स्वचालित रूप से लेबल किए गए उदाहरणों से सीखता है। रोबोट बहुत तेज़ी से और बेहतर तरीके से सीखता है, भले ही आपने केवल थोड़े से मानवीय सहयोग के लिए पूछा हो।
इस शोध पत्र ने क्या पाया
लेखकों ने इसका परीक्षण उन रोबोटों पर किया जिन्हें चलना (लोकोमोशन) था और उन रोबोटों पर जिन्हें वस्तुओं को हिलाना (मैनिपुलेशन) था। उन्होंने प्रयोगशाला में एक वास्तविक रोबोटिक हाथ पर भी इसका परीक्षण किया।
- कम मानवीय कार्य: VOTP ने केवल कुछ ही मानवीय लेबल (कभी-कभी केवल 10) के साथ शीर्ष परिणाम प्राप्त किए।
- बाकी सब से बेहतर: इसने अन्य तरीकों को हराया जो समान परिणाम प्राप्त करने के लिए सैकड़ों या हजारों लेबल की आवश्यकता रखते थे।
- मजबूती (Robustness): भले ही रोशनी बदल गई हो या बैकग्राउंड में ध्यान भटकाने वाली चीजें (जैसे रोबोट के पीछे टीवी पर चल रहा वीडियो) हों, VOTP फिर भी समझ गया कि क्या अच्छा था और क्या बुरा।
- वास्तविक दुनिया: जब उन्होंने एक वास्तविक रोबोटिक हाथ पर केला उठाने या दराज खोलने का परीक्षण किया, तो VOTP ने उन तरीकों की तुलना में बहुत अधिक बार सफलता प्राप्त की जो केवल कुछ मानवीय लेबल पर निर्भर थे।
संक्षेप में: VOTP रोबोट को सिखाने का एक तरीका है जिससे आप उन्हें कुछ उदाहरण दिखाते हैं कि इंसान क्या पसंद करते हैं, और फिर एक "स्मार्ट आँख" और एक "गणितीय मैचमेकर" का उपयोग करके वे खुद ही तय कर लेते हैं कि बाकी वीडियो के लिए रोबोट को क्या करना चाहिए। यह इंसानों को हजारों वीडियो को लेबल करने के उबाऊ और दोहराव वाले काम से बचाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।