← नवीनतम पेपर
🤖 AI

RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking

RankQ एक ऑफलाइन-टू-ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो संरचित क्रिया वरीयताओं (structured action preferences) को सीखने के लिए समान निराशावाद (uniform pessimism) को एक स्व-पर्यवेक्षित बहु-पद रैंकिंग हानि (self-supervised multi-term ranking loss) से प्रतिस्थापित करके नमूना दक्षता और नीति प्रदर्शन में सुधार करती है, जो स्पार्स रिवॉर्ड बेंचमार्क पर उत्कृष्ट परिणाम और विजन-आधारित रोबोट लर्निंग में महत्वपूर्ण सिम-टू-रियल ट्रांसफर लाभ प्रदर्शित करती है।

मूल लेखक: Andrew Choi, Wei Xu

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andrew Choi, Wei Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक रोबोट को बिना नुकसान पहुँचाए सिखाना

कल्पना कीजिए कि आप एक रोबोट को ब्लॉक (blocks) सजाना सिखाना चाहते हैं। आपके पास दो विकल्प हैं:

  1. ऑनलाइन लर्निंग (Online Learning): रोबोट को कोशिश करने दें, असफल होने दें, टकराने दें और शून्य से सीखने दें। यह धीमा, खतरनाक और महंगा है (जैसे किसी बच्चे को कार चलाना सिखाने के लिए उसे सड़क पर उतार देना)।
  2. ऑफलाइन लर्निंग (Offline Learning): रोबोट को किसी और को यह काम करते हुए दिखाने वाला वीडियो दिखाएं। रोबोट उस वीडियो से सीखता है लेकिन असली ब्लॉक्स को कभी छूता नहीं है। यह तेज़ और सुरक्षित है, लेकिन रोबोट बुरी आदतें सीख सकता है यदि वीडियो हिलता हुआ था या यदि वीडियो में दिख रहा व्यक्ति गलतियाँ कर रहा था।

RankQ एक नया तरीका है जो इन दोनों का सबसे अच्छा संगम पाने की कोशिश करता है। यह रोबोट को पहले वीडियो से सीखने देता है (Offline), और फिर इसे बेहतर होने के लिए वास्तविक दुनिया में अभ्यास करने देता है (Online)। समस्या यह है कि जब रोबोट अभ्यास करना शुरू करता है, तो वह अक्सर अपनी ही गलतियों या वीडियो के खराब हिस्सों से भ्रमित हो जाता है। RankQ रोबोट को केवल याद करने के बजाय, कार्यों को रैंक (rank) करना सिखाकर इस समस्या को ठीक करता है।


समस्या: "निराशावादी" कोच (The "Pessimist" Coach)

पिछले तरीकों (जैसे CQL और Cal-QL) ने "खराब वीडियो" वाली समस्या को हल करने के लिए एक निराशावादी कोच की तरह काम करने की कोशिश की।

  • वे कैसे काम करते थे: वे रोबोट से कहते थे, "जो कुछ भी तुमने वीडियो में नहीं देखा है, वह शायद खतरनाक है। इसलिए, यदि तुम कुछ नया करने की कोशिश करते हो, तो हम तुम्हें भारी दंड देंगे।"
  • खामी: यह तब अच्छा काम करता है जब वीडियो में बेहतरीन चालें दिखाई गई हों। लेकिन क्या होगा यदि वीडियो गलतियों से भरा हो? निराशावादी कोच कहता है, "कुछ भी नया मत करो क्योंकि वीडियो कहता है कि सब कुछ बुरा है।" यह रोबhel को कभी सुधार करने से रोक देता है। वह वीडियो में देखी गई बिल्कुल वैसी ही औसत दर्जे की चालें दोहराते हुए फंस जाता है, भले ही वह इससे बेहतर कर सकता हो।

समाधान: "रैंकिंग" कोच (RankQ)

RankQ कोचिंग के तरीके को बदल देता है। एक निराशावादी जो नई चीजों को दंडित करता है, के बजाय RankQ एक स्मार्ट रैंकिंग कोच की तरह काम करता है।

यह कहने के बजाय कि "नई चीजें बुरी हैं," यह कहता है, "चलो तुलना करते हैं। क्या यह नई चाल वीडियो में मौजूद चीज़ों से बेहतर है या बदतर?"

यहाँ बताया गया है कि RankQ रोबोट को कार्यों को रैंक करना कैसे सिखाता है:

  1. सफलता बनाम विफलता (Success vs. Failure): यह वीडियो को देखता है और "अच्छी चालों" (सफलताओं) को "बुरी चालों" (विफलताओं) से अलग करता है।
  2. "शोर" परीक्षण (The "Noise" Test): यह वीडियो से एक "अच्छी चाल" लेता है और उसमें थोड़ा सा बदलाव करता है (जैसे थोड़ा सा स्टैटिक शोर जोड़ना)। यह रोबोट को सिखाता है: "मूल सटीक चाल इस थोड़ी सी बिगड़ी हुई वर्शन से बेहतर है।"
  3. "अराजकता" परीक्षण (The "Chaos" Test): यह एक "अच्छी चाल" लेता है और उसे बहुत अस्त-व्यस्त या रैंडम बना देता है। यह रोबोट को सिखाता है: "थोड़ी सी बिगड़ी हुई वर्शन अभी भी इस पूरी अराजकता से बेहतर है।"
  4. "विफलता" परीक्षण (The "Failure" Test): भले ही वीडियो में कोई विफलता दिखाई गई हो, RankQ रोबोट को सिखाता है कि वीडियो की एक "बुरी चाल" भी पूरी तरह से रैंडम, मनगढ़ंत चाल से बेहतर है।

जादू: इन सापेक्ष रैंकिंग (relative rankings) को सीखकर, रोबोट एक मानसिक मानचित्र (एक "Q-landscape") बनाता है। इस मानचित्र पर, "अच्छी चालें" एक पहाड़ी के शिखर पर हैं, और "बुरी चालें" एक घाटी में हैं।

  • जब रोबोट एक नया कार्य करता है, तो उसे केवल "हाँ/नहीं" का उत्तर नहीं मिलता। उसे एक दिशा मिलती है।
  • गणित रोबोट को बताता है: "तुम यहाँ हो। शिखर (सफलता) तक पहुँचने के लिए, तुम्हें इस दिशा में आगे बढ़ना होगा।"

यह रोबोट को खराब वीडियो डेटा की "घाटी" से बाहर निकलने और ब्लॉक सजाने के नए, बेहतर तरीके खोजने की अनुमति देता है, भले ही मूल वीडियो गलतियों से भरा हो।


उन्होंने क्या टेस्ट किया (परिणाम)

शोधकर्ताओं ने दो प्रकार की चुनौतियों पर इसका परीक्षण किया:

1. "वीडियो गेम" टेस्ट (D4RL बेंचमार्क)

उन्होंने रोबोट सिमुलेशन कार्यों (जैसे एक चींटी जो भूलभुलैया में घूम रही है या एक हाथ जो पेन चला रहा है) का उपयोग किया।

  • परिणाम: RankQ ने सात अन्य शीर्ष तरीकों के बराबर या उनसे बेहतर प्रदर्शन किया। यह विशेष रूप रूप से उन कठिन भूलभुलैया को हल करने में अच्छा था जहाँ अन्य रोबोट फंस जाते थे।

2. "असली रोबोट" टेस्ट (Vision-Language-Action Models)

यह सबसे बड़ा परीक्षण है। उन्होंने एक परिष्कृत AI मॉडल (एक VLA) का उपयोग किया जो "देख" सकता है और भाषा के निर्देशों को "समझ" सकता है।

  • कम डेटा परिदृश्य (Low Data Scenario): उन्होंने रोबोट को अभ्यास के लिए बहुत कम डेटा (केवल 200 प्रयास) दिया।
    • अन्य तरीके: रुक गए। वे बहुत डर के कारण सुधार नहीं कर सके।
    • RankQ: सफल रहा। इसने अगले सबसे अच्छे तरीके की तुलना में सफलता दर में 42.7% का सुधार किया। इसने क्यूब्स को सजाने और चम्मचों को कटोरे में रखने के काम को बहुत बेहतर ढंग से सीखा।
  • उच्च डेटा परिदृश्य (High Data Scenario): उन्होंने रोबोट को बहुत सारा डेटा (800 प्रयास) दिया और कई अलग-अलग लाइटिंग स्थितियों और कैमरा एंगल का अनुकरण किया।
    • परिणाम: RankQ अभी भी सबसे तेज़ और सबसे सफल था। इसने प्रतिस्पर्धा की तुलना में 25.7% तेज़ी से कार्य पूरे किए।
  • वास्तविक दुनिया में स्थानांतरण (Real World Transfer): वे कंप्यूटर सिमुलेशन में प्रशिक्षित रोबोट को एक असली भौतिक रोबोट पर ले गए, जो एक वास्तविक लैब में है।
    • RankQ से पहले: रोबोट केवल 43.1% बार क्यूब को सजा पाता था।
    • RankQ के बाद: रोबोट ने क्यूब को 84.7% बार सफलतापूर्वक सजाया।

निष्कर्ष (The Takeaway)

RankQ को एक ऐसे तरीके के रूप में देखें जो रोबोट को केवल यह नहीं सिखाता कि क्या करना है, बल्कि यह भी सिखाता है कि वह जो कर रहा है उसका आकलन कैसे करना है

सिर्फ एक स्क्रिप्ट का आँख मूँदकर पालन करने या नई चीज़ें आज़माने से डरने के बजाय, RankQ रोबोट को एक दिशा-सूचक (compass) देता है। यह रोबोट को समझने में मदद करता है कि "विफलता से थोड़ा बेहतर होना" भी एक कदम ऊपर की ओर है, और "पूर्णता" ही लक्ष्य है। यह रोबोट को अपूर्ण डेटा से तेजी से सीखने और वास्तविक दुनिया में अभ्यास शुरू करने पर तेजी से सुधार करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →