← नवीनतम पेपर
🤖 AI

ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training

यह शोध पत्र ALOE को प्रस्तुत करता है, जो एक एक्शन-लेवल ऑफ-पॉलिसी इवैल्यूएशन फ्रेमवर्क है जो हेटेरोजेनियस रिप्ले बफर्स में बेमेल ऐतिहासिक डेटा की सीमाओं को दूर करने के लिए वर्तमान-पॉलिसी-विशिष्ट वैल्यू अनुमान उत्पन्न करके वास्तविक दुनिया के वातावरणों में विजन-लैंग्वेज-एक्शन मॉडल्स के स्थिर और प्रभावी पोस्ट-ट्रेनिंग को सक्षम बनाता है।

मूल लेखक: Rushuai Yang, Hecheng Wang, Zhichao Wu, Chiming Liu, Xiaohan Yan, Xuan Du, Shuoyu Yue, Chuheng Zhang, Yunlong Wang, Yongcheng Liu, Lizhe Qi, Yi Chen, Wei Shan, Maoqing Yao

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rushuai Yang, Hecheng Wang, Zhichao Wu, Chiming Liu, Xiaohan Yan, Xuan Du, Shuoyu Yue, Chuheng Zhang, Yunlong Wang, Yongcheng Liu, Lizhe Qi, Yi Chen, Wei Shan, Maoqing Yao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े अनाड़ी रोबोट को कपड़े तह करने या फोन जोड़ने जैसे जटिल काम करना सिखा रहे हैं। आप चाहते हैं कि रोबोट केवल आपकी नकल करके नहीं, बल्कि खुद चीज़ों को आज़माकर, असफल होकर और खुद बेहतर तरीका खोजकर सीखे। इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning - RL) कहा जाता है।

हालाँकि, वास्तविक दुनिया में रोबोट को सिखाना महंगा और धीमा है। यदि रोबोट एक फोन गिरा देता है, तो आपको उसे उठाना पड़ता है और दृश्य को फिर से सेट करना पड़ता है। आप रोबोट को वीडियो गेम की तरह लाखों बार प्रयास करने के लिए नहीं छोड़ सकते। इसलिए, रोबोट को एक "रीप्ले बफर" (replay buffer) से सीखना होगा जिसमें डेटा का एक मिला-जुला मिश्रण होता है:

  • आपके द्वारा कार्य को पूरी तरह से करने के वीडियो (डेमोंस्ट्रेशन)।
  • रोबोट के अपने पिछले प्रयास (कुछ अच्छे, कुछ बुरे)।
  • वे समय जब आपने किसी गलती को सुधारने के लिए हस्तक्षेप किया।

समस्या: "भ्रमित कोच" (The "Confused Coach")

यह पेपर तर्क देता है कि रोबोट को सिखाने के पुराने तरीके एक भ्रमित कोच की तरह थे।

जब रोबोट कुछ सीखने की कोशिश करता है, तो उसे एक "वैल्यू फंक्शन" (value function) की आवश्यकता होती है—यानी यह आंकने का एक तरीका कि कोई विशिष्ट चाल कितनी अच्छी है। पुराने तरीके डेटा के इस मिश्रण को देखते थे और कहते थे, "औसतन, इस प्रकार की चाल आमतौर पर सफलता की ओर ले जाती है।" लेकिन यह त्रुटिपूर्ण है क्योंकि डेटा अलग-अलग रोबोटों और एक ही रोबोट के अलग-अलग संस्करणों का एक मिला-जुला इतिहास है।

उपमा: कल्पना कीजिए कि एक छात्र गणित सीखने की कोशिश कर रहा है। शिक्षक उसे एक पाठ्यपुस्तक देता है जिसमें छात्र के गलत उत्तरों को शिक्षक के सही समाधानों के साथ मिला दिया गया है। यदि छात्र पूछता है, "क्या मेरा यह विशिष्ट कदम सही है?" और शिक्षक पूरे पुस्तक को देखकर कहता है, "खैर, आमतौर पर यह कदम काम करता है," तो छात्र भ्रमित हो जाता है। शिक्षक छात्र के वर्तमान कदम का न्याय नहीं कर रहा है; वह सभी के पिछले कदमों के औसत का न्याय कर रहा है। इससे छात्र गलत सबक सीखता है या अटक जाता है।

समाधान: ALOE (द "एक्शन-लेवल कोच")

लेखक एक नया सिस्टम प्रस्तावित करते हैं जिसे ALOE (Action-Level Off-Policy Evaluation) कहा जाता है। ALOE को एक तेज़ नज़र रखने वाले कोच के रूप में सोचें जो रोबोट के वर्तमान कदम को वास्तविक समय में देखता है और विशेष रूप से उसका न्याय करता है, न कि इतिहास की उलझी हुई किताब को देखता है।

यहाँ बताया गया है कि ALOE कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "चंक" रणनीति (बिंदुओं को जोड़ना)
वास्तविक जीवन में, "कपड़े तह करने" जैसा कार्य एक एकल चाल नहीं है; यह चालों का एक क्रम है (कोना पकड़ना, कपड़े को सीधा करना, तह करना)। यदि रोबोट को केवल अंत में "पुरस्कार" (एक थम्स अप) मिलता है, तो यह जानना कठिन होता है कि कौन सी विशिष्ट चाल असली हीरो थी।

  • ALOE की ट्रिक: केवल एक सेकंड के बजाय, ALOE क्रियाओं के चंक्स (chunks) (जैसे, 5 सेकंड का क्रम) का न्याय करता है। यह चाल की शुरुआत और परिणाम के बीच के बिंदुओं को जोड़ता है, जिससे रोबोट यह समझने में सक्षम होता है कि "कोने को धीरे से पकड़ना" ही अंतिम सफलता की कुंजी थी, भले ही पुरस्कार बहुत बाद में मिला हो।

2. "निराशावादी" सुरक्षा जाल (The "Pessimistic" Safety Net)
जब रोबोट कुछ ऐसा आज़माता है जो उसने पहले नहीं देखा है (जैसे, किसी नए प्रकार की शर्ट), तो वह अंदाज़ा लगा सकता है। पुराने सिस्टम अति-आत्मविश्वासी हो सकते हैं और कह सकते हैं, "बहुत बढ़िया काम!" जबकि रोबोट वास्तव में शर्ट गिराने ही वाला होता है।

  • ALOE की ट्रिक: ALOE एक "निराशावादी" दृष्टिकोण अपनाता है। यह चाल को रेट करने के लिए न्यायाधीशों के एक पैनल (क्रिटिक्स का एक समूह) से पूछता है। यदि एक भी जज अनिश्चित है या सोचता है कि चाल जोखिम भरी है, तो ALOE स्कोर को कम कर देता है। रोबोट को सुरक्षित रहने और यह कहने में बेहतर है कि "यह जोखिम भरा लग रहा है" बजाय इसके कि वह अति-आत्मविश्वासी होकर रोबोट को क्रैश कर दे। यह रोबोट को नई चीज़ों को आज़माते समय बुरी आदतें सीखने से रोकता है।

3. "एडवांटेज" स्कोर (The "Advantage" Score)
अंत में, ALOE रोबोट के वर्तमान कदम की तुलना इस बात से करता है कि रोबोट आमतौर पर क्या करता है।

  • उपमा: यदि रोबोट आमतौर पर शर्ट को बाजू (sleeve) से पकड़ता है (जिससे अक्सर विफलता होती है), लेकिन आज वह उसे हेम (hem/नीचे का किनारा) से पकड़ता है (जो काम करता है), तो ALOE उस विशिष्ट "हेम ग्रैब" को एक बड़ा बोनस स्कोर देता है। यह रोबोट को बताता है: "जो तुम आमतौर पर करते हो उसे करना बंद करो; इसके बजाय यही विशिष्ट चीज़ करो।"

परिणाम: वास्तविक दुनिया का प्रमाण

शोधकर्ताओं ने चार कठिन वास्तविक दुनिया के कार्यों पर ALOE का परीक्षण किया:

  1. स्मार्टफोन को बॉक्स में पैक करना
  2. कपड़े तह करना (रोबोट के लिए एक कठिन कार्य)।
  3. विभिन्न आकारों की कई वस्तुओं को छाँटना
  4. उच्च सटीकता के साथ फोन असेंबल करना

उन्होंने अन्य तरीकों (जैसे मानक "कॉपी करने" या पुराने वैल्यू-बेस्ड तरीकों) के मुकाबले ALOE की तुलना की।

  • परिणाम: ALOE हर बार जीता। इसने उच्च सफलता दर हासिल की, तेज़ी से सीखा, और उन चीज़ों को संभालने में बहुत बेहतर था जिन्हें उसने पहले कभी नहीं देखा था (जैसे नया फोन मॉडल या अलग आकार की शर्ट)।
  • यह क्यों सफल रहा: पेपर दिखाता है कि इसकी सफलता का मुख्य कारण रोबोट के वर्तमान कार्यों को आंकने का नया तरीका था, न कि अतीत की गलतियों और सफलताओं के उलझे हुए इतिहास पर निर्भर रहना।

सारांश

संक्षेप में, ALOE रोबोट को सिखाने का एक नया तरीका है। रोबोट को पुराने, उलझे हुए डेटा के मिश्रण से सीखने देने के बजाय, यह रोबोट को उसके वर्तमान कार्यों का एक स्पष्ट, तत्काल और सतर्क मूल्यांकन प्रदान करता है। यह रोबोट को वास्तविक दुनिया में जटिल, लंबे कार्यों को बहुत तेज़ी से और अधिक विश्वसनीय रूप से सीखने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →