SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation
यह शोध पत्र SeeQ को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो जटिल, लंबी अवधि के रोबोटिक हेरफेर कार्यों के लिए ऑफलाइन डेटा का उपयोग करके लंबी क्रेडिट-असाइनमेंट क्षितिज (long credit-assignment horizons) की समस्या को दूर करने और पॉलिसी स्टीयरिंग में सुधार करने के लिए प्राकृतिक भाषा में सक्रिय उप-कार्यों (active subtasks) की ऑटोरेग्रेसिव रूप से भविष्यवाणी करके सामान्यज्ञ वैल्यू फंक्शन्स (generalist value functions) को प्रशिक्षित करता है।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: SeeQ: दीर्घ-क्षितिज (Long-Horizon) रोबोटिक हेरफेर के लिए जनरललिस्ट वैल्यू फंक्शन्स को प्रशिक्षित करना
समस्या विवरण
जनरललिस्ट रोबोट नीतियां, जिन्हें अक्सर इमिटेशन लर्निंग (Imitation Learning) के माध्यम से प्रशिक्षित किया जाता है, जटिल, दीर्घ-क्षितिज (long-horizon) हेरफेर कार्यों के साथ संघर्ष करती हैं। इन कार्यों में अक्सर कई चरण शामिल होते हैं या सफलता के लिए विशिष्ट चरणों पर बार-बार प्रयास और विचार की आवश्यकता होती है। ऐसी सेटिंग्स में, त्रुटियां समय के साथ संचित (compound) होती हैं, और रिकवरी व्यवहार (recovery behaviors) विशेषज्ञ डेटासेट में कम प्रतिनिधित्व पाते हैं। जबकि Q-वैल्यू फंक्शन्स (Q-value functions) उम्मीदवार क्रियाओं को रैंक करने के माध्यम से नीतियों को निर्देशित करने के लिए एक तंत्र प्रदान करते हैं, उन्हें दीर्घ-क्षितिज कार्यों के लिए सीखना चुनौतीपूर्ण है। मानक दृष्टिकोणों को तीन मुख्य बाधाओं का सामना करना पड़ता है:
- दीर्घ क्रेडिट-असाइनमेंट क्षितिज (Long Credit-Assignment Horizons): टास्क-लेवल रिवॉर्ड्स (कार्य के बिल्कुल अंत में सफलता/विफलता) से सीखने के लिए लंबी अनुक्रमों (sequences) पर संकेतों को प्रसारित करने की आवश्यकता होती है, जिससे कठिन बेलमैन बैकअप (Bellman backups) उत्पन्न होते हैं।
- डेटा कवरेज (Data Coverage): ऑफलाइन डेटासेट्स में अक्सर लंबी ट्राजेक्टरीज के दौरान देखे जाने वाले विविध अवस्था-क्रिया (state-action) जोड़ों का पर्याप्त कवरेज नहीं होता है, जिससे टेम्पोरल-डिफरेंस (TD) लर्निंग अविश्वसनीय हो जाती है।
- भंगुरता (Brittleness): प्रभावी वैल्यू लर्निंग के बिना, नीतियां उन क्रियाओं के बीच अंतर नहीं कर सकती हैं जो प्रगति करती हैं और वे जो विफलता की ओर ले जाती हैं, विशेष रूप से परिशुद्धता-गहन या बहु-चरणीय कार्यों में।
मौजूदा विधियाँ या तो TD लर्निंग से बचती हैं (मोंटे कार्लो रिटर्न्स का उपयोग करती हैं, जो डेटा वितरण से परे नीति सुधार को सीमित करता है) या पूरे कार्य क्षितिज पर TD लर्निंग पर निर्भर करती हैं, जो त्रुटि संचय (error compounding) से ग्रस्त होती है।
कार्यप्रणाली: SeeQ (Subtask-elicited Q-functions)
लेखक SeeQ का प्रस्ताव करते हैं, जो एक फ्रेमवर्क है जो पूरे कार्य के बजाय वर्तमान में सक्रिय उप-कार्य (active subtask) पर ध्यान केंद्रित करके लर्निंग क्षितिज को छोटा करता है।
मुख्य आर्किटेक्चर और प्रशिक्षण
SeeQ एक प्रीट्रेंड विजन-लैंग्वेज मॉडल (VLM) बैकबोन (विशेष रूप से एक 3B PaliGemma मॉडल) का उपयोग करता है और एक दो-चरणीय प्रशिक्षण प्रक्रिया पेश करता है:
- जनरललिस्ट प्रीट्रेनिंग (Generalist Pretraining): मॉडल को विविध, ओपन-सोर्स रोबोट हेरफेर डेटासेट्स (जैसे RoboCOIN) पर प्रीट्रेन किया जाता है जिसमें उप-कार्य एनोटेशन शामिल हैं। यह चरण विभिन्न एम्बॉडिमेंट्स (embodiments) में कार्य प्रगति और एक्शन कंडीशनिंग की मॉडल की समझ को नियमित (regularize) करता है।
- डाउनस्ट्रीम फाइनट्यूनिंग (Downstream Finetuning): मॉडल को विशिष्ट लक्षित कार्यों पर फाइनट्यून किया जाता है।
प्रमुख तकनीकी नवाचार
- उप-कार्य स्तर का वैल्यू प्रेडिक्शन (Subtask-Level Value Prediction): अंतिम कार्य पूर्णता के लिए रिटर्न का अनुमान लगाने के बजाय, Q-फंक्शन सक्रिय उप-कार्य () के अपेक्षित रिटर्न का अनुमान लगाता है। यह प्रेडिक्शन क्षितिज को कम करता है, जिससे TD लर्निंग अधिक स्थिर और प्रभावी हो जाती है।
- ऑटोरेग्रेसिव उप-कार्य डिकोडिंग (Autoregressive Subtask Decoding): टेस्ट-टाइम पर मानव एनोटेशन या बाहरी उप-कार्य प्रेडिक्टर की आवश्यकता को समाप्त करने के लिए, Q-फंक्शन आर्किटेक्चर को प्राकृतिक भाषा में सक्रिय उप-कार्य को ऑटोरेग्रेसिव रूप से प्रेडिक्ट करने के लिए संशोधित किया गया है।
- प्रशिक्षण के दौरान, मॉडल को ग्राउंड-ट्रुथ उप-कार्य एनोटेशन पर नेक्स्ट-टोकन प्रेडिक्शन लॉस के साथ सुपरवाइज किया जाता है।
- इन्फरेंस (inference) के दौरान, मॉडल वर्तमान अवस्था और कार्य निर्देश के आधार पर उप-कार्य टेक्स्ट () उत्पन्न करता है, और फिर इस उत्पन्न टेक्स्ट पर वैल्यू प्रेडिक्शन को कंडीशन करता है।
- TD-BoN (Temporal-Difference with Best-of-N) लर्निंग: प्रशिक्षण उद्देश्य उप-कार्य-स्तर की TD लर्निंग को "बेस्ट-ऑफ-एन" (Best-of-N) बैकअप रणनीति के साथ जोड़ता है।
- कैंडिडेट एक्शन चंक्स (action chunks) को एक बेस पॉलिसी () से सैंपल किया जाता है।
- टारगेट वैल्यू को उम्मीदवारों में से उच्चतम अनुमानित वैल्यू वाले एक्शन चंक का उपयोग करके कंप्यूट किया जाता है।
- यह दृष्टिकोण प्रशिक्षण बैकअप को टेस्ट-टाइम स्टीयरिंग प्रक्रिया के साथ संरेखित करता है और Q-फंक्शन को डेटासेट में देखी गई क्रियाओं से बेहतर क्रियाओं का मूल्यांकन करने की अनुमति देता है।
- सीमाओं के पार बूटस्ट्रैपिंग का अभाव (No Bootstrapping Across Boundaries): TD टारगेट उप-कार्य सीमाओं के पार बूटस्ट्रैप नहीं करता है। यदि कोई उप-कार्य एक्शन चंक क्षितिज के भीतर समाप्त होता है, तो बैकअप टर्म को शून्य कर दिया जाता है, यह सुनिश्चित करते हुए कि वैल्यू फंक्शन सख्ती से वर्तमान उप-कार्य की प्रगति को दर्शाता है।
कुल लॉस फंक्शन उप-कार्य वैल्यू के लिए TD लॉस और उप-कार्य टेक्स्ट के लिए नेक्स्ट-टोकन प्रेडिक्शन लॉस को जोड़ता है:
टेस्ट-टाइम इन्फरेंस
परिनियोजन (deployment) के समय, SeeQ Best-of-N चयन के माध्यम से एक बेस पॉलिसी () को स्टीयर करता है:
- अवस्था और कार्य निर्देश दिए जाने पर, मॉडल सक्रिय उप-कार्य को ऑटोरेग्रेसिव रूप से प्रेडिक्ट करता है।
- बेस पॉलिसी कैंडिडेट एक्शन चंक्स प्रस्तावित करती है।
- Q-फंक्शन प्रत्येक चंक को , , और प्रेडिक्टेड पर कंडीशन करके स्कोर देता है।
- उच्चतम स्कोर वाले एक्शन चंक को निष्पादित किया जाता है।
प्रमुख योगदान
- उप-कार्य स्तर का फॉर्मूलेशन (Subtask-Level Formulation): यह पेपर दीर्घ-क्षितिज वैल्यू लर्निंग को शॉर्ट-क्षितिज, उप-कार्य-स्तर की लर्निंग के रूप में पुनर्गठित करने की एक विधि पेश करता है, जो दीर्घ-क्षितिज पर स्पार्स रिवार्ड्स की चुनौतियों को प्रभावी ढंग से दरकिनार करता है।
- भाषा-कंडीशनड उप-कार्य इन्फरेंस (Language-Conditioned Subtask Inference): एक अभिनव आर्किटेक्चर जो स्पष्ट रूप से सक्रिय उप-कार्य को प्राकृतिक भाषा में प्रेडिक्ट करता है, जिससे टेस्ट-टाइम पर मॉड्यूलर उप-कार्य प्रेडिक्शन सिस्टम या मानव एनोटेशन की आवश्यकता समाप्त हो जाती है।
- जनरललिस्ट प्रीट्रेनिंग रणनीति (Generalist Pretraining Strategy): यह प्रदर्शित करता है कि विविध रोबोट डेटा पर VLM बैकबोन को प्रीट्रेन करना मजबूत एक्शन-कंडीशनिंग सीखने और डाउनस्ट्रीम फाइनट्यूनिंग के दौरान विशिष्ट इमेज फीचर्स के ओवरफिटिंग को कम करने के लिए महत्वपूर्ण है।
- अनुभवजन्य सत्यापन (Empirical Validation): दो रोबोट प्लेटफॉर्म्स पर चार वास्तविक दुनिया के द्विपक्षीय (bimanual) हेरफेर कार्यों (शर्ट-हैंगिंग, लिड-सीलिंग, ग्रोसरी-पैकिंग, लेगो-डिसासेम्बली) पर व्यापक मूल्यांकन।
परिणाम
लेखकों ने विकृत वस्तुओं (deformable objects), सटीक संरेखण (precise alignment) और बहु-चरणीय समन्वय वाले चार वास्तविक दुनिया के कार्यों पर SeeQ का मूल्यांकन किया।
- पॉलिसी स्टीयरिंग प्रदर्शन: SeeQ ने सभी कार्यों में बेस पॉलिसियों की सफलता दर में काफी सुधार किया।
- Shirt-hang: 10/24 (41.7%) से सुधरकर 22/24 (91.7%) हुआ।
- Lid-sealing: 10/24 (41.7%) से सुधरकर 15/24 (62.5%) हुआ।
- Grocery-packing: 9/24 (37.5%) से सुधरकर 17/24 (70.8%) हुआ।
- Lego-disassembly: 5/24 (20.8%) से सुधरकर 10/24 (41.7%) हुआ।
- कुल मिलाकर, औसत सफलता दर 35.4% से बढ़कर 66.7% (1.88x सुधार) हो गई।
- एब्लेशन स्टडीज (Ablation Studies):
- प्रीट्रेनिंग: रोबोट डेटा प्रीट्रेनिंग को हटाने से प्रदर्शन में महत्वपूर्ण गिरावट आई (शर्ट-हैंग पर 22/24 से 8/24 तक), जो विशिष्ट इमेज फीचर्स के प्रति ओवरफिटिंग को कम करने के लिए विविध डेटा की आवश्यकता को उजागर करता है।
- उप-कार्य कंडीशनिंग: उप-कार्य को स्पष्ट रूप से डिकोड करना और उस पर कंडीशन करना महत्वपूर्ण था। उप-कार्य प्रेडिक्शन को हटाने से प्रदर्शन बेस पॉलिसी से नीचे (8/24) चला गया, जबकि बिना कंडीशनिंग के केवल प्रेडिक्शन जोड़ने से यह 15/24 तक सुधरा। पूर्ण SeeQ ने 22/24 प्राप्त किया।
- बेसलाइन्स के साथ तुलना: SeeQ ने टास्क-लेवल मोंटे कार्लो रिग्रेशन, टास्क-लेवल TD लर्निंग और उप-कार्य-स्तर की SARSA (जो बैकअप के लिए डेटासेट क्रियाओं का उपयोग करती है न कि बेस्ट-ऑफ-एन सैंपलिंग का) को पछाड़ दिया।
महत्व और दावे
पेपर का दावा है कि उप-कार्य-स्तर के मान (values) टास्क-लेवल सफलता संकेतों की तुलना में अधिक प्रभावी लर्निंग टारगेट प्रदान करते हैं जब जनरललिस्ट Q-फंक्शन्स को प्रशिक्षित किया जाता है। हेरफेर कार्यों को मध्यवर्ती मील के पत्थरों (milestones) में विघटित करने की प्राकृतिक क्षमता का लाभ उठाकर, SeeQ दीर्घ-क्षितिज पर होने वाले एरर कंपाउंडिंग के बिना प्रभावी TD लर्निंग को सक्षम बनाता है।
लेखक इस बात पर जोर देते हैं कि उनका दृष्टिकोण जनरललिस्ट वैल्यू लर्निंग की अनुमति देता है जिसे न्यूनतम फाइनट्यूनिंग के साथ नए कार्यों पर लागू किया जा सकता है, बशर्ते कि कार्यों को उप-कार्यों में विभाजित किया जा सके। उप-कार्यों को प्रेडिक्ट करने के लिए भाषा का स्पष्ट उपयोग VLM की टेक्स्ट-जेनरेशन क्षमताओं के साथ वैल्यू एस्टीमेशन को संरेखित करता है, जिससे उप-कार्य ट्रांजिशन के पास मजबूती (robustness) में सुधार होता है।
यह कार्य सुझाव देता है कि शॉर्ट-होराइजन लर्निंग ऑब्जेक्टिव्स को लैंग्वेज-स्ट्रक्चर्ड इन्फरेंस के साथ जोड़ना, विशेष रूप से बड़े पैमाने पर विविध रोबोट डेटा पर प्रीट्रेनिंग का लाभ उठाते हुए, अधिक मजबूत, दीर्घ-क्षितिज रोबोटिक हेरफेर की दिशा में एक व्यवहार्य मार्ग है। लेखक सीमाओं को स्वीकार करते हैं, जैसे कि उप-कार्य सीमाओं की अस्पष्टता और बेस पॉलिसी के कैंडिडेट एक्शन्स की गुणवत्ता पर निर्भरता, लेकिन वे तर्क देते हैं कि उनका फ्रेमवर्क जटिल वास्तविक दुनिया की रोबोटिक्स के लिए वैल्यू फंक्शन्स को व्यावहारिक बनाने की दिशा में एक महत्वपूर्ण कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।