SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation
यह शोध पत्र SeeQ को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो जटिल, लंबी अवधि के रोबोटिक हेरफेर कार्यों के लिए ऑफलाइन डेटा का उपयोग करके लंबी क्रेडिट-असाइनमेंट क्षितिज (long credit-assignment horizons) की समस्या को दूर करने और पॉलिसी स्टीयरिंग में सुधार करने के लिए प्राकृतिक भाषा में सक्रिय उप-कार्यों (active subtasks) की ऑटोरेग्रेसिव रूप से भविष्यवाणी करके सामान्यज्ञ वैल्यू फंक्शन्स (generalist value functions) को प्रशिक्षित करता है।