Adaptation of Generalist Robot Policies with Minimal Data
यह शोध पत्र MiDAS को प्रस्तुत करता है, जो एक सरल ऑफलाइन-टू-ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो सामान्यज्ञ रोबोट नीतियों को केवल एक मानव प्रदर्शन से भी तेजी से नए कार्यों के अनुकूल होने और मजबूत स्वायत्त सुधार प्राप्त करने में सक्षम बनाता है।