Can Tabular Foundation Models Guide Exploration in Robot Policy Learning?
यह शोध पत्र TFM-S3 का प्रस्ताव करता है, जो एक नमूना-कुशल (sample-efficient) हाइब्रिड विधि है जो एक पूर्व-प्रशिक्षित टैबुलर फाउंडेशन मॉडल का लाभ उठाकर एक गतिशील रूप से अपडेट किए गए पॉलिसी सबस्पेस के भीतर वैश्विक अन्वेषण (global exploration) को निर्देशित करती है, जिससे मौजूदा बेसलाइनों की तुलना में उच्च-आयामी निरंतर रोबोट नियंत्रण (high-dimensional continuous robot control) में अभिसरण (convergence) को गति मिलती है और प्रदर्शन में सुधार होता है।