Freeform Preference Learning for Robotic Manipulation
यह शोध पत्र फ्रीफॉर्म प्रेफरेंस लर्निंग (FPL) को प्रस्तुत करता है, जो एक ऐसी विधि है जो रोबोटिक मैनिपुलेशन पॉलिसियों को बाइनरी तुलनाओं के बजाय प्राकृतिक-भाषा वरीयता अक्षों (natural-language preference axes) से सीखने में सक्षम बनाती है, जिसके परिणामस्वरूप प्रदर्शन में महत्वपूर्ण सुधार, सघन प्रगति संकेत (dense progress signals), और बिना पुन: प्रशिक्षण के परीक्षण के समय व्यवहार को नियंत्रित करने की क्षमता प्राप्त होती है।