ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation
यह शोध पत्र ProcVLM को प्रस्तुत करता है, जो एक विज़न-लैंग्वेज मॉडल है जो शेष परमाणु क्रियाओं (atomic actions) और दृश्य परिवर्तनों के बारे में तर्क करके प्रक्रिया-आधारित प्रगति पुरस्कार (procedure-grounded progress rewards) सीखता है, जिसे लंबी अवधि के रोबोटिक हेरफेर (long-horizon robotic manipulation) के लिए सघन, विभेदक फीडबैक प्रदान करने हेतु एक विशाल 60M-फ्रेम डेटासेट (ProcCorpus-60M) पर प्रशिक्षित किया गया है।