Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment
यह शोध पत्र CoVer-VLA को प्रस्तुत करता है, जो एक पदानुक्रमित टेस्ट-टाइम वेरिफिकेशन फ्रेमवर्क है जो पुनर्गठित निर्देशों और एक्शन उम्मीदवारों के संयुक्त स्केलिंग का लाभ उठाकर विजन-लैंग्वेज-एक्शन मॉडल्स को प्राकृतिक भाषा निर्देशों के साथ संरेखित करने में पॉलिसी प्री-ट्रेनिंग से काफी बेहतर प्रदर्शन करता है, जिससे सिम्युलेटेड और वास्तविक दुनिया के बेंचमार्क दोनों में पर्याप्त लाभ प्राप्त होता है।