DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization
यह शोध पत्र DyGRO-VLA प्रस्तुत करता है, जो एक दो-चरणीय अनुकूलन ढांचा (two-stage optimization framework) है जो क्रॉस-टास्क लेटेंट रिप्रेजेंटेशन्स को कैप्चर करके और 'मिक्सचर-ऑफ-आरएल-रेसिडुअल्स' के माध्यम से पॉलिसी ऑप्टिमाइज़ेशन को गतिशील रूप से परिष्कृत करके विभिन्न कार्यों में विजन-लैंग्वेज-एक्शन मॉडल्स की सामान्यीकरण क्षमता को बढ़ाता है, जिससे हस्तक्षेप कम होता है और वितरण बदलाव (distribution shifts) के तहत प्रदर्शन में सुधार होता है।