RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation
यह शोध पत्र RT-VLA का प्रस्ताव करता है, जो एक हल्का, डिस्टिल्ड विजन-लैंग्वेज-एक्शन मॉडल है जो अत्याधुनिक SimLingo टीचर की ड्राइविंग और रीजनिंग क्षमताओं को एक कॉम्पैक्ट स्टूडेंट में स्थानांतरित करता है, जिससे प्रतिस्पर्धी क्लोज्ड-लूप प्रदर्शन को बनाए रखते हुए और पोस्ट-हॉक व्याख्यात्मकता के साथ रीयल-टाइम कंट्रोल को सक्षम करते हुए महत्वपूर्ण इन्फरेंस लेटेंसी में कमी (44.8x तक) प्राप्त की जाती है।