PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space
PearlVLA एक अभिनव विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो विचार-विमर्श (deliberation) को एक विजन-लैंग्वेज मॉडल के लेटेंट स्पेस में ले जाकर LIBERO बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है, जहाँ एक फ्रोजन लेटेंट वर्ल्ड मॉडल द्वारा निर्देशित और कॉज़ल रिवॉर्ड आरएल (causal reward RL) के माध्यम से अनुकूलित एक पुनरावृत्ति परिशोधन प्रक्रिया (iterative refinement process) कम-विलंबता वाले एक्शन जनरेशन और स्पष्ट लॉन्ग-होरिज़न प्लानिंग के बीच संतुलन बनाती है।