← नवीनतम पेपर
🤖 AI

PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space

PearlVLA एक अभिनव विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो विचार-विमर्श (deliberation) को एक विजन-लैंग्वेज मॉडल के लेटेंट स्पेस में ले जाकर LIBERO बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है, जहाँ एक फ्रोजन लेटेंट वर्ल्ड मॉडल द्वारा निर्देशित और कॉज़ल रिवॉर्ड आरएल (causal reward RL) के माध्यम से अनुकूलित एक पुनरावृत्ति परिशोधन प्रक्रिया (iterative refinement process) कम-विलंबता वाले एक्शन जनरेशन और स्पष्ट लॉन्ग-होरिज़न प्लानिंग के बीच संतुलन बनाती है।

मूल लेखक: Bochen Yang, Lianlei Shan

प्रकाशित 2026-06-17
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Bochen Yang, Lianlei Shan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल कार्य करना सिखा रहे हैं, जैसे कि सैंडविच बनाना।

समस्या: "तेज़ी से सोचना" बनाम "गहराई से सोचना" की दुविधा
वर्तमान रोबोट मस्तिष्क (जिन्हें विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है) एक कठिन विकल्प का सामना करते हैं।

  • विकल्प A (द स्प्रिंटर - तेज़ धावक): वे दृश्य को देखते हैं और तुरंत अगले कदम के बारे में चिल्ला उठते हैं। यह बहुत तेज़ है, लेकिन वे आगे की योजना नहीं बनाने के कारण अपने ही पैरों में उलझकर गिर सकते हैं।
  • विकल्प B (द फिलोसॉफर - दार्शनिक): वे रुकते हैं, अपनी योजना के बारे में एक लंबा निबंध लिखते हैं, या टेक्स्ट का उपयोग करके अपने दिमाग में भविष्य का अनुकरण (सिमुलेशन) करते हैं। यह स्मार्ट है, लेकिन इसमें इतना समय लगता है कि रोबोट वास्तविक दुनिया में उपयोगी होने के लिए बहुत धीमा हो जाता है।

समाधान: PearlVLA
लेखकों ने एक नया सिस्टम बनाया जिसे PearlVLA कहा जाता है। गति और बुद्धिमत्ता के बीच चुनाव करने के बजाय, उन्होंने एक ऐसा रोबोट बनाया जो बिना धीमे हुए अपने "भीतर" सोच सकता है।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. "ड्राफ्टिंग" चरण (लेटेंट स्पेस)

कल्पना कीजिए कि रोबोट के पास एक "सोच का बुलबुला" (एक छिपा हुआ डिजिटल स्थान) है जहाँ वह विचारों का खाका तैयार कर सकता है।

  • पुराना तरीका: रोबोट या तो तुरंत चाल का अनुमान लगा लेता था, या अपनी योजना समझाने के लिए टेक्स्ट का एक पैराग्राफ लिखने के लिए रुक जाता था।
  • PearlVLA का तरीका: रोबोट अपने विचार के बुलबुले में योजना का एक कच्चा खाका (रफ स्केच) बनाता है। यह अभी अंतिम कमांड नहीं है; यह केवल एक "खुरदरा ड्राफ्ट" है।

2. "क्रिस्टल बॉल" की जाँच (द फ्रोजन वर्ल्ड मॉडल)

यह जादुई ट्रिक है। रोबोट के पास एक इन-बिल्ट, जमा हुआ "क्रिस्टल बॉल" (एक प्री-ट्रेन्ड वर्ल्ड मॉडल) है।

  • हर बार जब रोबोट एक ड्राफ्ट योजना बनाता है, तो वह क्रिस्टल बॉल से पूछता है: "यदि मैं इस ड्राफ्ट प्लान का पालन करता हूँ, तो कुछ सेकंड बाद दुनिया कैसी दिखेगी?"
  • क्रिस्टल बॉल को रोबोट की सटीक मोटर चालों को जानने की आवश्यकता नहीं है; यह रोबोट के वर्तमान इरादे के आधार पर भविष्य के दृश्य की भविष्यवाणी करता है।

3. "स्व-सुधार" लूप (रिफाइनमेंट)

अब, रोबोट अपने ड्राफ्ट प्लान की तुलना क्रिस्टल बॉल के प्रेडिक्शन (भविization) से करता है।

  • उदाहरण: रोबोट एक योजना का ड्राफ्ट बनाता है "कप को पकड़ने" के लिए। क्रिस्टल बॉल कहता है, "यदि आप ऐसा करते हैं, तो आप नमकदानी को गिरा देंगे।"
  • रोबंतु तुरंत अपने विचार के बुलबुले में अपने ड्राफ्ट को ठीक करता है: "ठीक है, चलो हाथ को थोड़ा बाईं ओर ले चलते हैं।"
  • वह क्रिस्टल बॉल से फिर से पूछता है। "क्या अब बेहतर है? हाँ।"
  • वह इसे कुछ बार करता है (उनके प्रयोगों में 4 राउंड), योजना को एक रफ स्केच से एक सटीक, बारीक निर्देश में पॉलिश करता है।

4. "अंतिम निष्पादन" (एक्शन चंक)

एक बार जब योजना पॉलिश हो जाती है, तो रोबोट केवल एक चाल नहीं चलता। वह अंतिम, सटीक विचार को एक्शन के एक चंक (जैसे कि गति का 1-सेकंड का वीडियो) में बदल देता है और उसे एक साथ निष्पादित करता है। यह रोबोट को तेज़ रखता है, बिल्कुल "स्प्रिंटर" की तरह, लेकिन "फिलोसॉफर" की दूरदर्शिता के साथ।

यह बेहतर क्यों है?

उन्होंने LIBERO (रोबोट कार्यों का एक सेट) नामक एक बेंचमार्क पर इस परीक्षण किया।

  • परिणाम: PearlVLA इस परीक्षण पर सर्वश्रेष्ठ प्रदर्शन करने वाला रोबोट बन गया, जिसने 98.7% सफलता दर हासिल की।
  • सीक्रेट सॉस: उन्होंने एक विशेष "कोच" (जिसे CRG-PRL कहा जाता है) जोड़ा जो रोबोट की सोचने की प्रक्रिया को देखता है। यदि रोबोट के "विचार" बेहतर भविष्य परिणाम की ओर ले जाते हैं, तो कोच उसे इनाम देता है। यह रोबोट को केवल यह नहीं सिखाता कि क्या करना है, बल्कि यह भी सिखाता है कि कैसे बेहतर तरीके से सोचना है

सारांश

PearlVLA एक ऐसे रोबोट की तरह है जो न तो केवल दुनिया के प्रति प्रतिक्रिया देता है और न ही डायरी लिखने के लिए रुकता है। इसके बजाय, यह अपने दिमाग में एक त्वरित, अदृश्य सिमुलेशन चलाता है, जाँच करता है कि क्या भविष्य अच्छा दिख रहा है, यदि नहीं तो अपनी योजना को ठीक करता है, और फिर पलक झपकते ही पूर्ण चाल का निष्पादन करता है। यह साबित करता है कि आप गति और गहरी सोच दोनों प्राप्त कर सकते हैं, जब तक कि आप सही जगह पर सोच रहे हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →