← नवीनतम पेपर
💻 computer science

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation

यह शोध पत्र \methodgated को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) फ्रेमवर्क है जो ज़ीरो-शॉट ज्यामितीय निरंतरता जांच (zero-shot geometric consistency check) के माध्यम से टेस्ट-टाइम स्केलिंग को चुनिंदा रूप से लागू करके वर्ल्ड एक्शन मॉडल्स को बेहतर बनाता है, जिससे कार्य सफलता दर में सुधार होता है और अनावश्यक कम्प्यूटेशनल लागतों में काफी कमी आती है।

मूल लेखक: Zesen Zhao, Minkyoung Cho, Hui shen, Boyuan Zheng, Kunxiao Gao, Yulong Cao, Z. Morley Mao

प्रकाशित 2026-07-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zesen Zhao, Minkyoung Cho, Hui shen, Boyuan Zheng, Kunxiao Gao, Yulong Cao, Z. Morley Mao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट कॉफी बनाने का तरीका सीखने की कोशिश कर रहा है। पुराने दिनों में, रोबोट अनाड़ी बच्चों की तरह थे: वे एक हैंडल पकड़ते, उसे खींचते और बस उम्मीद करते कि सब ठीक होगा। यदि उनसे कप गिर जाता, तो वे बस अपनी गलती से सीखने की उम्मीद में फिर से प्रयास करते। लेकिन आधुनिक रोबोट अधिक समझदार होते जा रहे हैं। वे "वर्ल्ड एक्शन मॉडल्स" (World Action Models) नामक चीज़ का उपयोग करते हैं। इन मॉडल्स को एक रोबोट के आंतरिक 'सपनों के यंत्र' के रूप में सोचें। अपने हाथ को हिलाने से पहले, रोबोट अपने दिमाग में एक त्वरित सिमुलेशन चलाता है, यह कल्पना करता है कि यदि वह कप को पकड़ता है, उठाता है और कॉफी डालता है, तो भविष्य कैसा दिखेगा। वह अपनी मानसिक आँखों से भविष्य को देखता है।

बड़ा सवाल यह है कि वैज्ञानिक यह कैसे सुनिश्चित करें कि रोबोट का "सपना" एक अच्छा सपना हो? आर्टिफिशियल इंटेलिजेंस की दुनिया में, एक लोकप्रिय विचार है जिसे "टेस्ट-टाइम स्केलिंग" (Test-Time Scaling) कहा जाता है। यह एक छात्र को परीक्षा देने के लिए अधिक समय देने जैसा है। केवल एक बार उत्तर देने के बजाय, एआई दस अलग-अलग संभावित उत्तर उत्पन्न करता है, उन सभी की जाँच करता है, और सबसे अच्छे को चुनता है। यह आमतौर पर एआई को स्मार्ट बनाता है, लेकिन यह महंगा और धीमा भी है क्योंकि इसमें बहुत अधिक कंप्यूटर शक्ति का उपयोग होता है। एक रोबोट के लिए, बुरे विचारों पर समय और ऊर्जा बर्बाद करना खतरनाक है; वह सोचते समय कोई फूलदान गिरा सकता है। इसलिए, चुनौती यह पता लगाने की है कि भविष्य को जाँचने के लिए अतिरिक्त मानसिक शक्ति खर्च करना कब सार्थक है, और शोर (noise) से भ्रमित हुए बिना सबसे अच्छे भविष्य को कैसे चुना जाए।

यह शोध पत्र रोबोटों को ये निर्णय लेने में मदद करने के लिए एक चतुर, मुफ्त तरीका पेश करता है। लेखक "गेटेड जियो-बीओएन" (Gated GeoBoN) नामक एक प्रणाली प्रस्तावित करते हैं। रोबोट को अपने हर विचार की जाँच करने के लिए मजबूर करने के बजाय (जो कि धीमा है), उन्होंने एक दो-चरणीय फ़िल्टर बनाया है। सबसे पहले, रोबोट अपने पहले विचार पर एक त्वरित, सस्ता सा नज़र डालता है। वह एक सरल प्रश्न पूछता है: "जो क्रिया मैं करने की योजना बना रहा हूँ, क्या वह वास्तव में उस गति से मेल खाती है जो मैं अपने सपने में देख रहा हूँ?" यदि रोबोट एक कप उठाने की योजना बनाता है लेकिन उसका सपना दिखाता है कि कप स्थिर है, तो यह एक चेतावनी (red flag) है। रोबोट फिर "गेट" (द्वार) से टकराता है और कहता है, "ठीक है, यह पहला विचार अजीब है। चलिए कुछ और विकल्प उत्पन्न करते हैं और उन्हें सावधानी से जाँचते हैं।"

यदि पहला विचार सुसंगत दिखता है, तो रोबोट बस आगे बढ़ जाता है, जिससे समय बचता है। लेकिन यदि गेट सक्रिय हो जाता है, तो रोबोट नए "सपनों" का एक समूह बनाता है। यहाँ दूसरा, अधिक शक्तिशाली चरण आता है: एक ज्यामितीय (geometric) जाँच। रोबोट एक फ्रीज़्ड, प्री-ट्रेन्ड ज्योमेट्री मॉडल (एक ऐसा टूल जो 3D स्थान को समझता है) का उपयोग करके अपने नए सपनों को विभिन्न कैमरा कोणों से देखता है। वह पूछता है, "यदि मैं इस भविष्य के दृश्य को अपने कलाई वाले कैमरे और अपने मुख्य कैमरे से देखूँ, तो क्या 3D आकार पूरी तरह से मेल खाते हैं?" यदि रोबोट का हवा में तैरते कप का सपना भौतिकी के 3D नियमों से मेल नहीं खाता, तो सिस्टम उसे अस्वीकार कर देता है। रोबोट फिर उस सपने को चुनता है जो सबसे अधिक शारीरिक रूप से सुसंगत दिखता है और उस क्रिया को निष्पादित करता है।

शोधकर्ताओं ने दरवाज़े खोलने, कॉफी बनाने और वस्तुओं को हिलाने जैसे कार्यों सहित कई रोबोट बेंचमार्क पर इसका परीक्षण किया। उन्होंने पाया कि यह तरीका बहुत अच्छी तरह से काम करता है। जब उन्होंने एक निश्चित संख्या में जाँचों का उपयोग किया (जैसे हमेशा 8 विकल्पों की जाँच करना), तो रोबोट अपने कार्यों में बेहतर हुए। उदाहरण के लिए, 'रोबोकासा' (RoboCasa) नामक कार्यों के एक सेट पर, एक प्रकार के रोबोट मस्तिष्क के साथ सफलता दर 66.3% से बढ़कर 68.4% हो गई, और दूसरे के साथ 80.8% से 82.5% हो गई। 'लिबेरो लॉन्ग' (LIBERO Long) नामक दूसरे सेट पर, सफलता दर 97.5% से बढ़कर 99.3% हो गई।

हालाँकि, इस शोध पत्र ने एक सीमा भी खोजी। यदि आप लगातार अधिक विकल्प मांगते रहते हैं (जैसे 16 या 32 सपनों की जाँच करना), तो रोबोट हमेशा स्मार्ट नहीं होता है। वास्तव में, कभी-कभी यह और भी खराब हो जाता है। लेखक सुझाव देते हैं कि ऐसा इसलिए है क्योंकि जब आपके पास विकल्पों का एक बड़ा ढेर होता है, तो आप गलती से एक "भाग्यशाली" बुरे विचार को चुन सकते हैं जो केवल संयोग से सुसंगत दिखता है, भले ही वह वास्तव में एक अच्छा प्लान न हो। इसे "फॉल्स लो-स्कोर सिलेक्शन" (false low-score selection) कहा जाता है।

इसे ठीक करने के लिए, उन्होंने अपने "गेट" सिस्टम का उपयोग किया। केवल तभी गहन जाँच करने के बजाय जब पहला विचार संदिग्ध लग रहा था, उन्होंने बहुत सारा समय बचाया। उन्होंने पाया कि इस "गेटेड" दृष्टिकोण ने सभी की जाँच करने के लाभों का लगभग 75% हिस्सा वापस प्राप्त कर लिया, लेकिन इसने अतिरिक्त जाँचों को केवल 26% निर्णयों पर ही सक्रिय किया। इसका मतलब है कि रोबोट अधिकांश समय तेज़ और कुशल रहता है, और केवल तभी गहराई से सोचने के लिए धीमा होता है जब उसे वास्तव में इसकी आवश्यकता होती है। शोध पत्र निष्कर्ष निकालता है कि इन अंतर्निहित निरंतरता जाँचों का उपयोग करना रोबोटों को बिना उन्हें फिर से प्रशिक्षित किए या उनके दिमाग में नए, जटिल हिस्से जोड़े, स्मार्ट बनाने का एक शक्तिशाली और मुफ्त तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →