← नवीनतम पेपर
🤖 AI

Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

Fast-ThinkAct एक कुशल विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो वर्बलाइज़ेबल लेटेंट रीजनिंग के प्रेफरेंस-गाइडेड डिस्टिलेशन का उपयोग करता है ताकि लॉन्ग-होरिज़न प्लानिंग, फ्यू-शॉट अडैप्टेशन और फेलियर रिकवरी में मजबूत प्रदर्शन बनाए रखते हुए इन्फरेंस लेटेंसी को काफी कम किया जा सके।

मूल लेखक: Chi-Pin Huang, Yunze Man, Zhiding Yu, Min-Hung Chen, Jan Kautz, Yu-Chiang Frank Wang, Fu-En Yang

प्रकाशित 2026-02-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chi-Pin Huang, Yunze Man, Zhiding Yu, Min-Hung Chen, Jan Kautz, Yu-Chiang Frank Wang, Fu-En Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं।

पुराना तरीका (द "ओवर-थिंकर" या अत्यधिक सोचने वाला):
पहले, यदि आप एक स्मार्ट रोबोट से कहते, "स्ट्रॉबेरी को दराज में रख दो," तो वह एक मानव दार्शनिक की तरह जोर-जोर से सोचने की कोशिश करता। वह अपने दिमाग में एक लंबा, विस्तृत भाषण उत्पन्न करता: "ठीक है, पहले मुझे स्ट्रॉबेरी को देखना होगा। यह लाल है। दराज नीली है। मुझे अपना हाथ 12 सेंटीमीटर बाईं ओर, फिर 5 सेंटीमीटर नीचे ले जाना होगा। मुझे सावधान रहना चाहिए कि मैं इसे गिरा न दूँ। अब, पकड़ो। अब, उठाओ। अब, खोलो। अब, रखो।"

यह "बोलकर सोचना" (जिसे चेन-ऑफ-थॉट कहा जाता है) रोबोट को स्मार्ट बनाने में मदद करता है, लेकिन यह धीमा है। जब तक रोबोट वह 250 शब्दों का भाषण लिखने के लिए अपना विचार पूरा करता, तब तक स्ट्रॉबेरी लुढ़क कर दूर जा चुकी होती, या रसोई में आग लग चुकी होती। वास्तविक दुनिया में, रोबोटों को तेजी से काम करने की आवश्यकता होती (प्रति सेकंड 10 से 15 बार), लेकिन यह "अत्यधिक सोचने" की प्रक्रिया उन्हें एक घोंघे की तरह धीमा बना देती है।

नया तरीका (फास्ट-थिंक-एक्ट - Fast-ThinkAct):
NVIDIA के शोधकर्ताओं (ची-पिन हुआंग और उनकी टीम) ने Fast-ThinkAct विकसित किया। उन्होंने महसूस किया कि रोबोट को अपने विचारों को 'बोलने' की ज़रूरत नहीं है, बस उन्हें 'होने' की ज़रूरत है।

यह कैसे काम करता है, एक सरल उदाहरण के माध्यम से यहाँ दिया गया है:

1. "सीक्रेट हैंडशेक" बनाम "लंबा पत्र"

कल्पना कीजिए कि आप और एक दोस्त एक जटिल खेल खेल रहे हैं।

  • पुराना रोबोट: हर चाल चलने से पहले खुद को विस्तार से समझाने के लिए एक लंबा पत्र लिखता है। यह स्पष्ट तो है, लेकिन इसे लिखने में बहुत समय लगता है।
  • Fast-ThinkAct रोबोट को एक सीक्रेट हैंडशेक (गुप्त संकेत) सिखाता है। एक लंबा पत्र लिखने के बजाय, रोबोट अपने मस्तिष्क को एक छोटा, संकुचित संकेत (एक "लेटेंट टोकन") भेजता है। इस संकेत में आवश्यक योजना संबंधी सभी जानकारी होती है, लेकिन यह इतना छोटा होता है कि यह एक उपन्यास की तुलना में एक हल्की सी फुसफुसाहट जैसा होता है।

2. "शिक्षक" और "छात्र"

आप एक रोबोट को इन गुप्त संकेतों का उपयोग करना कैसे सिखाते हैं?

  • शिक्षक: सबसे पहले, वे एक "शिक्षक" रोबोट को प्रशिक्षित करते हैं जो बहुत बुद्धिमान है लेकिन धीमा है। वह समस्याओं को हल करने के लिए वे सभी लंबे, विस्तृत पत्र (रीजनिंग ट्रेसेस) लिखता है।
  • छात्र: फिर, वे एक "छात्र" रोबोट को पेश करते हैं। छात्र शिक्षक को देखता है। लेकिन छात्र उन लंबे पत्रों की नकल करने के बजाय, शिक्षक के ज्ञान को उन छोटे गुप्त संकेतों में डिस्टिल (निचोड़ना/संक्षिप्त करना) करना सीखता है।
  • फ़िल्टर: सिस्टम एक "प्रेफरेंस" (पसंद) फ़िल्टर का उपयोग करता है। यदि शिक्षक का लंबा पत्र अव्यवस्थित या गलत है, तो छात्र उसे अनदेखा करना सीख जाता है। यदि पत्र शानदार है, तो छात्र उस प्रतिभा को एक छोटे, कुशल संकेत में संकुचित करना सीख जाता है।

3. "अनुवादक" (The Verbalizer)

आप पूछ सकते हैं: "यदि रोबोट गुप्त संकेतों में सोच रहा है, तो हमें कैसे पता चलेगा कि वह सही सोच रहा है?"
शोधकर्ताओं ने एक अनुवादक (जिसे वर्बलाइज़र कहा जाता है) जोड़ा है। प्रशिक्षण के दौरान, अनुवादक रोबोट के छोटे गुप्त संकेत को लेता है और उसे वापस मानवीय भाषा में विस्तारित करता है ताकि हम जांच सकें कि क्या यह समझ में आता है।

  • महत्वपूर्ण बिंदु: एक बार जब रोबोट प्रशिक्षित हो जाता है, तो उसे अनुवादक की आवश्यकता नहीं होती। वह केवल गुप्त संकेतों का उपयोग करके चलता है। अनुवादक एक शिक्षक की नियमावली (manual) की तरह है जिसका उपयोग केवल स्कूल के दौरान किया जाता है; रोबोट को काम करते समय उस नियमावली को पढ़ने की आवश्यकता नहीं होती।

यह बड़ी बात क्यों है?

शोध पत्र दिखाता है कि Fast-ThinkAct पिछले सबसे स्मार्ट रोबोटों की तुलना में 9.3 गुना तेज़ है, जबकि वास्तव में कार्यों में बेहतर भी है।

  • गति: यह सोचने के समय को सेकंडों से घटाकर मिलीसेकंड में बदल देता है। इसका मतलब है कि रोबोट वास्तविक समय में प्रतिक्रिया दे सकता है, जैसे कि कोई इंसान गिरते हुए कप को पकड़ता है।
  • बुद्धिमत्ता: क्योंकि रोबोट लंबे वाक्य लिखने में समय बर्बाद नहीं कर रहा है, इसलिए वह अपनी मानसिक शक्ति को कार्य के दृश्य भाग (देखना कि कप कहाँ है) और क्रिया भाग (कप को पकड़ना) पर केंद्रित कर सकता है।
  • रिकवरी (सुधार): यदि रोबोट कप गिरा देता है, तो वह तुरंत (अपने गुप्त भाषा में) यह सोचने में सक्षम है कि इसे कैसे ठीक किया जाए, बजाय इसके कि वह एक लंबा माफीनामा लिखने में फंस जाए।

निष्कर्ष

Fast-ThinkAct एक रेस कार ड्राइवर को ड्राइविंग करते समय निर्देश पुस्तिका पढ़ने के बजाय, उसे सहज ज्ञान (instincts) और मांसपेशियों की स्मृति (muscle memory) में नियमों को आत्मसात करने के लिए सिखाने जैसा है। परिणाम? वे तेज़, सुरक्षित और स्मार्ट तरीके से गाड़ी चलाते हैं, और साथ ही अपनी बुद्धिमत्ता का स्तर भी बनाए रखते हैं।

यह तकनीक हमें उन रोबोटों के करीब लाती है जो वास्तव में हमारी व्यस्त, तेज़ दुनिया में हमारे साथ रह और काम कर सकें, न कि उन रोबोटों के जो स्थिर खड़े होकर बहुत अधिक सोचते रहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →