← नवीनतम पेपर
🤖 AI

SAGE: Subgoal-Conditioned Action Generation for Latent World Model Planning

यह शोध पत्र SAGE को प्रस्तुत करता है, जो एक प्रायर-कंडीशन्ड (prior-conditioned) प्लानर है जो लक्ष्य-कंडीशन्ड सबगोल्स (goal-conditioned subgoals) का उपयोग करके एक्शन सीक्वेंस प्रस्तावों को संरचित करता है ताकि लॉन्ग-होरिज़न लेटेंट वर्ल्ड मॉडल प्लानिंग को बेहतर बनाया जा सके, जिससे रैंडम इनिशियलाइजेशन की तुलना में PushT और OGBench Cube जैसे कार्यों पर सफलता दर में काफी सुधार होता है।

मूल लेखक: Letian Cheng, Qi Zhang, Yisen Wang

प्रकाशित 2026-07-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Letian Cheng, Qi Zhang, Yisen Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

भविष्य की कल्पना करने की कला

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भूलभुलैया (maze) में रास्ता खोजने या एक भारी बक्से को किसी विशिष्ट स्थान तक धकेलने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। ऐसा करने के लिए, रोबोट को एक "वर्ल्ड मॉडल" (world model) की आवश्यकता होती है। इसे एक मानसिक सिम्युलेटर के रूप में सोचें, जैसे रोबोट के मस्तिष्क के भीतर चल रहा कोई वीडियो गेम। कैमरा स्क्रीन पर दिखने वाले प्रकाश के हर एक पिक्सेल की भविष्यवाणी करने के बजाय, रोबोट यह सीखता है कि उसके हिलने-डुलने पर दुनिया के उसके आंतरिक "मानचित्र" (map) में क्या बदलाव आता है। इसके बाद वह आगे के हजारों अलग-अलग रास्तों की "कल्पना" कर सकता है, यह देख सकता है कि कौन सा रास्ता लक्ष्य तक ले जाता है, और सबसे अच्छा कदम चुन सकता है। यह मशीनों के लिए योजना बनाने का एक शक्तिशाली तरीका है, लेकिन जब लक्ष्य बहुत दूर होता है, तो यह एक दीवार से टकरा जाता है। यदि रोबोट एक साथ 150 कदम आगे के भविष्य की कल्पना करने की कोशिश करता है, तो संभावनाओं की संख्या इतनी विशाल हो जाती है कि यह केवल अनुमान लगाकर समुद्र तट पर रेत के एक विशिष्ट कण को खोजने जैसा हो जाता है। रोबोट शोर (noise) में खो जाता है, और उसके रैंडम अनुमान शायद ही कभी सही निशाने पर लगते हैं। यही वह चुनौती है जिससे शोधकर्ता जूझ रहे हैं: रोबोट को प्रभावी ढंग से योजना बनाने में कैसे मदद की जाए जब मंजिल बहुत दूर हो, बिना उसके मस्तिष्क को बहुत अधिक रैंडम संभावनाओं से अभिभूत किए।

SAGE: रोबोट का रणनीतिक दिशा-सूचक (Strategic Compass)

यह शोध पत्र ठीक इसी समस्या को हल करने के लिए SAGE (Subgoal-Conditioned Action Generation for Latent World Model Planning) नामक एक नई विधि पेश करता है। पेकिंग यूनिवर्सिटी के लेखक, लेटियन चेंग, क्यू झांग और यिसन वांग का सुझाव है कि रोबोट को शुरुआत से अंत तक का एक लंबा रास्ता अनुमान लगाने के लिए कहने के बजाय, हमें उसे यात्रा को छोटे, प्रबंधनीय टुकड़ों में तोड़ने के लिए सिखाना चाहिए।

कल्पना कीजिए कि आप न्यूयॉर्क से लॉस एंजिल्स तक की सड़क यात्रा की योजना बना रहे हैं। यदि आप अपने जीपीएस (GPS) को केवल यह कहते हैं, "लॉस एंजिल्स तक ड्राइव करें," और वह अगले 3,000 मील के लिए हर एक मोड़ चुनने की कोशिश करता है, तो वह भ्रमित हो सकता है। इसके बजाय, एक स्मार्ट नेविगेटर कहेगा, "पहले, चलो शिकागो तक पहुँचते हैं," फिर "अगला, चलो डेनवर तक पहुँचते हैं," इत्यादि। SAGE रोबोटों के लिए यही करता है। यह एक विशेष "सबगोल जनरेटर" (subgoal generator) का उपयोग करता है ताकि अगले कुछ कदमों के लिए एक सुलभ मध्यवर्ती अवस्था—एक "स्थानीय लक्ष्य" (local target)—की भविष्यवाणी की जा सके। उदाहरण के लिए, यदि रोबोट को एक ब्लॉक को 150 कदम दूर धकेलना है, तो SAGE उससे एक साथ 150 कदमों की योजना नहीं बनाता। इसके बजाय, वह कहता है, "ठीक है, अगले 15 से 25 कदमों के लिए, तुम्हारा लक्ष्य इस विशिष्ट स्थान तक पहुँचना है।"

एक बार जब यह स्थानीय लक्ष्य निर्धारित हो जाता है, तो सिस्टम का दूसरा हिस्सा, "एक्शन जनरेटर" (action generator), विशेष रूप से उस स्थानीय स्थान तक पहुँचने के लिए डिज़ाइन किए गए संभावित मूव्स की एक सूची बनाता है। यह रोबोट को एक ऐसे मानचित्र देने जैसा है जो केवल अगले कुछ मील दिखाता है, लेकिन एक हाइलाइट किए गए मार्ग के साथ जो तर्कसंगत है। रोबोट का स्थिर "वर्ल्ड मॉडल" (वह मानसिक सिम्युलेटर जो समान रहता है और जिसे फिर से प्रशिक्षित नहीं किया जाता है) इन विशिष्ट, निर्देशित विचारों का परीक्षण करता है कि कौन सा सबसे अच्छा काम करता है, और वास्तव में हिलने-डुलने से पहले योजना को परिष्कृत करता है।

इस दृष्टिकोण के परिणाम काफी प्रभावशाली हैं। उन प्रयोगों में जहाँ रोबलेट को एक ब्लॉक को धकेलना था (PushT कार्य) या एक क्यूब को हिलाना था (OGBench Cube कार्य), जब लक्ष्य बहुत दूर था, तो सुधार जबरदस्त था। जब लक्ष्य 150 कदम दूर था, तो मानक विधि केवल 12.7% बार ही PushT कार्य में सफल हुई। SAGE के साथ, सफलता दर बढ़कर 64.7% हो गई। इसी तरह, Cube कार्य के लिए, सफलता 26.7% से बढ़कर 67.3% हो गई।

शोध पत्र ने सावधानीपूर्वक परीक्षण किया कि यह कैसे काम कर रहा था। उन्होंने पाया कि केवल रोबोट को एक स्थानीय लक्ष्य (सबगोल) देने से काफी मदद मिली, लेकिन उस लक्ष्य को मूव्स उत्पन्न करने के एक स्मार्ट तरीके (एक्शन जनरेटर) के साथ मिलाने से यह और भी बेहतर हो गया। हालाँकि, उन्होंने यह भी दिखाया कि रोबोट को "रेफरी" के रूप में अपने "वर्ल्ड मॉडल" की आवश्यकता थी। यदि वे केवल रोबोट को बिना जांच और परिष्करण के पहले विचार का पालन करने देते, तो सफलता दर काफी गिर जाती (150-कदम वाले कार्य के लिए 16.0% तक नीचे), जो यह साबित करता है कि सर्वोत्तम पथ चुनने के लिए मानसिक सिमुलेशन अभी भी महत्वपूर्ण है।

दिलचस्प बात यह है कि शोधकर्ताओं ने यह भी खोजा कि यात्रा को कैसे विभाजित किया जाता है, यह मायने रखता था। कई छोटे चरणों में योजना बनाना (जैसे एक बार में 15 कदम) कम चरणों में बड़ी योजना बनाने (जैसे एक बार में 25 कदम) की तुलना में अक्सर बेहतर काम करता है, विशेष रूप से बहुत लंबी दूरियों के लिए। यह सुझाव देता है कि बार-बार जांच करना और योजना को बार-बार समायोजित करना रोबोट को ट्रैक पर रहने में मदद करता है।

संक्षेप में, SAGE सुझाव देता है कि रोबोट को दूर के फिनिश लाइन के बजाय अगले तत्काल चेकपॉइंट पर ध्यान केंद्रित करना सिखाकर, और उस चेकपॉइंट के लिए स्मार्ट, लक्षित मूव्स बनाकर, हम उन्हें बिना उनके मस्तिष्क को पूरी तरह से पुन: प्रशिक्षित किए बहुत कठिन, लंबे कार्यों को हल करने में मदद कर सकते हैं। यह कुछ ऐसा है जैसे यह महसूस करना कि पहाड़ चढ़ने के लिए, आपको शिखर देखने की आवश्यकता नहीं है; आपको बस अगले कुछ कदमों के लिए अपना पैर कहाँ रखना है, यह जानने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →