Any House Any Task: Scalable Long-Horizon Planning for Abstract Human Tasks
यह शोध पत्र AHAT का प्रस्ताव करता है, जो एक स्केलेबल लॉन्ग-होरिज़न प्लानिंग फ्रेमवर्क है जो एक नवीन सुदृढीकरण शिक्षण एल्गोरिदम (TGPO) के माध्यम से प्रशिक्षित एक LLM का लाभ उठाता है ताकि अस्पष्ट मानवीय निर्देशों और सीन ग्राफ को PDDL सबगोल्स में अनुवादित किया जा सके, जिससे रोबोटों को बड़े वातावरणों में जटिल घरेलू कार्यों के लिए इष्टतम योजनाएं उत्पन्न करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को अपना बिखरा हुआ कमरा साफ करना सिखाने की कोशिश कर रहे हैं। आप उसे एक स्टेप-बाय-स्टेप मैनुअल नहीं देना चाहते जैसे कि "मोजा उठाओ, फिर दो कदम चलो, फिर नीचे झुको।" यह बहुत उबाऊ और नाजुक है; अगर मोजा हिल भी गया, तो रोबोट भ्रमित हो जाएगा। इसके बजाय, आप बस कहना चाहते हैं, "इस कमरे को व्यवस्थित करो," और चाहते हैं कि रोबोट बाकी सब खुद समझ ले। यह रोबोटिक्स का 'होली ग्रेल' (सर्वोच्च लक्ष्य) है: एक अस्पष्ट, मानवीय इच्छा को एक सटीक, भौतिक कार्य योजना में बदलना।
इसे करने के लिए, वैज्ञानिक अक्सर दो अलग-अलग उपकरणों का उपयोग करते हैं। पहला है एक लार्ज लैंग्वेज मॉडल (LLM), जो एक अत्यंत बुद्धिमान, सुशिक्षित लाइब्रेरियन की तरह है जिसे दुनिया के बारे में लाखों तथ्य पता हैं, लेकिन कभी-कभी वह कहानियाँ गढ़ देता है या भौतिकी (फिजिक्स) के नियमों को भूल जाता है। दूसरा है एक सिंबोलिक प्लानर (Symbolic Planner), जो एक सख्त, अडिग गणित शिक्षक की तरह है जो नियमों का पूरी तरह पालन करता है लेकिन उसे पता ही नहीं कि "व्यवस्थित" का क्या अर्थ है या इंसानों से कैसे बात की जाए। सबसे बड़ी चुनौती इस बात की है कि बातूनी लाइब्रेरियन और सख्त गणित शिक्षक को एक साथ कैसे काम कराया जाए ताकि लाइब्रेरियन रोबोट को लूप में न फंसा दे और गणित शिक्षक बहुत अधिक अस्पष्ट निर्देशों के कारण काम शुरू करने से मना न कर दे।
यह ठीक वही समस्या है जिसे TGPO (ट्रेस-गाइडेड पॉलिसी ऑप्टिमाइजेशन) नामक एक नए शोध पत्र में हल किया गया है। शोधकर्ता एक रोबोट को यह सिखाने की कोशिश कर रहे हैं कि कैसे बड़े, धुंधले मानवीय आदेशों को छोटे, जांच योग्य चरणों की एक श्रृंखला में तोड़ा जाए जिसे एक रोबोट वास्तव में पालन कर सके। उन्होंने पाया कि केवल एक स्मार्ट AI से "बस इसे कर दो" कहने से अक्सर ऐसे प्लान बनते हैं जो कागज पर तो अच्छे दिखते हैं लेकिन वास्तविक दुनिया में विफल हो जाते हैं। इसके बजाय, उन्होंने एक चतुर प्रशिक्षण पद्धति विकसित की जहां AI अपनी सोच का एक "ट्रेस" (trace) बनाना सीखता है, एक सहायक द्वारा गलती होने पर सुधारा जाता है, और फिर वह दोबारा प्रयास करता है। यह एक छात्र को केवल अंत में ग्रेड देने के बजाय, उसके होमवर्क के माध्यम से उसे समझाने, उसकी तर्क संबंधी गलतियों को सुधारने और उसे तब तक अभ्यास करने देने जैसा है जब तक कि वह सही न कर ले। परिणाम स्वरूप, यह प्रणाली पिछले तरीकों की तुलना में लंबे, जटिल कार्यों—जैसे कि किसी पार्टी के लिए पूरा घर तैयार करना—के लिए बहुत बेहतर प्लानिंग करती है, खासकर जब निर्देश अस्पष्ट हों।
समस्या: वह "जादुई छड़ी" जो टूट जाती है
कल्पना कीजिए कि आपके पास एक रोबोट बटलर (सेवक) है। आप उससे कहते हैं, "मैं एक उत्सव समारोह आयोजित कर रहा हूँ, इसलिए घर की सफाई कर दो।" एक इंसान इसे तुरंत समझ जाता है: वह जानता है कि कचरा उठाना है, मेज पोंछनी है, और शायद सजावट का सामान रखना है। लेकिन एक रोबोट के लिए, यह एक दुःस्वप्न है। यदि आप किसी मानक AI से केवल "एक योजना लिखने" के लिए कहते हैं, तो वह कल्पना (hallucinate) कर सकता है। वह कह सकता है, "सोफे को रसोई में ले जाओ," भले ही सोफा बहुत भारी हो, या "फर्श साफ करने के लिए चूल्हा चालू करो," जो कि एक बहुत बुरा विचार है।
शोध पत्र बताता है कि वर्तमान AI मॉडल वाक्य में आगे क्या आने वाला है इसका अनुमान लगाने में तो बेहतरीन हैं, लेकिन वे यह सुनिश्चित करने में बहुत खराब हैं कि उनकी योजनाएं व्यवहार्य (feasible) हैं या नहीं। वे शुरुआत में ही छोटी गलतियाँ कर देते हैं—जैसे मेज हिलाने से पहले कप उठाना भूल जाना—और वे गलतियाँ ताश के पत्तों के महल की तरह जमा होती जाती हैं जब तक कि पूरी योजना ध्वस्त नहीं हो जाती। दूसरी ओर, पारंपरिक रोबोट प्लानर बहुत सुरक्षित होते हैं; वे ऐसा कुछ नहीं करेंगे जो असंभव हो। लेकिन वे बहुत मंदबुद्धि भी होते हैं; उन्हें आपको बहुत विशिष्ट कोड (जिसे PDDL कहा जाता है) में बताना पड़ता है कि उन्हें क्या करना है, और वे "पार्टी के लिए सफाई" जैसे सूक्ष्म अर्थों को नहीं समझ सकते।
समाधान: TGPO (द "ट्रेस-गाइडेड" कोच)
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे ट्रेस-गाइडेड पॉलिसी ऑप्टिमाइजेशन (TGPO) कहा जाता है। TGPO को एक ऐसे रोबोट के रूप में न देखें जो केवल अनुमान लगाता है, बल्कि एक ऐसे छात्र के रूप में देखें जो एक बहुत ही सख्त, सहायक कोच के साथ सीख रहा है।
यहाँ प्रशिक्षण कैसे काम करता है, एक सरल उदाहरण के माध्यम से:
- छात्र (AI पॉलिसी): रोबोट का मस्तिष्क आपके आदेश ("पार्टी के लिए सफाई करें") को उप-लक्ष्यों (sub-goals) की एक सूची में तोड़ने की कोशिश करता है। शायद वह कहता है: "1. कचरा उठाओ। 2. बर्तन धोओ। 3. वैक्यूम करो।"
- कोच (वेरिफायर): एक सख्त चेकर इस सूची को देखता है। वह पूछता है, "रुको, क्या तुम वास्तव में बर्तन धो सकते हो यदि सिंक खाने से भरा है? क्या तुमने वैक्यूम करने से पहले कुर्सियां हटाना याद रखा?"
- "ट्रेस" सुधार: यदि छात्र की योजना गलत है, तो कोच केवल "फेल" नहीं कहता। इसके बजाय, वह सोचने की प्रक्रिया (ट्रेस) को देखता है और विशिष्ट गलती को ठीक करता है। वह कह सकता है, "तुम पहले सिंक खाली करना भूल गए। यहाँ सुधारे गए चरणों की सूची है।"
- अभ्यास लूप: रोबोट फिर इस सुधारे गए सूची को लेता है और इसके आधार पर शेष योजना बनाने का प्रयास करता है। वह केवल अंतिम "पास/फेल" ग्रेड से नहीं, बल्कि सुधार से सीखता है।
यह आज के अधिकांश AI प्रशिक्षण से अलग है। आमतौर पर, आप एक AI को कुछ करने के लिए कहते हैं, और यदि वह विफल हो जाता है, तो आप बस उसे "खराब काम" कहते हैं और फिर से प्रयास करते हैं। यह गणित के टेस्ट में फेल होने और बिना यह देखे कि कहाँ गलती हुई, केवल "F" ग्रेड प्राप्त करने जैसा है। TGPO उस लाल पेन के निशान मिलने जैसा है जो आपको टेस्ट देते समय मिलते हैं, ताकि आप पेपर जमा करने से पहले ही अपनी तर्क प्रक्रिया को ठीक कर सकें।
उन्होंने क्या पाया: रोबोट अधिक स्मार्ट हो गया
शोधकर्ताओं ने साधारण कार्यों जैसे "मुझे तौलिया ला दो" से लेकर अविश्वसनीय रूप से जटिल कार्यों जैसे "उत्सव के लिए घर तैयार करना" (जिसमें फर्नीचर हिलाना, सफाई करना और एक विशिष्ट क्रम में व्यवस्थित करना शामिल है) तक, विविध कार्यों पर इस नई पद्धति का परीक्षण किया।
उन्होंने अपने रोबोट की तुलना दो अन्य प्रकार के प्लानर्स से की:
- "प्रॉम्प्टिंग" वाले रोबोट: ये वे AI मॉडल हैं जिन्हें केवल एक योजना लिखने के लिए कहा जाता है। शोध पत्र में पाया गया कि जैसे-जैसे कार्य कठिन और अमूर्त होते गए, ये रोबोट बुरी तरह विफल रहे। वे जटिलता से भ्रमित हो गए और असंभव क्रियाएं सुझाने लगे।
- "मानक लर्निंग" वाले रोबोट: ये वे रोबोट हैं जिन्हें मानक सुदृढीकरण शिक्षण (reinforcement learning - प्रयास और त्रुटि) के साथ प्रशिक्षित किया गया है। वे प्रॉम्प्टिंग रोबोट की तुलना में बेहतर थे, लेकिन फिर भी संघर्ष करते रहे जब निर्देश अस्पष्ट थे या कार्य बहुत लंबे थे।
परिणाम:
TGPO रोबोट स्पष्ट विजेता था।
- आसान कार्यों पर, यह लगभग 88% बार सफल रहा।
- जटिल कार्यों पर (क्रियाओं की लंबी श्रृंखला), यह 77% बार सफल रहा।
- अमूर्त कार्यों पर (जहाँ रोबोट को अनुमान लगाना था कि "सफाई" का क्या अर्थ है), यह 70% बार सफल रहा।
तुलना में, सबसे अच्छा "प्रॉम्प्टिंग" रोबोट उन्हीं अमूर्त कार्यों पर केवल 22% बार सफल हुआ। शोध पत्र सुझाव देता है कि TGPO की अपनी सोच की प्रक्रिया को वास्तविक समय में ठीक करने की क्षमता ही इसकी कुंजी है। यह केवल अनुमान नहीं लगाता; यह तर्क देता है, जाँच करता है, सुधार करता है और फिर कार्य करता है।
यह क्यों महत्वपूर्ण है
यह शोध पत्र दिखाता है कि रोबोट को "सत्यापन योग्य उप-लक्ष्य" (verifiable subgoals - छोटे, जांच योग्य चरण) उत्पन्न करना सिखाकर और एक ऐसी प्रणाली का उपयोग करके जो उनके सोचने के 'ट्रेस' को ठीक करती है, हम उन्हें वास्तविक दुनिया में बहुत अधिक विश्वसनीय बना सकते हैं। लेखक नोट करते हैं कि यह तब भी काम करता है जब वातावरण अव्यवस्थित हो या निर्देश अस्पष्ट हों।
हालाँकि, वे सावधानीपूर्वक यह भी बताते हैं कि यह अभी भी हर रोबोट समस्या के लिए जादुई समाधान नहीं है। यह प्रणाली अभी भी दुनिया के एक पूर्व-निर्धारित मानचित्र (सीन ग्राफ) और नियमों के एक सेट पर निर्भर करती है जिसे रोबोट जानता है। यह केवल कैमरे को देखकर शून्य से दुनिया को सीखना नहीं है; इसे योजना बनाने के लिए उस संरचित मानचित्र की आवश्यकता होती है। लेकिन मानवीय शब्दों को सुरक्षित, निष्पादन योग्य रोबोट क्रियाओं में बदलने के विशिष्ट कार्य के लिए, TGPO एक बड़ी प्रगति का सुझाव देता है, जो यह सिद्ध करता है कि सही प्रकार के "कोचिंग" के साथ, AI अकेले करने की तुलना में बहुत बेहतर योजना बना सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।