Improved Generalized Planning with LLMs through Strategy Refinement and Reflection
यह शोध पत्र LLM-आधारित सामान्यीकृत योजना (generalized planning) के लिए एक उन्नत ढांचे को प्रस्तुत करता है जो स्वचालित डिबगिंग के साथ स्यूडोकोड-आधारित रणनीति परिशोधन (pseudocode-based strategy refinement) को पेश करके, विफलताओं का निदान करने के लिए प्रतिबिंब (reflection) को शामिल करके, और कई प्रोग्राम वेरिएंट उत्पन्न करके योजना की गुणवत्ता को बढ़ाता है, जिससे 17 बेंचमार्क डोमेन में औसतन 82% कवरेज प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े शाब्दिक अर्थों में सोचने वाले (literal-minded) रोबोट को एक विशिष्ट प्रकार की पहेली हल करना सिखाने की कोशिश कर रहे हैं। मान लीजिए कि पहेली लॉजिस्टिक्स (Logistics) है: ट्रकों और विमानों का उपयोग करके पैकेज एक शहर से दूसरे शहर भेजना।
अतीत में, शोधकर्ताओं ने रोबोट (एक लार्ज लैंग्वेज मॉडल, या LLM) को एक-एक करके हर सिंगल पहेली हल करने के लिए कहने की कोशिश की थी। यह ऐसा था जैसे रोबोट से पूछना, "मैं इस एक बॉक्स को कैसे हिलाऊं?" फिर "मैं उस दूसरे बॉक्स को कैसे हिलाऊं?" यह धीमा, महंगा था, और जब पहेली बड़ी होती थी तो रोबोट अक्सर भ्रमित हो जाता था।
फिर, एक नया विचार आया: सामान्यीकृत योजना (Generalized Planning)। एक अकेली पहेली हल करने के बजाय, हम रोबोट को एक मास्टर रेसिपी (एक कंप्यूटर प्रोग्राम) लिखने के लिए कहते हैं जो किसी भी लॉजिस्टिक्स पहेली को हल कर सके, चाहे उसमें कितने भी बॉक्स या शहर शामिल हों।
हालाँकि, पहले के प्रयासों में एक बड़ी खामी थी। यह ऐसा था जैसे रोबोट को रेसिपी लिखने के लिए कहना, लेकिन रोबोट आपको केवल एक अस्पष्ट पैराग्राफ दे देता जैसे, "खाना तब तक पकाएं जब तक वह तैयार न हो जाए।" यदि रोबोट अस्पष्ट निर्देशों को गलत समझ लेता, तो बनने वाली रेसिपी बेकार हो जाती और खाना जल जाता। शोधकर्ता रेसिपी को आसानी से ठीक नहीं कर पा रहे थे क्योंकि वे सीधे अंतिम कोड को डीबग करने की कोशिश कर रहे थे, जो कार के इंजन को ठीक करने जैसा है जबकि कार अभी भी चल रही हो।
यह पेपर इस समस्या को ठीक करने के लिए एक तीन-चरणीय अपग्रेड पेश करता है, जो रोबोट को ये मास्टर रेसिपी लिखने में बहुत बेहतर बनाता है। यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:
1. "ब्लूप्रिंट" चरण (स्यूडोकोड रणनीति - Pseudocode Strategy)
रोबोट को सीधे जटिल कोड (अंतिम रेसिपी) लिखने के लिए कहने के बजाय, शोधकर्ता पहले उससे एक ब्लूप्रिंट या एक फ्लोचार्ट बनाने के लिए कहते हैं जो सरल, संरचित अंग्रेजी (जिसे स्यूडोकोड कहा जाता है) का उपयोग करता है।
- पुराना तरीका: "एक प्रोग्राम लिखें जो पैकेज स्थानांतरित करे।" -> रोबोट तुरंत कोड लिखता है।
- नया तरीका: "पहले, सरल अंग्रेजी में निर्देशों की एक चरण-दर-चरण सूची लिखें, जैसे कि एक फ्लोचार्ट।"
- उदाहरण: "1. पैकेज को खोजें। 2. क्या यह उसी शहर में है जहाँ लक्ष्य है? यदि हाँ, तो ट्रक चलाएं। यदि नहीं, तो हवाई अड्डे तक जाएं, उड़ान भरें, और फिर से ड्राइव करें।"
यह क्यों मदद करता है: कंप्यूटर कोड की एक दीवार की तुलना में एक सरल चरणों की सूची में तर्क की गलती (logic error) को पहचानना बहुत आसान है। यह सड़क पर फंसे होने के दौरान अपने जीपीएस को ठीक करने के बजाय, ड्राइविंग शुरू करने से पहले एक नक्शा चेक करने जैसा है।
2. "मॉक ट्रायल" चरण (रणनीति सत्यापन और प्रतिबिंब - Strategy Validation & Reflection)
एक बार जब रोबोट के पास अपना ब्लूप्रिंट होता है, तो शोधकर्ता केवल उस पर भरोसा नहीं करते। वे इसे एक मॉक ट्रायल (नकली परीक्षण) से गुजारते हैं।
- प्रक्रिया: वे कुछ छोटी, आसान पहेलियाँ लेते हैं और रोबोट से कहते हैं: "ठीक है, इस विशिष्ट पहेली को हल करने के लिए अपने ब्लूप्रिंट का पालन करें।"
- सावधानी: रोबोट वास्तव में कोड नहीं चला रहा है; वह केवल योजना का अनुकरण (simulate) कर रहा है। यदि योजना विफल हो जाती है (जैसे, रोबोट पैकेज को विमान पर लोड करने की कोशिश करता है जबकि वह अभी भी ट्रक के अंदर है), तो सिस्टम त्रुटि को पकड़ लेता है।
- "रिफ्लेक्शन" (प्रतिबिंब) चरण: यही असली जादू है। केवल "त्रुटि" (Error) कहने के बजाय, सिस्टम रोबोट से पूछता है कि वह क्यों विफल हुआ।
- सिस्टम: "आपने पैकेज को विमान पर लोड करने की कोशिश की, लेकिन पैकेज अभी भी ट्रक में था। आपके ब्लूप्रिंट में यह चरण क्यों छूट गया?"
- रोबोट: "ओह, मैं समझ गया! मेरे ब्लूप्रिंट में विमान पर लोड करने से पहले 'पैकेज को ट्रक से उतारना' लिखना भूल गया।"
- रोबोट: "मैं अब ब्लूप्रिंट को ठीक करूँगा।"
यह एक छात्र द्वारा अभ्यास परीक्षा देने, एक प्रश्न गलत करने, और फिर दोबारा प्रयास करने से पहले यह समझाने के लिए पूछे जाने जैसा है कि उन्होंने वह गलत क्यों किया। यह "रिफ्लेक्शन" रोबोट को वही गलती दोबारा करने से रोकता है।
3. "टेस्टिंग पैनल" चरण (कोड के कई संस्करण - Multiple Code Versions)
अंत में, जब ब्लूप्रिंट एकदम सही हो जाता है, तो रोबोट वास्तविक कंप्यूटर कोड लिखता है। लेकिन शोधकर्ता केवल पहले ड्राफ्ट को स्वीकार नहीं करते।
- प्रक्रिया: वे रोबोट को उसी सटीक ब्लूप्रिंट के आधार पर कोड के तीन या पांच अलग-अलग संस्करण लिखने के लिए कहते हैं।
- चयन: वे इन सभी संस्करणों को टेस्ट पहेलियों पर चलाते हैं और जो सबसे अच्छा काम करता है उसे चुनते हैं।
यह क्यों मदद करता है: कभी-कभी, एक अच्छे ब्लूप्रिंट के साथ भी, एक शेफ प्याज को थोड़ा अलग तरीके से काट सकता है। कई संस्करण बनाकर, आप यह सुनिश्चित करते हैं कि आपको सबसे अच्छा "व्यंजन" मिले।
परिणाम: एक सुपर-रेसिपी
शोधकर्ताओं ने इस नई पद्धति का परीक्षण 17 अलग-अलग प्रकार की पहेलियों (ट्रक चलाने से लेकर सैटेलाइट उड़ाने तक) पर चार अलग-अलग AI मॉडल्स का उपयोग करके किया।
- पुराना तरीका: रोबोट औसतन लगभग 37% पहेलियाँ सही हल कर पाया।
- नया तरीका: रोबोट 82% पहेलियाँ सही हल कर पाया।
इससे भी अधिक प्रभावशाली बात यह है कि रोबोट ने जो "रेसिपी" लिखीं, वे सामान्य (general) थीं। वे केवल उन विशिष्ट पहेलियों के लिए नहीं थीं जिन्हें रोबोट ने प्रशिक्षण के दौरान देखा था; वे उन पहेलियों के लिए भी काम करती थीं जिनमें अधिक पैकेज, अधिक शहर और अधिक जटिलता शामिल थी, जो रोबोट ने पहले कभी नहीं देखी थीं।
सारांश
इस पेपर को एक AI को बिल्डर (निर्माता) बनने से पहले एक बेहतर आर्किटेक्ट (वास्तुकार) सिखाने के रूप में देखें।
- अभी निर्माण न करें: पहले, एक विस्तृत, चरण-दर-चरण ब्लूप्रिंट बनाएं (स्यूडोकोड)।
- ब्लूप्रिंट का परीक्षण करें: योजना में कमियों को खोजने के लिए सिमुलेशन चलाएं।
- चिंतन करें और सुधारें: AI को अपनी गलतियों को समझाने और ब्लूप्रिंट को फिर से बनाने के लिए कहें।
- निर्माण करें और चुनें: ठीक किए गए ब्लूप्रिंट के आधार पर कुछ अलग-अलग इमारतें बनाएं और सबसे मजबूत वाली चुनें।
अंतिम कोड लिखने से पहले सोचने और चिंतन करने के लिए धीमा होकर, AI बहुत अधिक विश्वसनीय, शक्तिशाली और सामान्य समाधान बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।