A complementary study on PlanGPT: Evaluation with defined Performance Metrics and comparison with a planner
यह शोध पत्र परिभाषित प्रदर्शन मेट्रिक्स का उपयोग करके PlanGPT लार्ज लैंग्वेज मॉडल के एक पूरक मूल्यांकन को प्रस्तुत करता है, जो यह प्रकट करता है कि यह पारंपरिक प्लानर्स की तुलना में कोई लाभ नहीं देता है और एक साधारण ग्रीडी (Greedy) सर्च रणनीति से बेहतर प्रदर्शन नहीं करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कमरा साफ करने के लिए निर्देश देने की कोशिश कर रहे हैं। आपके पास नियमों की एक सूची है (जैसे "मोजा उठाओ," "मोजे को टोकरी में डालो"), कमरे की एक शुरुआती तस्वीर है, और एक साफ कमरे की लक्ष्य तस्वीर है। रोबोट को गंदगी से साफ स्थिति तक पहुँचने के लिए चरणों का सटीक क्रम पता लगाना होगा।
आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे ऑटोमेटेड प्लानिंग (Automated Planning) कहा जाता है। आमतौर पर, हम इन पहेलियों को हल करने के लिए विशेष, अत्यधिक तार्किक कंप्यूटर प्रोग्रामों का उपयोग करते हैं जिन्हें प्लानर्स (Planners) कहा जाता है। वे शतरंज के उस्ताद खिलाड़ियों की तरह होते हैं जो हर संभावित चाल की गणना करके सही रास्ता खोज लेते हैं।
हाल ही में, PlanGPT नामक एक नया प्रकार का AI पेश किया गया। PlanGPT को एक तर्क मशीन के बजाय एक सुपर-क्रिएटिव राइटर (अति-रचनात्मक लेखक) के रूप में सोचें (एक लार्ज लैंग्वेज मॉडल), जिसे चरणों के निर्देश "लिखने" के लिए प्रशिक्षित किया गया है, न कि गणना करने के लिए। बड़ा सवाल यह था: क्या यह रचनात्मक लेखक वास्तव में एक मास्टर लॉजिक मशीन का काम कर सकता है, या यह केवल अनुमान लगा रहा है?
यह शोध पत्र एक "पूरक अध्ययन" (complementary study) है, जिसका अर्थ है कि लेखकों ने PlanGPT के काम की दोबारा जाँच करने का निर्णय लिया क्योंकि मूल रिपोर्ट ने पूरी कहानी नहीं बताई थी।
प्रयोग: तीन धावकों के बीच एक दौड़
यह देखने के लिए कि क्या PlanGPT अच्छा है, लेखकों ने सात अलग-अलग "कमरों" (डोमेन) के ट्रैक पर तीन धावकों के साथ एक दौड़ आयोजित की, जिनमें ब्लॉक को स्टैक करने से लेकर ट्रक चलाने तक के कार्य शामिल थे:
- PlanGPT (रचनात्मक लेखक): नया AI जो सीखे गए पैटर्न के आधार पर योजना का अनुमान लगाने की कोशिश करता है।
- A (परफेक्शनिस्ट/पूर्णतावादी):* एक पारंपरिक प्लानर जो सबसे अच्छा और छोटा रास्ता खोजने के लिए समय लेता है, लेकिन कभी-कभी फंस जाता है यदि कमरा बहुत अधिक बिखरा हुआ हो।
- Greedy (स्प्रिंटर/तेज धावक): एक पारंपरिक प्लानर जो पहला वैध रास्ता पकड़ लेता है। यह हमेशा सबसे अच्छा रास्ता नहीं होता, लेकिन यह अविश्वसनीय रूप से तेज़ है।
लेखकों ने दो चीजें मापीं:
- प्लान कॉस्ट (Plan Cost): रोबोट को कितने कदम उठाने पड़े? (कम कदम = बेहतर)।
- प्लानिंग टाइम (Planning Time): कंप्यूटर को योजना बनाने में कितना समय लगा?
परिणाम: लेखक बनाम स्प्रिंटर
लेखकों ने पाया, कुछ सरल उपमाओं का उपयोग करते हुए:
- "परफेक्ट" रास्ता: PlanGPT कभी-कभी परफेक्शनिस्ट (A*) जितना अच्छा रास्ता खोजने में सक्षम था, लेकिन अक्सर ऐसा नहीं था।
- स्पीड टेस्ट: स्प्रिंटर (Greedy) योजना बनाने में लगभग हमेशा सबसे तेज़ था। PlanGPT कभी-कभी परफेक्शनिस्ट से तेज़ था, लेकिन अक्सर स्प्रिंटर से धीमा था।
- बड़ा आश्चर्य: जब उन्होंने समग्र स्कोर को देखा, तो PlanGPT ने स्प्रिंटर (Greedy) से बेहतर प्रदर्शन नहीं किया। कई मामलों में, स्प्रिंटर वास्तव में बेहतर और छोटे प्लान खोजने में सक्षम था।
"वन-साइज़-फिट्स-नॉट" (एक ही आकार सबके लिए नहीं) की समस्या:
लेखकों ने PlanGPT के डिज़ाइन में एक प्रमुख खामी की ओर इशारा किया। काम करने के लिए, PlanGPT को हर एक प्रकार के कमरे के लिए एक अलग "दिमाग" (मॉडल) की आवश्यकता होती है।
- यदि आप ब्लॉक स्टैक करना चाहते हैं, तो आपको मॉडल A चाहिए।
- यदि आप ट्रक चलाना चाहते हैं, तो आपको मॉडल B चाहिए।
- यदि आप सैटेलाइट उड़ाना चाहते हैं, तो आपको मॉडल C चाहिए।
यह अपने घर के हर काम के लिए एक अलग विशेषज्ञ को काम पर रखने जैसा है। एक व्यक्ति खाना बनाने में अच्छा है, दूसरा सफाई करने में, लेकिन आपको 8 अलग-अलग काम करने के लिए 8 अलग-अलग लोगों को काम पर रखना पड़ता है। यह बहुत अधिक कंप्यूटर संसाधनों (कंप्यूटिंग पावर) का उपयोग करता है। लेखकों ने पूछा: क्या एक ही तेज़ "स्प्रिंटर" द्वारा किए जाने वाले काम को करने के लिए महंगे विशेषज्ञों की एक पूरी टीम को काम पर रखना सार्थक है?
निष्कर्ष
यह शोध पत्र निष्कर्ष निकालता है कि हालांकि PlanGPT एक दिलचस्प प्रयोग है, लेकिन यह वर्तमान में एक "सक्षम" (competent) प्लानर नहीं है।
- यह लगातार साधारण और तेज़ तरीकों से बेहतर योजनाएं नहीं खोज पाता है।
- इसे भारी मात्रा में संसाधनों (8 अलग-अलग मॉडल, बहुत अधिक कंप्यूटिंग पावर) की आवश्यकता होती है।
- यह उन जटिल समस्याओं को नहीं संभाल सकता जिनमें प्रशिक्षण के दौरान देखे गए ऑब्जेक्ट्स से अधिक वस्तुओं की आवश्यकता होती है।
लेखक सुझाव देते हैं कि शायद लार्ज लैंग्वेज मॉडल्स (जैसे PlanGPT) इस विशिष्ट कार्य के लिए सही उपकरण नहीं हैं। वे कहानियाँ लिखने या चैट करने के लिए बेहतर हो सकते हैं, जबकि पारंपरिक लॉजिक प्रोग्राम अभी भी योजना बनाने के लिए सबसे अच्छा विकल्प बने हुए हैं। वे संकेत देते हैं कि शायद एक अलग प्रकार का AI, जो केवल "शब्दों की भविष्यवाणी" करने के बजाय "तर्क (reasoning)" करने के लिए डिज़ाइन किया गया हो, भविष्य हो सकता है, लेकिन फिलहाल, रचनात्मक लेखक ने तर्क मशीन को नहीं हराया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।