PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement
PIVOT एक स्व-पर्यवेक्षित (self-supervised) फ्रेमवर्क है जो योजना (planning) और निष्पादन (execution) के बीच के अंतर को पाटने के लिए योजना, निरीक्षण, विकास और सत्यापन की चार-चरणीय प्रक्रिया के माध्यम से उम्मीदवार प्रक्षेप पथों (candidate trajectories) को पुनरावृत्ति से परिष्कृत करता है, जिससे काफी कम कम्प्यूटेशनल लागत के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ PIVOT पेपर का विवरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों में विभाजित किया गया है।
बड़ी समस्या: "दिन में सपने देखने वाला शेफ" (The Daydreaming Chef)
कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान शेफ (एक AI एजेंट) को एक डिनर पार्टी के लिए एक जटिल, बहु-कोर्स डिनर बनाने के लिए काम पर रखा है।
- योजना (The Plan): शेफ बैठता है, एक सुंदर, विस्तृत मेनू लिखता है, और आवश्यक प्रत्येक सामग्री की सूची बनाता है। यह कागज़ पर एकदम सही दिखता है।
- वास्तविकता (The Reality): जब शेफ खाना बनाना शुरू करता है, तो उसे एहसास होता है कि उसके पास मांगी गई विशिष्ट मछली नहीं है, ओवन खराब है, या वह वाइन खरीदना भूल गया है। क्योंकि उसने खाना बनाते समय रसोई की जाँच नहीं की, इसलिए वह मूल योजना का पालन करता रहता है। परिणाम क्या होता है? एक जला हुआ भोजन या ऐसा व्यंजन जो ऑर्डर से मेल नहीं खाता।
AI की दुनिया में, इसे प्लान-एग्जीक्यूशन मिसअलाइनमेंट (Plan-Execution Misalignment) कहा जाता है। AI एक बेहतरीन योजना लिखता है, लेकिन जब वह वास्तविक काम (जैसे वेब सर्च करना या फ्लाइट बुक करना) करने की कोशिश करता है, तो वह उन बाधाओं से टकरा जाता है जिनकी उसने भविष्यवाणी नहीं की थी। योजना को ठीक करने के लिए रुकने के बजाय, वह आगे बढ़ता रहता है, जिससे गलतियाँ बढ़ती जाती हैं और अंततः पूरा कार्य विफल हो जाता है।
समाधान: PIVOT (Plan–Inspect–eVOlve Trajectories)
लेखकों ने इस समस्या को ठीक करने के लिए PIVOT नामक एक नई प्रणाली बनाई है। PIVOT को केवल तेज़ खाना बनाने वाले शेफ के रूप में न देखें, बल्कि एक स्मार्ट सू-शेफ (sous-chef) के रूप में देखें जो लगातार काम की जाँच करता है और मुख्य शेफ को वास्तविक समय में तालमेल बिठाने में मदद करता है।
PIVOT चार सरल चरणों में काम करता है, एक लूप की तरह:
1. PLAN (ब्लूप्रिंट/योजना)
AI द्वारा किसी भी टूल (जैसे सर्च इंजन या कैलकुलेटर) का उपयोग करने से पहले, उसे एक संरचित योजना लिखनी होगी।
- उदाहरण: यह एक शेफ की तरह है जो किराने के स्टोर पर जाने से पहले यह लिख लेता है कि उसे क्या और किस क्रम में खरीदना है (जैसे, "यदि स्टोर में सैल्मन खत्म हो जाए, तो मैं ट्राउट खरीदूँगा")।
2. INSPECT (स्वाद परीक्षण/जाँच)
जैसे-जैसे AI योजना को चरण-दर-चरण निष्पादित करता है, वह रुककर जाँच करता है: "क्या यह वास्तव में काम कर रहा है?"
- उदाहरण: कल्पना कीजिए कि शेफ हर कदम के बाद सॉस को चखता है। यदि सॉस बहुत नमकीन है, तो वह भोजन के अंत तक इंतज़ार नहीं करता कि उसे पता चले। वह त्रुटि को तुरंत पकड़ लेता है।
- जादू: यदि कुछ गलत हो जाता है, तो PIVOT केवल "Error" नहीं कहता। यह एक जासूस की तरह काम करता है, गलती से पीछे की ओर (backward) जाकर यह पता लगाता है कि योजना ठीक किस क्षण पटरी से उतरी थी। यह पूछता है, "यह क्यों विफल हुआ?" और "किस चरण के कारण यह हुआ?"
3. EVOLVE (पिवट/बदलाव)
एक बार त्रुटि मिल जाने के बाद, AI पूरे भोजन को फेंक नहीं देता। वह केवल टूटे हुए हिस्से को ठीक करता है।
- उदाहरण: यदि शेफ को एहसास होता है कि मछली खराब हो गई है, तो वह पूरे किचन को जलाने या सब कुछ शुरू से शुरू करने के बजाय, मछली को किसी अन्य प्रोटीन से बदल देता है, लेकिन ऐपेटाइज़र और सलाद को वैसा ही रखता है।
- यह कैसे काम करता है: AI योजना के उन हिस्सों को रखता है जो काम कर रहे थे ("validated prefix") और केवल उस हिस्से को फिर से लिखता है जो विफल हुआ ("unsupported suffix")। यह पुनर्गठन के लिए "टेस्ट टेस्ट" फीडबैक का उपयोग करता है।
4. VERIFY (अंतिम गुणवत्ता जाँच)
अंतिम उत्तर देने से पहले, AI मूल नियमों के विरुद्ध एक अंतिम जाँच करता है।
- उदाहरण: वेटर द्वारा खाना मेज पर ले जाने से पहले, हेड शेफ टिकट की आखिरी बार जाँच करता है: "क्या हमने शाकाहारी विकल्प शामिल किया? क्या प्रेजेंटेशन सही है? क्या हम नैपकिन भूल गए?" यह सुनिश्चित करता है कि भागदौड़ में कोई छोटी विवरण छूट न जाए।
यह अन्य तरीकों से बेहतर क्यों है?
अन्य AI विधियाँ अक्सर गलतियों को सुधारने की कोशिश करती हैं:
- अधिक प्रयास करके: बस AI को अधिक सोचने के लिए अधिक समय देना (जिससे अक्सर केवल भ्रमित सोच ही मिलती है)।
- शुरू से शुरू करके: यदि एक चरण विफल हो जाता है, तो वे पूरी योजना को फेंक देते हैं और फिर से शुरुआत करते हैं (समय और पैसा बर्बाद होता है)।
- बहुत कठोर होकर: एक सख्त चेकलिस्ट का उपयोग करना जो विशिष्ट समस्या के अनुकूल नहीं होती।
PIVOT अलग है क्योंकि:
- यह सर्जिकल (Surgical) है: यह केवल टूटे हुए हिस्से को ठीक करता है, जिससे समय और प्रयास बचता है।
- यह गंदगी से सीखता है: यह वास्तविक विफलता का उपयोग एक "टेक्स्टुअल ग्रेडिएंट" (गलती को ठीक करने के लिए एक विशिष्ट निर्देश) बनाने के लिए करता है, न कि केवल अनुमान लगाने के लिए।
- यह कुशल है: पेपर का दावा है कि PIVOT समान या बेहतर परिणाम प्राप्त करने के लिए अन्य तरीकों की तुलना में 3 से 5 गुना कम "टोकन" (वह मुद्रा जिसका उपयोग AI सोचने और बोलने के लिए करता है) का उपयोग करता है। यह आधे किराने के बिल में एक बेहतरीन भोजन पाने जैसा है।
परिणाम
शोधकर्ताओं ने दो प्रकार के कठिन कार्यों पर PIVOT का परीक्षण किया:
- यात्रा और खरीदारी: सख्त नियमों (बजट, तारीखें, विशिष्ट होटल) के साथ जटिल यात्राओं की योजना बनाना।
- सामान्य प्रश्न: टूल्स का उपयोग करके खुले प्रश्नों (open-ended problems) को हल करना।
निष्कर्ष:
- मानवीय सहायता के साथ: यदि कोई इंसान AI को फंसने पर फीडबैक देता है, तो PIVOT मानक तरीकों की तुलना में सफलता दर को 94% तक बढ़ा सकता है।
- मानवीय सहायता के बिना: भले ही AI को खुद को ठीक करना पड़े (स्वायत्त रूप से), यह अभी भी अन्य AI एजेंटों की तुलना में बहुत बेहतर प्रदर्शन करता है, और अक्सर उन्हें काफी पीछे छोड़ देता है।
- लागत: यह अपने प्रतिस्पर्धियों की तुलना में बहुत कम कंप्यूटिंग पावर का उपयोग करते हुए ये परिणाम प्राप्त करता है।
सारांश
PIVOT एक ऐसा फ्रेमवर्क है जो AI एजेंटों को योजना बनाना, अपने काम की जाँच करना, केवल टूटे हुए हिस्सों को ठीक करना और अंतिम परिणाम की दोबारा जाँच करना सिखाता है। यह AI को एक खराब योजना का आँख मूंदकर पालन करने से रोकता है और इसके बजाय उन्हें गतिशील रूप से अनुकूलित होने में मदद करता है, जिससे वे अधिक विश्वसनीय, कुशल और जटिल, वास्तविक दुनिया के कार्यों को संभालने में सक्षम बनते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।