HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning
यह शोध पत्र HIPIF का प्रस्ताव करता है, जो लंबे समय तक चलने वाले (long-horizon) LLM एजेंटों के लिए एक एंड-टू-एंड प्रशिक्षण ढांचा है, जो स्पष्ट उप-लक्ष्यों (subgoals) के इर्द-गिर्द निष्पादन को व्यवस्थित करके और पूर्ण इतिहास का सारांश प्रस्तुत करके संदर्भ हस्तक्षेप (context interference) को कम करता है, जबकि महंगी सहायक मॉडलों पर निर्भर हुए बिना नियोजन को स्थिर करने के लिए पदानुक्रमित प्रतिबिंब (hierarchical reflection) और प्रक्रिया पुरस्कारों (process rewards) का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन भुलक्कड़ रोबोट को पूरा घर साफ करना सिखाने की कोशिश कर रहे हैं। वह निर्देशों को समझने में बहुत अच्छा है, लेकिन यदि आप उसे एक लंबा, जटिल कार्य देते हैं (जैसे "रसोई साफ करें, फिर लिविंग रूम को व्यवस्थित करें, फिर कपड़े धोएं"), तो वह घबरा जाता है।
ऐसा क्यों है? क्योंकि रोबोट काम करते समय अपने द्वारा किए गए हर काम की एक चलती हुई डायरी रखता है। जब तक वह 50वें स्टेप पर पहुँचता है, उसकी डायरी सैकड़ों पन्नों की हो जाती है। वह अपने ही इतिहास में इतना खो जाता है कि वह मुख्य लक्ष्य को भूल जाता है, या वह बार-बार एक ही गलती दोहराने लगता है क्योंकि वह अब बड़ी तस्वीर नहीं देख पाता।
यह पेपर HIPIF (Hierarchical Planning and Information Folding) नामक एक नई प्रशिक्षण विधि पेश करता है ताकि इस समस्या को ठीक किया जा सके। सोचिए कि HIPIF रोबोट को सोचने और याद रखने का एक नया तरीका सिखा रहा है।
यह कैसे काम करता है, इसे तीन सरल अवधारणाओं में विभाजित किया गया है:
1. "सबगोल" रणनीति (बड़े कार्य को छोटे टुकड़ों में तोड़ना)
पूरे घर को एक साथ देखने के बजाय, HIPIF रोबोट को काम को छोटे, प्रबंधनीय "सबगोल" (उप-लक्ष्यों) में तोड़ने के लिए सिखाता है।
- उपमा: कल्पना कीजिए कि आप एक लंबा उपन्यास लिख रहे हैं। यदि आप पूरी कहानी एक ही बार में लिखने की कोशिश करेंगे, तो आप भ्रमित हो जाएंगे। इसके बजाय, आप एक बार में एक अध्याय लिखते हैं।
- HIPIF कैसे करता है: रोबोट पहले यह तय करता है, "मेरा पहला सबगोल गंदे बर्तन ढूंढना है।" एक बार जब वह उन्हें ढूंढ लेता है, तो वह उन 100 चीजों की पूरी सूची को देखते रहने के बजाय केवल बर्तनों पर ध्यान केंद्रित करता है।
2. "इन्फॉर्मेशन फोल्डिंग" (पूरे किए गए अध्यायों पर किताब बंद करना)
यह इस पेपर का सबसे अनूठा विचार है। आमतौर पर, AI अपनी पिछली हर क्रिया का हर विवरण अपनी "वर्किंग मेमोरी" में रखता है। HIPIF रोबोट को एक सबगोल पूरा होने के बाद उस पर किताब बंद करना सिखाता है।
- उपमा: कल्पना कीजिए कि आप एक रहस्यमयी उपन्यास पढ़ रहे हैं। एक बार जब आप पहला सुराग सुलझा लेते हैं, तो आपको सुराग याद रखने के लिए पहले 50 पन्ने दोबारा पढ़ने की आवश्यकता नहीं होती। आप बस अपनी नोटबुक में एक वाक्य का सारांश लिखते हैं: "चाबी मैट के नीचे मिली।" फिर आप उस अध्याय को बंद कर देते हैं और अगले पन्ने पर बढ़ जाते हैं।
- HIPIF कैसे करता है: जब रोबोट "बर्तन ढूंढने" का काम पूरा कर लेता है, तो वह उन बर्तनों को खोजने के लंबे, उलझे हुए इतिहास को एक छोटे, साफ सारांश (जैसे "बर्तन सिंक में मिले") में समेट देता है और उसे एक "पूर्ण" फोल्डर में रख देता है। फिर वह अगले सबगोल "बर्तन धोना" पर पूरी तरह से ध्यान केंद्रित करने के लिए अपनी तत्काल मेमोरी को खाली कर देता है। यह रोबोट को पुराने, अप्रासंगिक विवरणों से भ्रमित होने से रोकता है।
3. "सेल्फ-चेक" और "कोच" (चिंतन और पुरस्कार)
रोबोट को यह सिखाना कठिन है। यदि आप उसे सिर्फ "बेहतर करो" कहेंगे, तो वह नहीं जान पाएगा कि "कैसे"। HIPIF दो आंतरिक सहायकों को जोड़ता है:
Hierarchical Reflection (सेल्फ-चेक): एक नया कदम उठाने से पहले, रोबोट रुकता है और खुद से दो सवाल पूछता है:
- "क्या मैंने अपना वर्तमान सबगोल पूरा कर लिया है?" (उदाहरण के लिए, "क्या बर्तन वास्तव में साफ हैं?")
- "यदि हाँ, तो अगला सबगोल क्या है? यदि नहीं, तो मैं क्या गलत कर रहा हूँ?"
यह रोबोट को बहुत जल्दी आगे बढ़ने या किसी लूप में फंसने से रोकता है।
Subgoal-Oriented Process Rewards (कोच): सामान्य प्रशिक्षण में, रोबोट को पूरे कार्य के अंत में ही "अच्छा काम किया!" या "विफल" जैसा फीडबैक मिलता है। सीखने के लिए यह बहुत देर हो चुकी होती है। HIPIF एक कोच की तरह काम करता है जो खेल के दौरान फीडबैक देता है।
- यदि रोबोट ऐसे बर्तन धोने की कोशिश करता है जो मौजूद ही नहीं हैं, तो कोच कहता है, "रुको! यह एक बुरा विचार है।"
- यदि रोबोट एक ही काम को दो बार करने में फंस जाता है, तो कोच कहता है, "तुम लूप में फंस रहे हो! कुछ नया आज़माओ।"
यह रोबोट को हर संभावित स्थिति के लिए मानव द्वारा लिखे गए परफेक्ट स्क्रिप्ट की आवश्यकता के बिना, चरण-दर-चरण सही आदतें सीखने में मदद करता है।
परिणाम
शोधकर्ताओं ने इस पद्धति का परीक्षण तीन अलग-अलग "आभासी दुनिया" (सफाई, खाना पकाने और विज्ञान प्रयोगों के लिए सिम्युलेटेड वातावरण) में किया। उन्होंने अपने रोबोट की तुलना निम्नलिखित से की:
- स्टैंडर्ड AI: जो लंबे कार्यों में खो जाता है।
- अन्य उन्नत विधियाँ: जिन्हें अक्सर प्रशिक्षण स्क्रिप्ट लिखने के लिए महंगे मानव विशेषज्ञों या अतिरिक्त कंप्यूटर प्रोग्रामों की आवश्यकता होती है।
परिणाम:
HIPIF अन्य सभी से बेहतर रहा। इसने अधिक कार्यों को हल किया, कम गलतियाँ कीं, और कम कंप्यूटर मेमोरी (टोकन) का उपयोग किया क्योंकि यह एक विशाल, अनावश्यक इतिहास को ढो नहीं रहा था। महत्वपूर्ण रूप से, इसने यह सब बिना किसी मानव विशेषज्ञ द्वारा प्रशिक्षण डेटा लिखने या सोचने में मदद करने के लिए अतिरिक्त AI मॉडलों की आवश्यकता के बिना किया। इसने अपने स्वयं के विचारों और यादों को व्यवस्थित करना खुद ही सीख लिया।
संक्षेप में: HIPIF AI एजेंटों को काम को छोटे चरणों में तोड़कर, जो वे पूरा कर चुके हैं उसका सारांश बनाकर ताकि वे अभिभूत न हों, और ट्रैक पर रहने के लिए निरंतर फीडबैक देकर लंबी परियोजनाओं में बेहतर होने के लिए प्रशिक्षित करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।