← नवीनतम पेपर
🤖 AI

HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning

यह शोध पत्र HIPIF का प्रस्ताव करता है, जो लंबे समय तक चलने वाले (long-horizon) LLM एजेंटों के लिए एक एंड-टू-एंड प्रशिक्षण ढांचा है, जो स्पष्ट उप-लक्ष्यों (subgoals) के इर्द-गिर्द निष्पादन को व्यवस्थित करके और पूर्ण इतिहास का सारांश प्रस्तुत करके संदर्भ हस्तक्षेप (context interference) को कम करता है, जबकि महंगी सहायक मॉडलों पर निर्भर हुए बिना नियोजन को स्थिर करने के लिए पदानुक्रमित प्रतिबिंब (hierarchical reflection) और प्रक्रिया पुरस्कारों (process rewards) का उपयोग करता है।

मूल लेखक: Juncheng Diao, Zhicong Lu, Peiguang Li, Yongwei Zhou, Changyuan Tian, Qingbin Li, Rongxiang Weng, Jingang Wang, Xunliang Cai

प्रकाशित 2026-06-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Juncheng Diao, Zhicong Lu, Peiguang Li, Yongwei Zhou, Changyuan Tian, Qingbin Li, Rongxiang Weng, Jingang Wang, Xunliang Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन भुलक्कड़ रोबोट को पूरा घर साफ करना सिखाने की कोशिश कर रहे हैं। वह निर्देशों को समझने में बहुत अच्छा है, लेकिन यदि आप उसे एक लंबा, जटिल कार्य देते हैं (जैसे "रसोई साफ करें, फिर लिविंग रूम को व्यवस्थित करें, फिर कपड़े धोएं"), तो वह घबरा जाता है।

ऐसा क्यों है? क्योंकि रोबोट काम करते समय अपने द्वारा किए गए हर काम की एक चलती हुई डायरी रखता है। जब तक वह 50वें स्टेप पर पहुँचता है, उसकी डायरी सैकड़ों पन्नों की हो जाती है। वह अपने ही इतिहास में इतना खो जाता है कि वह मुख्य लक्ष्य को भूल जाता है, या वह बार-बार एक ही गलती दोहराने लगता है क्योंकि वह अब बड़ी तस्वीर नहीं देख पाता।

यह पेपर HIPIF (Hierarchical Planning and Information Folding) नामक एक नई प्रशिक्षण विधि पेश करता है ताकि इस समस्या को ठीक किया जा सके। सोचिए कि HIPIF रोबोट को सोचने और याद रखने का एक नया तरीका सिखा रहा है।

यह कैसे काम करता है, इसे तीन सरल अवधारणाओं में विभाजित किया गया है:

1. "सबगोल" रणनीति (बड़े कार्य को छोटे टुकड़ों में तोड़ना)

पूरे घर को एक साथ देखने के बजाय, HIPIF रोबोट को काम को छोटे, प्रबंधनीय "सबगोल" (उप-लक्ष्यों) में तोड़ने के लिए सिखाता है।

  • उपमा: कल्पना कीजिए कि आप एक लंबा उपन्यास लिख रहे हैं। यदि आप पूरी कहानी एक ही बार में लिखने की कोशिश करेंगे, तो आप भ्रमित हो जाएंगे। इसके बजाय, आप एक बार में एक अध्याय लिखते हैं।
  • HIPIF कैसे करता है: रोबोट पहले यह तय करता है, "मेरा पहला सबगोल गंदे बर्तन ढूंढना है।" एक बार जब वह उन्हें ढूंढ लेता है, तो वह उन 100 चीजों की पूरी सूची को देखते रहने के बजाय केवल बर्तनों पर ध्यान केंद्रित करता है।

2. "इन्फॉर्मेशन फोल्डिंग" (पूरे किए गए अध्यायों पर किताब बंद करना)

यह इस पेपर का सबसे अनूठा विचार है। आमतौर पर, AI अपनी पिछली हर क्रिया का हर विवरण अपनी "वर्किंग मेमोरी" में रखता है। HIPIF रोबोट को एक सबगोल पूरा होने के बाद उस पर किताब बंद करना सिखाता है।

  • उपमा: कल्पना कीजिए कि आप एक रहस्यमयी उपन्यास पढ़ रहे हैं। एक बार जब आप पहला सुराग सुलझा लेते हैं, तो आपको सुराग याद रखने के लिए पहले 50 पन्ने दोबारा पढ़ने की आवश्यकता नहीं होती। आप बस अपनी नोटबुक में एक वाक्य का सारांश लिखते हैं: "चाबी मैट के नीचे मिली।" फिर आप उस अध्याय को बंद कर देते हैं और अगले पन्ने पर बढ़ जाते हैं।
  • HIPIF कैसे करता है: जब रोबोट "बर्तन ढूंढने" का काम पूरा कर लेता है, तो वह उन बर्तनों को खोजने के लंबे, उलझे हुए इतिहास को एक छोटे, साफ सारांश (जैसे "बर्तन सिंक में मिले") में समेट देता है और उसे एक "पूर्ण" फोल्डर में रख देता है। फिर वह अगले सबगोल "बर्तन धोना" पर पूरी तरह से ध्यान केंद्रित करने के लिए अपनी तत्काल मेमोरी को खाली कर देता है। यह रोबोट को पुराने, अप्रासंगिक विवरणों से भ्रमित होने से रोकता है।

3. "सेल्फ-चेक" और "कोच" (चिंतन और पुरस्कार)

रोबोट को यह सिखाना कठिन है। यदि आप उसे सिर्फ "बेहतर करो" कहेंगे, तो वह नहीं जान पाएगा कि "कैसे"। HIPIF दो आंतरिक सहायकों को जोड़ता है:

  • Hierarchical Reflection (सेल्फ-चेक): एक नया कदम उठाने से पहले, रोबोट रुकता है और खुद से दो सवाल पूछता है:

    1. "क्या मैंने अपना वर्तमान सबगोल पूरा कर लिया है?" (उदाहरण के लिए, "क्या बर्तन वास्तव में साफ हैं?")
    2. "यदि हाँ, तो अगला सबगोल क्या है? यदि नहीं, तो मैं क्या गलत कर रहा हूँ?"
      यह रोबोट को बहुत जल्दी आगे बढ़ने या किसी लूप में फंसने से रोकता है।
  • Subgoal-Oriented Process Rewards (कोच): सामान्य प्रशिक्षण में, रोबोट को पूरे कार्य के अंत में ही "अच्छा काम किया!" या "विफल" जैसा फीडबैक मिलता है। सीखने के लिए यह बहुत देर हो चुकी होती है। HIPIF एक कोच की तरह काम करता है जो खेल के दौरान फीडबैक देता है।

    • यदि रोबोट ऐसे बर्तन धोने की कोशिश करता है जो मौजूद ही नहीं हैं, तो कोच कहता है, "रुको! यह एक बुरा विचार है।"
    • यदि रोबोट एक ही काम को दो बार करने में फंस जाता है, तो कोच कहता है, "तुम लूप में फंस रहे हो! कुछ नया आज़माओ।"
      यह रोबोट को हर संभावित स्थिति के लिए मानव द्वारा लिखे गए परफेक्ट स्क्रिप्ट की आवश्यकता के बिना, चरण-दर-चरण सही आदतें सीखने में मदद करता है।

परिणाम

शोधकर्ताओं ने इस पद्धति का परीक्षण तीन अलग-अलग "आभासी दुनिया" (सफाई, खाना पकाने और विज्ञान प्रयोगों के लिए सिम्युलेटेड वातावरण) में किया। उन्होंने अपने रोबोट की तुलना निम्नलिखित से की:

  • स्टैंडर्ड AI: जो लंबे कार्यों में खो जाता है।
  • अन्य उन्नत विधियाँ: जिन्हें अक्सर प्रशिक्षण स्क्रिप्ट लिखने के लिए महंगे मानव विशेषज्ञों या अतिरिक्त कंप्यूटर प्रोग्रामों की आवश्यकता होती है।

परिणाम:
HIPIF अन्य सभी से बेहतर रहा। इसने अधिक कार्यों को हल किया, कम गलतियाँ कीं, और कम कंप्यूटर मेमोरी (टोकन) का उपयोग किया क्योंकि यह एक विशाल, अनावश्यक इतिहास को ढो नहीं रहा था। महत्वपूर्ण रूप से, इसने यह सब बिना किसी मानव विशेषज्ञ द्वारा प्रशिक्षण डेटा लिखने या सोचने में मदद करने के लिए अतिरिक्त AI मॉडलों की आवश्यकता के बिना किया। इसने अपने स्वयं के विचारों और यादों को व्यवस्थित करना खुद ही सीख लिया।

संक्षेप में: HIPIF AI एजेंटों को काम को छोटे चरणों में तोड़कर, जो वे पूरा कर चुके हैं उसका सारांश बनाकर ताकि वे अभिभूत न हों, और ट्रैक पर रहने के लिए निरंतर फीडबैक देकर लंबी परियोजनाओं में बेहतर होने के लिए प्रशिक्षित करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →