← नवीनतम पेपर
🤖 AI

A Subgoal-driven Framework for Improving Long-Horizon LLM Agents

यह शोध पत्र एक सबगोल-संचालित ढांचे का प्रस्ताव करता है जो सबगोल अपघटन (subgoal decomposition) के माध्यम से ऑनलाइन योजना और मील के पत्थर-आधारित पुरस्कारों (milestone-based rewards) के साथ MiRA सुदृढीकरण लर्निंग दृष्टिकोण को जोड़ता है, जो वेब नेविगेशन कार्यों पर लॉन्ग-होरइज़न LLM एजेंट के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है, जिससे ओपन-सोर्स मॉडल अग्रणी प्रोप्रायटरी सिस्टम को भी पीछे छोड़ने में सक्षम होते हैं।

मूल लेखक: Taiyi Wang, Sian Gooding, Florian Hartmann, Oriana Riva, Edward Grefenstette

प्रकाशित 2026-03-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Taiyi Wang, Sian Gooding, Florian Hartmann, Oriana Riva, Edward Grefenstette

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े अधीर रोबोट को एक विशाल, अराजक शहर (इंटरनेट) में नेविगेट करना सिखाने की कोशिश कर रहे हैं ताकि वह एक विशिष्ट, छिपे हुए खजाने (एक जटिल कार्य पूरा करना जैसे "CMU से 50 मील के भीतर निकटतम कैफे खोजें") को ढूंढ सके।

समस्या यह है कि रोबोट अक्सर रास्ता भटक जाता है, गोल-गोल घूमता रहता है, या बीच में ही हार मान लेता है क्योंकि शहर बहुत बड़ा है और निर्देश अस्पष्ट हैं। यह पेपर इन रोबोट्स को प्रशिक्षित करने का एक नया तरीका पेश करता है ताकि वे केवल "अनुमान" न लगाएं, बल्कि काम पूरा करने के लिए वास्तव में योजना (plan) बनाएं और सीखें (learn)

यहाँ उनके समाधान, MiRA, का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "बीच में खो जाने वाला" रोबोट

वर्तमान AI एजेंट उन पर्यटकों की तरह हैं जिनके पास पहले ब्लॉक के लिए तो एक बेहतरीन नक्शा होता है लेकिन फिर वे भ्रमित हो जाते हैं।

  • समस्या: जब कोई कार्य लंबा होता है (जैसे 10 अलग-अलग वेबसाइटों पर नेविगेट करना), तो रोबता भूल जाता है कि उसने शुरुआत कहाँ से की थी। वह लूप में फंस जाता है (बार-बार एक ही बटन क्लिक करना) या किसी डेड एंड (बंद रास्ते) में भटक जाता है।
  • परिणाम: यहाँ तक कि सबसे बुद्धिमान रोबोट भी लंबे कार्यों पर लगभग 50% बार विफल हो जाते हैं क्योंकि वे अपनी "विचार प्रक्रिया" (train of thought) खो देते हैं।

2. समाधान: यात्रा को "चेकपॉइंट्स" में तोड़ना

लेखकों ने महसूस किया कि यदि आप रोबोट को कहते हैं, "चंद्रमा पर जाओ," तो वह जम सकता है। लेकिन यदि आप कहते हैं, "पहले, हवाई अड्डे तक पहुँचो। फिर, विमान पर चढ़ो। फिर, लैंड करो," तो वह इसे संभाल सकता है।

वे इन चेकपॉइंट्स को Subgoals या Milestones कहते हैं।

भाग A: "स्मार्ट को-पायलट" (ऑनलाइन प्लानिंग)

  • उपमा: कल्पना कीजिए कि रोबोट गाड़ी चला रहा है, लेकिन उसके पास एक स्मार्ट को-पायलट (एक सुपर-स्मार्ट AI मॉडल जैसे Gemini) बगल वाली सीट पर बैठा है।
  • यह कैसे काम करता है: हर कुछ कदमों के बाद, को-पायलट पूछता है: "हे, क्या हम वास्तव में पिछले चेकपइंट तक पहुँच गए हैं? क्या हम अभी भी सही रास्ते पर हैं? हमें अगले किस संकेत (sign) को देखने की आवश्यकता है?"
  • लाभ: यदि रोबोट गोल-गोल घूमने लगता है, तो को-पायलट तुरंत कहता है, "रुको! तुम गलत दिशा में जा रहे हो। चलो वापस चलते हैं।" यह रोबोट को समय बर्बाद करने और फंसने से रोकता है।

भाग B: "वीडियो गेम ट्रेनर" (MiRA - प्रशिक्षण विधि)

यही असली जादू है। आमतौर पर, एक रोबोट को प्रशिक्षित करना एक वीडियो गेम खेलने जैसा है जहाँ आपको केवल अंत में "गेम ओवर" या "आप जीत गए" की स्क्रीन मिलती है। यदि आप 50 लेवल के बाद विफल होते हैं, तो आपको इस बात का कोई फीडबैक नहीं मिलता कि आप क्यों विफल हुए।

  • पुराना तरीका (Sparse Rewards): रोबोट एक पहाड़ चढ़ने की कोशिश करता है। वह फिसलता है और गिर जाता है। उसे कोई अंक नहीं मिलते। वह फिर से कोशिश करता है, फिर फिसलता है। वह कभी नहीं सीख पाता कि कैसे चढ़ना है।
  • Mi-RA तरीका (Dense Rewards): लेखकों ने रोबोट के लिए एक प्रोग्रेस बार (Progress Bar) बनाया है।
    • पूरे पहाड़ के शिखर तक प्रतीक्षा करने के बजाय, रोबोट को हर बार एक "हाई फाइव" (पुरस्कार) मिलता है जब वह एक बेस कैंप (एक सबगोल) तक पहुँचता है।
    • "पोटेंशियल क्रिटिक" (Potential Critic): इसे एक GPS की तरह समझें जो अगले चेकपइंट के करीब आने पर चमकने लगता है। यह रोबोट को बताता है, "आप लक्ष्य के 20% करीब हैं!" या "आप 80% तक पहुँच गए हैं!"
    • यह कैसे मदद करता है: यह रोबोट को निरंतर फीडबैक देता है। वह सीखता है कि "इस बटन को क्लिक करना" अच्छा है क्योंकि यह प्रोग्रेस बार को आगे बढ़ाता है, भले ही उसने अभी तक पूरा कार्य पूरा न किया हो।

3. परिणाम: दिग्गजों को हराते छोटे रोबोट

टीम ने दो प्रकार के रोबोट्स पर परीक्षण किया:

  1. "बड़े दिमाग" (Gemini जैसे प्रोप्राइटरी मॉडल): उन्होंने "स्मार्ट को-पायलट" (ऑनलाइन प्लानिंग) जोड़ा। रोबोट रास्ता भटकने में बहुत बेहतर हो गया, जिससे उसकी सफलता दर में लगभग 10% का सुधार हुआ।
  2. "छोटे दिमाग" (Gemma जैसे ओपन-सोर्स मॉडल): उन्होंने छोटे रोबोट को सिखाने के लिए "वीडियो गेम ट्रेनर" (MiRA) का उपयोग किया।
    • पहले: छोटा रोबोट केवल 6.4% समय सफल होता था।
    • बाद में: MiRA के साथ, वह 43.0% बार सफल हुआ।
    • चौंकाने वाला तथ्य: यह छोटा, ओपन-सोर्स रोबोट, जिसे इस नई पद्धति से प्रशिक्षित किया गया था, वास्तव में विशाल, महंगे, क्लोज्ड-सोर्स रोबोट्स (जैसे GPT-4o) को पछाड़ गया, जो केवल 14% तक ही पहुँच पाए थे।

4. यह क्यों महत्वपूर्ण है

इसे एक बच्चे को केक बनाना सिखाने जैसा समझें।

  • पुरानी विधि: आप उन्हें कहते हैं, "केक बनाओ।" वे आटा, पानी और मिट्टी मिलाते हैं, ओवन में डालते हैं और उसे जला देते हैं। आप कहते हैं, "बुरा केक।" वे फिर से कोशिश करते हैं और फिर से जला देते हैं। वे कभी भी सीखते नहीं हैं कि कैसे बनाना है।
  • MiRA विधि: आप उन्हें चरणों के साथ एक रेसिपी देते हैं। "चरण 1: सूखी सामग्री मिलाएं।" (पुरस्कार: अच्छा काम!)। "चरण 2: अंडे डालें।" (पुरस्कार: अच्छा काम!)। यदि वे कोई चरण छोड़ देते हैं, तो आप धीरे से उन्हें वापस मार्गदर्शन करते हैं।
  • परिणाम: बच्चा केवल परिणाम नहीं, बल्कि प्रक्रिया सीखता है। वे बहुत तेज़ी से मास्टर बेकर बन जाते हैं।

सारांश

यह पेपर एक फ्रेमवर्क पेश करता है जिसे MiRA कहा जाता है जो AI एजेंटों को लंबे कार्यों में रास्ता भटकने से रोकने में मदद करता है। यह इसे निम्न प्रकार से करता है:

  1. बड़े लक्ष्यों को छोटे, जांच योग्य चरणों (Subgoals) में तोड़कर।
  2. केवल अंतिम परिणाम के बजाय हर छोटा कदम पूरा करने के लिए निरंतर फीडबैक (Rewards) देकर।
  3. रोबोट के काम की वास्तविक समय में जाँच करने के लिए एक "को-पायलट" का उपयोग करके।

परिणाम? अब हम छोटे, सस्ते AI मॉडल्स को प्रशिक्षित कर सकते हैं ताकि वे जटिल डिजिटल दुनिया में नेविगेट करने में अविश्वसनीय रूप से कुशल हों, और यहाँ तक कि अपने से बड़े, सबसे महंगे AI मॉडल्स को भी पीछे छोड़ सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →