← नवीनतम पेपर
💬 NLP

Milestone-Guided Policy Learning for Long-Horizon Language Agents

यह शोध पत्र BEACON को प्रस्तुत करता है, जो एक मील का पत्थर-निर्देशित (milestone-guided) नीति शिक्षण ढांचा है जो मील के पत्थर की सीमाओं पर प्रक्षेपवक्रों (trajectories) को विभाजित करके और द्वि-स्तरीय लाभ अनुमान (dual-scale advantage estimation) लागू करके लॉन्ग-होरिज़न लैंग्वेज एजेंटों में क्रेडिट मिसअट्रिब्यूशन और सैंपल अक्षमता को संबोधित करता है, और ALFWorld जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Zixuan Wang, Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zixuan Wang, Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट बटलर (नौकर) को एक बिखरे हुए घर की सफाई करना सिखा रहे हैं। कार्य लंबा और जटिल है: "नीली चाबी ढूँढो, स्टोरेज रूम को खोलो, बिल्ली को बाहर निकालो, और उसे खाना खिलाओ।"

यदि रोबोट अंत में विफल हो जाता है (शायद वह बिल्ली को खाना खिलाना भूल जाता है), तो पारंपरिक प्रशिक्षण विधियाँ कहेंगी, "तुम विफल रहे! जो कुछ भी तुमने किया उसे वापस रद्द करो और शुरू से करो।" इसका मतलब है कि रोबोट को उन अच्छी चीजों के लिए दंडित किया जाता है जो उसने पहले की थीं, जैसे चाबी ढूँढना और दरवाजा खोलना। इससे रोबोट भ्रमित हो जाएगा क्योंकि उसने शुरुआत में सही काम किया था लेकिन उसे "खराब ग्रेड" मिला क्योंकि बाद के चरण गलत हो गए।

यह पेपर इस भ्रम को दूर करने के लिए एक नई प्रशिक्षण विधि पेश करता है जिसे BEACON कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

समस्या: "सब-या-कुछ-नहीं" वाला ग्रेड

वर्तमान विधियाँ (जैसे GRPO) रोबोट के पूरे दिन को एक एकल टेस्ट की तरह मानती हैं।

  • दोष: यदि रोबोट 99% काम पूरी तरह से करता है लेकिन आखिरी कदम पर लड़खड़ा जाता है, तो पूरे दिन को विफलता के रूप में चिह्नित किया जाता है।
  • परिणाम: रोबोट अपने 99% अच्छे काम से कुछ भी नहीं सीख पाता है। यह उसे भ्रमित भी करता है क्योंकि कभी-कभी वह एक ही क्रिया करता है (जैसे "चाबी ढूँढना") और उसे "अच्छा काम" का संकेत मिलता है, और अन्य समय में उसे "बुरा काम" का संकेत मिलता है क्योंकि बाद के चरण गलत हो गए। यह एक छात्र की तरह है जिसे गणित की परीक्षा में केवल इसलिए 'F' ग्रेड मिला क्योंकि उसने ऊपर अपना नाम लिखना भूल गया था, भले ही उसने हर समीकरण को सही ढंग से हल किया हो।

समाधान: BEACON (द "चेकपॉइंट" सिस्टम)

BEACON खेल को बदलकर इसे छोटे अध्यायों, या माइलस्टोन्स (Milestones) में विभाजित करता है। इन माइलस्टोन्स को एक वीडियो गेम के चेकपॉइंट्स की तरह समझें।

1. यात्रा को खंडों (Segments) में विभाजित करना
रोबोट को अंत तक ग्रेड देने के बजाय, BEACON प्राकृतिक रुकने वाले बिंदुओं की तलाश करता है।

  • उदाहरण: "क्या आपने चाबी ढूँढी?" (चेकपॉइंट 1)। "क्या आपने दरवाजा खोला?" (चेकपॉइंट 2)।
  • एक बार जब रोबोट एक चेकपॉइंट पर पहुँच जाता है, तो गेम उसकी वहां पहुँचने की याददाश्त को "रीसेट" कर देता है। इससे कोई फर्क नहीं पड़ता कि रोबोट चाबी ढूँढने के लिए कितने अजीब रास्ते से आया; मायने यह रखता है कि वह अब चाबी के पास है।

2. आंशिक प्रगति के लिए श्रेय देना
पुराने सिस्टम में, यदि रोबोट अंत में विफल हो जाता है, तो उसे पूरे दिन के लिए शून्य अंक मिलते हैं।

  • BEACON की तरकीब: यदि रोबोट चाबी ढूँढ लेता है लेकिन बाद में विफल हो जाता है, तो उसे चाबी ढूँढने के लिए "आंशिक क्रेडिट" (Partial Credit) पुरस्कार मिलता है।
  • उपमा: कल्पना कीजिए कि एक रिले रेस चल रही है। यदि धावक अंतिम लैप में बैटन गिरा देता है, तो पुराना सिस्टम कहता है कि पूरी टीम को शून्य अंक मिलते हैं। BEACON कहता है, "पहले धावक ने बहुत अच्छा किया! उसने बैटन को पूरी तरह से पास किया। आइए उसे हाई-फाइव दें और एक छोटा सा इनाम दें, भले ही आखिरी धावक ने उसे गिरा दिया हो।" यह रोबोट को अगले चेकपॉइंट तक पहुँचने के लिए प्रयास जारी रखने के लिए प्रोत्साहित करता है।

3. "ड्यूल-स्केल" कोच (Dual-Scale Coach)
BEACON फीडबैक देने के लिए दो प्रकार के कोचों का उपयोग करता है:

  • बड़ी तस्वीर वाला कोच (The Big Picture Coach): अंतिम परिणाम को देखता है। क्या बिल्ली को खाना खिलाया गया? हाँ/नहीं। यह रोबोट को अंतिम लक्ष्य पर केंद्रित रखता है।
  • सेगमेंट कोच (The Segment Coach): केवल वर्तमान अध्याय को देखता है। "क्या आपने दरवाजा कुशलतापूर्वक खोला?" यह कोच रोबोट की तुलना केवल उन अन्य रोबोटों से करता है जो "दरवाजा खोलने" के चरण तक भी पहुँचे हैं।
  • यह क्यों मदद करता है: यह रोबोट को उन चीजों के लिए दंडित होने से रोकता है जो उसके काम पूरा करने के बाद हुई थीं। यदि रोबोट ने दरवाजा पूरी तरह से खोला, लेकिन अगले रोबोट ने बिल्ली को खाना खिलाने में विफल रहा, तो पहले रोबोट को दूसरे रोबोट की विफलता के लिए दोषी नहीं ठहराया जाता है।

परिणाम: एक स्मार्ट, तेज़ सीखने वाला

लेखकों ने इसे तीन अलग-अलग "दुनियाओं" पर परखा:

  1. ALFWorld: एक टेक्स्ट-आधारित घर की सफाई का खेल।
  2. WebShop: एक ऑनलाइन शॉपिंग सिमुलेशन।
  3. ScienceWorld: एक वर्चुअल साइंस लैब।

क्या हुआ?

  • पुरानी विधियाँ: जैसे-जैसे कार्य लंबे होते गए, रोबोट बदतर होते गए। वे भ्रमित हो गए और सीखना बंद कर दिया।
  • BEACON: रोबोट बेहतर और बेहतर होते गए, यहाँ तक कि बहुत लंबे कार्यों में भी।
    • सबसे कठिन घर की सफाई वाले कार्यों पर, BEACON 93% बार सफल रहा, जबकि पुरानी विधि केवल 54% बार सफल रही।
    • BEACON ने प्रशिक्षण को बहुत कुशल बना दिया। अभ्यास के 76% दौरों को फेंकने के बजाय (क्योंकि वे अंत में विफल हो गए थे), BEACON ने आंशिक सफलताओं को पुरस्कृत करके 82% दौरों में उपयोगी सबक खोज लिए।

सारांश में

BEACON एक स्मार्ट शिक्षक की तरह है जो केवल अंतिम परीक्षा के स्कोर को नहीं देखता। इसके बजाय, शिक्षक हर कदम पर आपका होमवर्क चेक करता है। यदि आप पहले तीन अध्याय सही करते हैं लेकिन आखिरी में गलती कर देते हैं, तो शिक्षक कहता है, "पहले तीन पर बहुत अच्छा काम! आइए आखिरी वाले को ठीक करें।" यह छात्र को हार मानने से रोकता है और उन्हें जटिल, लंबे कार्यों को बहुत तेज़ी से सीखने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →