← नवीनतम पेपर
🤖 machine learning

APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents

यह शोध पत्र APEX का प्रस्ताव करता है, जो एक स्वायत्त नीति अन्वेषण (autonomous policy exploration) ढांचा है जो रणनीति मानचित्र (strategy map) और फोर्क डिस्कवरी तंत्र (fork discovery mechanism) का उपयोग करके स्व-विकसित LLM एजेंटों में अन्वेषण पतन (exploration collapse) को दूर करता है, जिससे उन्हें मॉडल-वेट अपडेट के बिना स्मृति और प्रतिबिंब के माध्यम से बेहतर रणनीतियों की खोज करने में सक्षम बनाता है।

मूल लेखक: Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ APEX पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के साथ समझाया गया है।

समस्या: "कम्फर्ट ज़ोन" का जाल

कल्पना कीजिए कि आप एक जटिल वीडियो गेम खेल रहे हैं (जैसे एक टेक्स्ट एडवेंचर जहाँ आप दुनिया को एक्सप्लोर करने के लिए कमांड टाइप करते हैं)। आपके पास एक स्मार्ट AI असिस्टेंट है जो आपकी मदद कर रहा है।

शुरुआत में, AI कई अलग-अलग चीज़ें आज़माता है: दरवाज़े खोलना, चीज़ें उठाना, NPCs से बात करना। लेकिन कुछ समय बाद, उसे एक ऐसा रास्ता मिल जाता है जो उसे एक अच्छा स्कोर देता है। वह सहज (comfortable) हो जाता है। उसे एहसास होता है, "अरे, अगर मैं बस इस खास गलियारे में चलूँ और यह एक चाबी उठा लूँ, तो मुझे हर बार पॉइंट्स मिलते हैं।"

इसलिए, वह कुछ भी नया करना बंद कर देता है। वह एक लूप में फंस जाता है, बार-बार एक ही सुरक्षित रूटीन को दोहराता रहता है।

  • समस्या: AI औसतन (on average) अच्छा कर रहा है, लेकिन उसने उस "गुप्त खजाने के कमरे" की तलाश करना बंद कर दिया है जो दोगुने पॉइंट्स देता है, क्योंकि वह एक ऐसे दरवाज़े के पीछे छिपा है जिसे आज़माने के बारे में उसने कभी सोचा ही नहीं।
  • पेपर का शब्द: इसे Exploration Collapse कहा जाता है। एजेंट एक्सप्लोर करना बंद कर देता है और केवल उसी चीज़ का फायदा (exploit) उठाता है जिसे वह पहले से जानता है, जिससे वह बेहतर रणनीतियों को देखने से चूक जाता है।

समाधान: APEX ("एक्सप्लोरर का मैप")

लेखकों ने APEX (Autonomous Policy Exploration) नामक एक सिस्टम प्रस्तावित किया है। AI को केवल भटकने या पिछली गलतियों को याद रखने देने के बजाय, APEX AI को एक Strategy Map देता है।

इस मैप को किसी इमारत के चित्र के रूप में नहीं, बल्कि नियमों से जुड़े लक्ष्यों की एक चेकलिस्ट के रूप में समझें।

  • माइलस्टोन्स (Milestones): ये विशिष्ट लक्ष्य हैं, जैसे "चाबी ढूँढना" या "संदूक खोलना।"
  • डिपेंडेंसीज़ (Dependencies): मैप जानता है कि आप "संदूक खोलने" से पहले "चाबी ढूँढ" नहीं सकते।

यह मैप AI के लिए एक साझा मस्तिष्क (shared brain) के रूप में कार्य करता है, जो ठीक से ट्रैक करता है कि उसने क्या आज़माया है और उसने अभी तक क्या नहीं आज़माया है।

APEX कैसे काम करता है: दो-इंजन सिस्टम

APEX दो मुख्य तंत्रों का उपयोग करता है ताकि AI को फंसने से बचाया जा सके, जो एक टूर गाइड और एक डिटेक्टिव की तरह मिलकर काम करते हैं।

1. डिटेक्टिव: "फोर्क डिस्कवरी" (Fork Discovery)

कल्पना कीजिए कि आप एक म्यूज़ियम में घूम रहे हैं। आप देखते हैं कि एक दरवाज़ा थोड़ा खुला हुआ है, लेकिन आप आगे बढ़ जाते हैं क्योंकि आपका ध्यान सामने वाली पेंटिंग पर है।

  • क्या होता है: AI उस दरवाज़े को देखता है लेकिन उसे खोलता नहीं है।
  • फोर्क डिस्कवरी का काम: गेम खत्म होने के बाद, "डिटेक्टिव" रीप्ले को देखता है। वह कहता है, "रुको, हमने वह दरवाज़ा देखा था! हमारे पास उसे खोलने का मौका था, लेकिन हमने कभी खोला नहीं। चलिए 'दरवाज़ा खोलना' को अपने चेकलिस्ट में एक नए लक्ष्य के रूप में जोड़ देते हैं।"
  • परिणाम: मैप बढ़ता है। यह सक्रिय रूप से उन दिशाओं को खोजता है जिन्हें AI ने अनदेखा कर दिया था और उन्हें योजना में जोड़ देता है, यह सुनिश्चित करता है कि AI छिपे हुए अवसरों को न छोड़े।

2. टूर गाइड: "पॉलिसी सिलेक्शन" (Policy Selection)

अब जब मैप के पास लक्ष्यों की एक सूची है, तो AI को यह तय करने की ज़रूरत है कि अगला लक्ष्य कौन सा होगा।

  • समस्या: यदि AI केवल वही लक्ष्य चुनता है जिसे वह जानता है कि सबसे ज़्यादा पॉइंट्स देता है, तो वह कभी भी नए, जोखिम भरे लक्ष्यों को नहीं आज़माएगा।
  • पॉलिसी सिलेक्शन का काम: यह एक स्मार्ट टूर गाइड की तरह काम करता है जो सुरक्षा और रोमांच के बीच संतुलन बनाता है। यह एक गणितीय ट्रिक (जिसे Thompson Sampling कहा जाता है) का उपयोग करता है यह तय करने के लिए: "हमने 'चाबी' वाले लक्ष्य को 10 बार आज़माया और यह काम करता है। लेकिन हमने 'दरवाज़ा' वाले लक्ष्य को केवल एक बार आज़माया है। चलिए फिर से दरवाज़ा आज़माते हैं क्योंकि हमें नहीं पता कि यह कितना फायदेमंद हो सकता है!"
  • परिणाम: AI को मैप के "अनएक्सप्लोर्ड" (unexplored) हिस्सों में जाने के लिए मजबूर किया जाता है, जिससे यह सुनिश्चित होता है कि वह एक ही ढर्रे में न फँस जाए।

सुधार का चक्र (Cycle of Improvement)

हर कुछ गेम्स के बाद, सिस्टम मैप को अपडेट करने के लिए ब्रेक लेता है:

  1. रिफाइन (Refine): यह त्रुटियों को ठीक करता है। (जैसे, "हमें लगा था कि हमें दरवाज़ा खोलने के लिए तलवार चाहिए, लेकिन वास्तव में, हमें सिर्फ एक चाबी चाहिए थी।")
  2. प्रोपोगेट (Propagate): यह आंकड़ों को अपडेट करता है। (जैसे, "'चाबी ढूँढना' वाला लक्ष्य वास्तव में बहुत महत्वपूर्ण है क्योंकि यह बड़े खजाने की ओर ले जाता है।")
  3. डिस्कवर (Discover): डिटेक्टिव मैप में जोड़ने के लिए नए दरवाज़े खोजता है।

यह क्यों काम करता है (परिणाम)

शोधकर्ताओं ने इसे दो प्रकार के "गेम्स" पर टेस्ट किया:

  1. टेक्स्ट एडवेंचर्स (Jericho): जटिल कहानियाँ जहाँ आप कमांड टाइप करते हैं।
  2. वेब इंटरैक्शन (WebArena): वेबसाइटों पर नेविगेट करने जैसे वास्तविक कार्य, जैसे चीज़ें खरीदना या जानकारी ढूँढना।

निष्कर्ष:

  • पुराने तरीके (जैसे Reflexion): ये एजेंट्स अपने कम्फर्ट ज़ोन में फंस गए। उन्हें औसत स्कोर तो मिला, लेकिन वे शायद ही कभी सबसे अच्छा समाधान ढूँढ पाते थे।
  • APEX: क्योंकि यह स्पष्ट रूप से ट्रैक करता है कि उन्होंने क्या नहीं आज़माया है, यह लगातार बेहतर रणनीतियाँ खोजता है। इसने न केवल उच्च औसत स्कोर प्राप्त किया; इसने वह "गुप्त खजाना" भी ढूँढा जिसे अन्य मिस कर गए थे।

सारांश उपमा (Summary Analogy)

कल्पना कीजिए कि आप काम पर जाने के लिए सबसे अच्छा रास्ता खोजने की कोशिश कर रहे हैं।

  • पुराना तरीका: आप हर दिन एक ही सड़क लेते हैं क्योंकि वह आमतौर पर तेज़ होती है। आप कभी यह चेक नहीं करते कि क्या कोई नया शॉर्टकट खुला है।
  • APEX का तरीका: आपके पास एक नोटबुक (Strategy Map) है।
    • फोर्क डिस्कवरी आप हैं जो एक मैप देखते हैं और कहते हैं, "मैंने कल एक नई सड़क देखी थी, लेकिन मैंने उस पर नहीं चला। मैं इसे कल आज़माने के लिए लिख लेता हूँ।"
    • पॉलिसी सिलेक्शन आप हैं जो तय करते हैं, "मैंने मुख्य सड़क 20 बार ली है। चलिए आज नई सड़क आज़माते हैं ताकि देख सकें कि क्या यह तेज़ है।"

उन्होंने क्या आज़माया है और क्या नहीं, इसकी एक व्यवस्थित सूची रखकर, APEX AI को आलसी होने से रोकता है और यह सुनिश्चित करता है कि वह समस्याओं को हल करने के बेहतर तरीके खोजता रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →