← नवीनतम पेपर
🤖 AI

Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

यह शोध पत्र एक अन्वेषण-जागरूक (exploration-aware) सुदृढीकरण लर्निंग (reinforcement learning) ढांचे का प्रस्ताव करता है जो LLM एजेंटों को अन्वेषण की आवश्यकता वाले उच्च-अनिश्चितता वाले परिदृश्यों और निष्पादन के लिए उपयुक्त स्पष्ट संदर्भों के बीच अनुकूल रूप से अंतर करने में सक्षम बनाता है, जिससे टेक्स्ट-आधारित और GUI-आधारित एजेंट बेंचमार्क में निरंतर प्रदर्शन सुधार प्राप्त होता है।

मूल लेखक: Xingyuan Hua, Sheng Yue, Ju Ren

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xingyuan Hua, Sheng Yue, Ju Ren

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization" नामक शोध पत्र का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: "अनुमान और जाँच" का जाल (The "Guess-And-Check" Trap)

कल्पना कीजिए कि आप एक नए कमरे में एक जटिल पहेली सुलझाने की कोशिश कर रहे हैं, लेकिन आप एक बार में पूरी तस्वीर नहीं देख सकते। आपको यह समझने के लिए कि टुकड़े कहाँ फिट होते हैं, इधर-उधर घूमना होगा, चीजों को छूना होगा और दराजें खोलनी होंगी।

वर्तमान AI एजेंट (स्मार्ट कंप्यूटर प्रोग्राम) उन लोगों की तरह हैं जो आस-पास देखने से डरते हैं। उन्हें सीधे फिनिश लाइन तक पहुँचने के लिए प्रशिक्षित किया जाता है। यदि वे 100% सुनिश्चित नहीं हैं कि क्या करना है, तो वे या तो:

  1. हार मान लेते हैं और गलत अनुमान लगाते हैं।
  2. बिना सोचे-समझे भटकते रहते हैं, हर एक दराज को खोलते रहते हैं भले ही उन्हें पहले से ही उत्तर पता हो, जिससे समय और ऊर्जा बर्बाद होती है।

यह शोध तर्क देता है कि इंसान इस मामले में बेहतर होते हैं। जब हम अनिश्चित होते हैं, तो हम रुकते हैं, सुराग इकट्ठा करने के लिए आस-पास देखते हैं, और फिर अपनी चाल चलते हैं। यदि हम कोई गलती करते हैं, तो हम पीछे हट सकते हैं और एक अलग रास्ता चुन सकते हैं। वर्तमान AI स्वाभाविक रूप से ऐसा करने में संघर्ष करता है।

समाधान: EAPO (एक "स्मार्ट खोजकर्ता")

लेखकों ने एक नई प्रशिक्षण विधि बनाई है जिसे EAPO (Exploration-Aware Policy Optimization) कहा जाता है। EAPO को एक ऐसे कोच के रूप में सोचें जो AI को एक विशिष्ट तीन-चरणीय नृत्य सिखाता है: खोज (Explore), याद रखना (Remember), और कार्य करना (Act)।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. "बैकपैक" और "नोटबुक" (स्मृति और खोज)

कल्पना कीजिए कि AI एक हाइकर (पदयात्री) है।

  • बैकपैक (स्मृति/Memory): AI एक "बैकपैक" लेकर चलता है जहाँ वह वह सब कुछ लिखता है जो वह देखता है। यदि वह एक दरवाजा खोलता है और एक लाल दीवार देखता है, तो वह अपनी नोटबुक में लिखता है "दरवाजे के पीछे लाल दीवार"।
  • "एक्सप्लोर" मोड: जब AI भ्रमित होता है, तो वह केवल अनुमान नहीं लगाता। वह "एक्सप्लोर मोड" में स्विच कर जाता है। वह कहता है, "मुझे यकीन नहीं है कि इस दरवाजे के पीछे क्या है। मुझे इसके अंदर झाँक लेना चाहिए, इसे अपनी नोटबुक में लिखना चाहिए, और फिर बाहर आना चाहिए।"

शोध पत्र एक विशेष प्रारूप पेश करता है जहाँ AI को स्पष्ट रूप से लिखना होता है:

  • <explore>: "मैं यह देखने के लिए यह बटन चेक करने जा रहा हूँ कि क्या होता है।"
  • <memory>: "ठीक है, मैंने इसे चेक किया। इससे लाइट जल गई। मैं इसे याद रखूँगा।"
  • <action>: "अब जब मुझे पता है कि लाइट चालू है, तो मैं हरा बटन दबाऊँगा।"

2. "टाइम ट्रैवल" का जादू (रोलबैक/Rollback)

यह सबसे जादुई हिस्सा है। कई वीडियो गेम में, यदि आप किसी जाल में फंस जाते हैं, तो आप मर जाते हैं और आपको पूरा लेवल फिर से शुरू करना पड़ता है। यह निराशाजनक और अक्षम है।

शोध पत्र AI को टाइम ट्रैवल (रोलबैक) करना सिखाता है।

  • यदि AI एक रास्ते की खोज करता है और उसे एहसास होता है, "ओह नहीं, वह गलत दरवाजा था," तो वह घबराता नहीं है।
  • वह एक "बैक" बटन (जैसे वेब ब्राउज़र में होता है) का उपयोग करके तुरंत उस सटीक स्थान पर वापस लौट आता है जहाँ उसने गलती की थी।
  • महत्वपूर्ण बात यह है कि वह अपने नोट्स (जानकारी) को अपने पास रखता है। वह याद रखता है, "मैंने लाल दरवाजा आज़माया था, और वह लॉक था। इसलिए मैं इसे दोबारा नहीं आज़माऊँगा।"

यह खोज (exploration) को एक "डेड एंड" (बंद रास्ते) से बदलकर एक "सीखने के अवसर" में बदल देता है।

3. "स्मार्ट रिवॉर्ड" सिस्टम

आप AI को बिना भटकते हुए खोजने के लिए कैसे सिखा सकते हैं? इसके लिए एक अच्छा रिवॉर्ड सिस्टम चाहिए।

  • पुराना तरीका: AI को केवल तभी रिवॉर्ड मिलता है जब वह कार्य पूरा कर लेता है। वह सीखता है कि खोज करना समय की बर्बादी है क्योंकि इससे रिवॉर्ड मिलने में देरी होती है।
  • EAPO का तरीका: AI को उपयोगी जानकारी इकट्ठा करने के लिए "बोनस पॉइंट" मिलते हैं।
    • यदि AI एक दराज में देखता है और उसे एक चाबी मिलती है, तो उसे रिवॉर्ड मिलता है भले ही उसने अभी तक चाबी का उपयोग न किया हो
    • यदि AI एक दराज में देखता है और उसे कुछ नहीं मिलता, तो उसे समय बर्बाद करने के लिए छोटा दंड (penalty) मिलता है।
    • यह AI को चुनिंदा (selective) होना सिखाता है: "मैं केवल तभी खोज करूँगा यदि मुझे लगता है कि मुझे कुछ उपयोगी मिल सकता है।"

प्रयोगों में क्या हुआ?

शोधकर्ताओं ने इस "स्मार्ट खोजकर्ता" का परीक्षण चार अलग-अलग प्रकार की चुनौतियों पर किया:

  1. टेक्स्ट-आधारित कार्य: जैसे रेसिपी का पालन करना या टेक्स्ट एडवेंचर गेम सुलझाना।
  2. ऑनलाइन शॉपिंग: वेबसाइट पर विशिष्ट आइटम ढूँढना।
  3. मोबाइल ऐप्स (Android): सेटिंग्स बदलने के लिए फोन मेनू में नेविगेट करना।
  4. डेस्कटॉप कंप्यूटर (OS): कंप्यूटर का उपयोग करके फाइलें खोलना और विंडोज़ को मूव करना।

परिणाम:

  • बेहतर प्रदर्शन: EAPO-प्रशिक्षित AI ने अन्य AI विधियों की तुलना में काफी अधिक कार्यों को हल किया (कुछ मामलों में सफलता दर में 20% से 60% का सुधार हुआ)।
  • छोटे मॉडल, बड़े दिमाग: EAPO के साथ प्रशिक्षित एक बहुत छोटा AI मॉडल (2 बिलियन पैरामीटर्स) उन बहुत बड़े और महंगे मॉडल्स से बेहतर प्रदर्शन करता है जिन्होंने इस विधि का उपयोग नहीं किया था। इसने साबित कर दिया कि आपका सोचने का तरीका कितना महत्वपूर्ण है, न कि केवल आपका दिमाग कितना बड़ा है
  • अनुकूलन क्षमता (Adaptability): AI ने केवल तभी खोज करना सीखा जब वह भ्रमित था। जब उसे उत्तर पता होता, तो वह तेज़ी से कार्य करता। जब वह खो जाता, तो वह रुक जाता और सुराग इकट्ठा करता।

निष्कर्ष (The Bottom Line)

यह शोध पत्र दिखाता है कि हम AI एजेंटों को जिज्ञासु लेकिन अनुशासित होना सिखा सकते हैं। बिना सोचे-समझे अनुमान लगाने या पागलों की तरह हर चीज़ पर क्लिक करने के बजाय, वे सीखते हैं कि:

  1. जब वे अनिश्चित हों, तो रुकें।
  2. जानकारी इकट्ठा करें (खोजें)।
  3. उसे लिख लें (स्मृति)।
  4. यदि वे कोई गलती करते हैं, तो पीछे हटें (रोलबैक)।
  5. उस नए ज्ञान का उपयोग सही कदम उठाने के लिए करें।

यह एक ऐसे पर्यटक और एक स्मार्ट यात्री के बीच का अंतर है जो शहर में घूमते हुए चिल्ला रहा है "संग्रहालय कहाँ है?!" और वह स्मार्ट यात्री जो मानचित्र देखता है, स्थानीय व्यक्ति से पूछता है, दिशाएँ नोट करता है, और फिर आत्मविश्वास के साथ गंतव्य तक पहुँचता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →