← नवीनतम पेपर
💬 NLP

SELAUR: Self Evolving LLM Agent via Uncertainty-aware Rewards

SELAUR एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो अन्वेषण दक्षता और सीखने की स्थिरता में सुधार के लिए रिवॉर्ड डिज़ाइन में आंतरिक अनिश्चितता मेट्रिक्स को एकीकृत करके LLM एजेंटों में बहु-चरणीय निर्णय लेने की क्षमता को बढ़ाता है, जिसके परिणामस्वरूप ALFWorld और WebShop जैसे बेंचमार्क पर उच्च सफलता दर प्राप्त होती है।

मूल लेखक: Dengjia Zhang, Xiaoou Liu, Lu Cheng, Yaqing Wang, Kenton Murray, Hua Wei

प्रकाशित 2026-02-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dengjia Zhang, Xiaoou Liu, Lu Cheng, Yaqing Wang, Kenton Murray, Hua Wei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े घबराए हुए रोबोट को एक विशाल, जटिल भूलभुलैया (जैसे कि एक वर्चुअल सुपरमार्केट या घर के कामों से भरा हुआ घर) में रास्ता दिखाना सिखा रहे हैं। लक्ष्य रोबोट को सफलतापूर्वक निकास (exit) तक पहुँचाना है।

अतीत में, इन रोबोटों को सिखाने का तरीका सरल था: यदि वे निकास तक पहुँच जाते, तो हम उन्हें एक गोल्ड स्टार देते। यदि वे किसी दीवार से टकरा जाते या रास्ता भटक जाते, तो हम उन्हें "थम्स डाउन" देते और उन्हें फिर से प्रयास करने के लिए कहते।

समस्या यह है कि इस "गोल्ड स्टार" वाले दृष्टिकोण के साथ, जब रोबोट विफल होता है, तो वह कुछ भी उपयोगी नहीं सीख पाता। वह बस इतना जानता है कि, "मैं विफल हो गया," लेकिन उसे यह नहीं पता होता कि क्यों और कहाँ वह गलत हुआ। यह एक छात्र की तरह है जो गणित की परीक्षा में फेल हो जाता है और उसे केवल यह बताया जाता है कि "तुम्हें F मिला है," बिना यह देखे कि उसे किन विशिष्ट समस्याओं में कठिनाई हुई।

SELAUR एक नया, अधिक स्मार्ट तरीका है इन रोबोटों को सिखाने का। यह रोबोट को एक कॉन्फिडेंस मीटर (आत्मविश्वास मापने का यंत्र) और एक कोच देने जैसा है जो उसे पहेली सुलझाते समय साथ-साथ निर्देश देता है, न कि केवल अंत में।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. रोबोट की "अंतरात्मा की आवाज़" (अनिश्चितता/Uncertainty)

हर बार जब रोबोट कोई कदम उठाता है (जैसे "लाल कप उठाना" या "नीला बटन क्लिक करना"), तो उसके अंदर एक छोटी सी आवाज़ होती है जो कहती है, "मुझे इस बारे में काफी यकीन है" या "मैं पूरी तरह से अंदाज़ा लगा रहा हूँ।"

  • पुराना तरीका: रोबोट इस भावना को अनदेखा कर देता था। वह बस वही करता जो उसे सही लगता था।
  • SELAUR का तरीका: रोबोट अपनी "अंतरात्मा की आवाज़" पर ध्यान देता है।
    • यदि रोबोट आत्मविश्वासी है (कम अनिश्चितता), तो SELAUR कहता है, "बहुत अच्छा काम! इसे करते रहो।"
    • यदि रोबोट हिचकिचा रहा है (उच्च अनिश्चितता), तो SELAUR कहता है, "रुको, तुम यहाँ अनिश्चित लग रहे हो। चलो कोई दूसरा रास्ता आज़माते हैं या इस कदम के बारे में और गहराई से सोचते हैं।"

2. "विफलता ही स्वर्ण है" नियम (Failure-Aware Rewards)

यही असली जादू है। पुराने दिनों में, एक असफल प्रयास समय की बर्बादी था। SELAUR के साथ, एक असफल प्रयास वास्तव में मूल्यवान डेटा है।

कल्पना कीजिए कि एक रोबोट ऑनलाइन एक विशिष्ट शर्ट खरीदने की कोशिश कर रहा है लेकिन गलत साइज चुन लेता है और विफल हो जाता है।

  • पुराना रोबोट: "मैं विफल हो गया। मुझे नहीं पता क्यों। मैं बस फिर से रैंडम चीजें आज़माऊँगा।"
  • SELAUR रोबोट: "मैं विफल हो गया, लेकिन देखो मेरा कॉन्फिडेंस मीटर! जब मैंने 'Medium' साइज पर क्लिक किया, तब मैं बहुत अनिश्चित था। वह हिचकिचाहट एक सुराग थी! मैंने सीखा कि अगली बार मुझे साइज दोबारा चेक करने की ज़रूरत है।"

SELAUR रोबोट की उलझन को एक सबक में बदल देता है। यह रोबोट को अपनी उलझन को पहचानने के लिए पुरस्कृत करता है, भले ही अंतिम परिणाम विफलता ही क्यों न हो। इससे रोबोट तेज़ी से सीखता है क्योंकि वह केवल अंदाज़ा नहीं लगा रहा है; वह अपनी विचार प्रक्रिया का विश्लेषण कर रहा है।

3. "थ्री-पॉइंट चेक" (Metrics को मिलाना)

यह सुनिश्चित करने के लिए कि रोबोट का "अंतरात्मा का अहसास" सटीक है, SELAUR केवल एक तरीके से आत्मविश्वास को नहीं मापता है। यह तीन अलग-अलग "सेंसर" का उपयोग करता है (जैसे कार के डैशबोर्ड को स्पीडोमीटर, फ्यूल गेज और इंजन लाइट के साथ एक साथ चेक करना):

  1. एन्ट्रॉपी (Entropy): रोबोट के विचार कितने बिखरे हुए हैं? (क्या वह एक साथ 10 अलग-अलग चीजों के बारे में सोच रहा है, या सिर्फ एक के बारे में?)
  2. लीस्ट कॉन्फिडेंस (Least Confidence): अपने सबसे अच्छे विकल्प के बारे में रोबोट कितना आश्वस्त है?
  3. मार्जिन (Margin): उसका सबसे अच्छा विकल्प दूसरे सबसे अच्छे विकल्प की तुलना में कितना बेहतर है?

इन तीनों को मिलाकर, रोबले को एक बहुत स्पष्ट तस्वीर मिलती है कि वह कहाँ अस्थिर ज़मीन पर खड़ा है और कहाँ ठोस ज़मीन पर।

परिणाम: एक बेहतर खोजकर्ता

इस प्रणाली के कारण, रोबोट एक बेहतर खोजकर्ता बन जाता है।

  • वह उन लूप्स में नहीं फंसता जहाँ वह बार-बार एक ही गलत चीज़ करता रहता है (क्योंकि वह महसूस कर लेता है, "मैं अनिश्चित हूँ, इसलिए मुझे रुकना चाहिए और कुछ नया आज़माना चाहिए")।
  • वह हर प्रयास से सीखता है, न कि केवल जीत से।
  • वह अधिक स्थिर और विश्वसनीय हो जाता है, बिल्कुल एक इंसान की तरह जो अपनी गलतियों को दोहराने के बजाय उनसे सीखता है।

संक्षेप में: SELAUR AI एजेंटों को अपने संदेहों को सुनना सिखाता है। अपनी उलझन को अनदेखा करने के बजाय, यह उलझन का उपयोग सही रास्ता खोजने के लिए एक मानचित्र के रूप में करता है, जिससे हर विफलता सफलता की ओर एक कदम बन जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →