← नवीनतम पेपर
🤖 machine learning

DREvo: Distilling Recalibrated Historical Experience for Harness Self-Evolution

DREvo एक नवीन हारनेस सेल्फ-इवोल्यूशन विधि है जो ऐतिहासिक अनुभव को गतिशील रूप से पुन: अंशांकित करके और कार्रवाई योग्य खोज दिशाओं को संकुचित करके मौजूदा दृष्टिकोणों की अस्थिरता को संबोधित करती है, जिससे सीमित बजट के तहत रीजनिंग और एजेंटिक बेंचमार्क में बेहतर प्रदर्शन और सुचारू विकास प्रक्षेपवक्र प्राप्त होता है।

मूल लेखक: Hanghui Guo, Weijie Shi, Zhangze Chen, Shengxiang Xu, Yishu Wang, Yimei Zhang, Wangze Ni, Jia Zhu, Shimin Di

प्रकाशित 2026-07-30
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanghui Guo, Weijie Shi, Zhangze Chen, Shengxiang Xu, Yishu Wang, Yimei Zhang, Wangze Ni, Jia Zhu, Shimin Di

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को पहेली सुलझाना सिखाने की कोशिश कर रहे हैं। आप रोबोट को एक दिमाग (एक लार्ज लैंग्वेज मॉडल) देते हैं, लेकिन उस दिमाग को काम करने के लिए एक शरीर और नियमों के सेट की आवश्यकता होती है। इस "शरीर और नियम" वाले सेटअप को हार्नेस (harness) कहा जाता है। हार्नेस को रोबोट का ऑपरेटिंग सिस्टम समझें: यह तय करता है कि रोबोट जानकारी कैसे खोजता है, वह कैलकुलेटर या कोड एडिटर जैसे टूल्स का उपयोग कैसे करता है, और वह जो अभी कर रहा है उसे कैसे याद रखता है। यदि हार्नेस अस्त-व्यस्त या भ्रमित करने वाला है, तो सबसे बुद्धिमान दिमाग भी लड़खड़ा जाएगा।

लंबे समय तक, एक अच्छा हार्नेस बनाना हाथ से रेस कार को ट्यून करने जैसा था। विशेषज्ञों को अंदाज़ा लगाना पड़ता था कि क्या गलत है, कुछ तार बदलने पड़ते थे, परीक्षण करना होता था, और बस यही उम्मीद करनी होती थी कि सब ठीक हो जाएगा। लेकिन हाल ही में, वैज्ञानिकों ने खोजा कि रोबмोंट वास्तव में अपने स्वयं के शरीर को ठीक करने में मदद कर सकते हैं। वे एक बदलाव आजमा सकते हैं, देख सकते हैं कि क्या वह काम कर रहा है, परिणाम याद रख सकते हैं, और फिर से प्रयास कर सकते हैं। इसे सेल्फ-इवोल्यूशन (स्व-विकास) कहा जाता है। विचार यह है कि यदि रोबोट अपने पिछले सभी प्रयासों का एक डायरी रखता है, तो वह अपनी गलतियों से सीख सकता है और समय के साथ बेहतर हो सकता है। लेकिन यहाँ एक पेच है: सिर्फ इसलिए कि रोबोट के पास एक डायरी है, इसका मतलब यह नहीं है कि वह उसे पढ़ना जानता है। कभी-कभी, कल जो ट्रिक काम कर गई थी, वह आज आपदा बन सकती है क्योंकि रोबोट की स्थिति बदल गई है। यह पेपर पूछता है: हम यह कैसे सुनिश्चित करें कि रोबोट अपने इतिहास से सही सबक सीखे बिना भ्रमित हुए?


समस्या: रोबोट की भ्रमित करने वाली डायरी

कल्पना कीजिए कि आप एक कुत्ते को गेंद लाना सिखा रहे हैं। आप गेंद फेंकते हैं, कुत्ता दौड़ता है, और कभी-कभी वह उसे पकड़ लेता है, कभी-कभी वह उसे गिरा देता है। आप हर प्रयास को एक नोटबुक में लिखते हैं। अब, कल्पना कीजिए कि कुत्ते को एक नया कॉलर मिल गया है, या हवा अलग तरह से बहने लगी है, या आपने टेनिस बॉल को बदलकर एक सीटी वाली खिलौना बॉल (squeaky toy) कर दी है। यदि आप केवल अपनी नोटबुक देखते हैं और कहते हैं, "पिछली बार जब कुत्ता बाईं ओर दौड़ा तो उसने गेंद गिरा दी थी, इसलिए उसे हमेशा दाईं ओर दौड़ना चाहिए," तो आप गलत हो सकते हैं। वह पुराना सबक अब लागू नहीं हो सकता।

AI एजेंटों के साथ भी बिल्कुल ऐसा ही होता है। शोधकर्ताओं ने पाया कि जब रोबोट अपने पूरे इतिहास को देखकर अपने "हार्नेस" को सुधारने की कोशिश करते हैं, तो वे अक्सर एक लूप में फंस जाते हैं। वे एक सुधार आजमाते हैं, विफल होते देखते हैं, कुछ और आजमाते हैं, फिर से विफल होते देखते हैं, और फिर अचानक एक ऐसे तरीके पर वापस चले जाते हैं जो हफ्तों पहले विफल हुआ था। उनका प्रदर्शन एक पहाड़ी पर सुचारू रूप से चढ़ने के बजाय एक रोलरकोस्टर की तरह ऊपर-नीचे होता रहता है। शोधकर्ताओं ने महसूस किया कि रोबोट दो मुख्य समस्याओं से जूझ रहे थे:

  1. "क्या यह अभी भी सच है?" वाली समस्या: रोबोट यह जांच नहीं पाता था कि उसके पुराने सबक अभी भी वैध हैं या नहीं। वह हर पिछले सफल या असफल प्रयास को ऐसे मानता था जैसे वह अभी हो रहा हो, भले ही रोबोट का कोड बदल गया हो।
  2. "अब मैं क्या करूँ?" वाली समस्या: भले ही रोबोट को कोई सबक याद रहता था, लेकिन उसे यह सटीक रूप से नहीं पता होता था कि अपने शरीर के किस हिस्से को ठीक करना है या उसे कैसे ठीक करना है। यह ऐसा था जैसे आपको यह बताया जाए कि "आपने गेंद गिरा दी," बिना यह बताए कि "आपको अपनी पकड़ मजबूत करने की जरूरत है।"

समाधान: DREvo (स्मार्ट लाइब्रेरियन)

इसे ठीक करने के लिए, लेखकों ने DREvo नामक एक नई विधि बनाई। आप DREvo को एक सुपर-व्यवस्थित लाइब्रेरियन के रूप में सोच सकते हैं जो रोबोट की डायरी का प्रबंधन करता है। केवल रोबोट को कागजों का ढेर थमाने के बजाय, DREvo जानकारी को व्यवस्थित करता है, यह जांचता है कि क्या वह अभी भी प्रासंगिक है, और रोबोट को आगे क्या करना है इसके लिए स्पष्ट, विशिष्ट निर्देश देता है।

DREvo तीन मजेदार चरणों में यह करता है:

1. "लेबल मेकर" (फंक्शन-लेवल एविडेंस एंकरिंग)
पुराने तरीके में, रोबोट की डायरी टेक्स्ट का एक विशाल, अस्त-व्यस्त ढेर थी। DREvo इस ढेर को छोटे, लेबल वाले टुकड़ों में काट देता है। यह रोबोट द्वारा किए गए हर बदलाव को देखता है और उसे एक विशिष्ट "फंक्शन" (जैसे एक विशिष्ट टूल या मेमोरी नियम) से जोड़ देता है। यह एक अव्यवस्थित रेसिपी बुक में हर एक सामग्री परिवर्तन को उसके सटीक चरण से लेबल करने जैसा है। इस तरह, जब रोबोट सीखना चाहता है, तो उसे पता होता है कि उसका पिछला सबक उसके शरीर के किस हिस्से के बारे में बात कर रहा है।

2. "फ्रेशनेस चेकर" (स्टेट-डिपेंडेंट एविडेंस रीकैलिब्रेशन)
यह सबसे महत्वपूर्ण हिस्सा है। किसी पुराने सबक का उपयोग करने से पहले, DREvo दो प्रश्न पूछता है: "क्या यह सबक अभी भी विश्वसनीय है?" और "क्या यह सबक रोबोट के वर्तमान शरीर के अनुकूल है?"

  • विश्वसनीयता (Reliability): क्या यह सबक पहले हर बार काम आया था, या यह केवल एक तुक्का था?
  • ताजगी (Freshness): क्या रोबोट का कोड अभी भी वैसा ही है जैसा कि यह सबक सीखते समय था? यदि रोबोट ने अपनी "पकड़" (उसका कोड स्ट्रक्चर) बदल ली है, तो पकड़ के बारे में पुराना सबक अब काम नहीं आ सकता।
    DREvo हर सबक को एक "स्कोर" देता है। यदि कोई सबक पुराना है या रोबोट बहुत अधिक बदल गया है, तो स्कोर गिर जाता है, और रोबोट उसे अनदेखा कर देता है। यदि सबक ताजा और विश्वसनीय है, तो स्कोर ऊंचा रहता है।

3. "कोच की सीटी" (रोल-कंडीशन्ड सर्च इंटेंट डिस्टिलेशन)
अंत में, DREvo केवल रोबोट को तथ्यों की सूची नहीं देता; यह उसे एक गेम प्लान देता है। उच्च-स्कोर वाले सबक के आधार पर, DREvo अगले प्रयास के लिए रोबोट को एक विशिष्ट "भूमिका" (role) सौंपता है:

  • एक्सप्लॉइट (Exploit - उपयोग करना): "यह ट्रिक पहले बहुत अच्छी तरह काम कर गई थी! इसे फिर से करो!"
  • अवॉइड (Avoid - बचना): "इस ट्रिक की वजह से पिछली बार क्रैश हुआ था! इसे मत करो!"
  • रीटेस्ट (Retest - पुन: परीक्षण): "हम इस बारे में निश्चित नहीं हैं। आइए इसे सावधानी से आजमाएं कि क्या यह अब काम करता है।"
  • एक्सप्लोर (Explore - अन्वेषण): "हमारे पास कोई अच्छा सुराग नहीं है। आइए कुछ बिल्कुल नया आजमाएं।"
    यह रोबोट की अस्पष्ट "मुझे बेहतर होने की जरूरत है" वाली भावना को "जांच के लिए जाओ और 'एक्सप्लोइट' रणनीति का उपयोग करके मेमोरी टूल को ठीक करो" जैसे स्पष्ट, कार्रवाई योग्य कमांड में बदल देता है।

उन्होंने क्या पाया

शोधकर्ताओं ने पांच अलग-अलग चुनौतियों पर DREvo का परीक्षण किया, जिसमें रसायन विज्ञान की पहेलियों को सुलझाने से लेकर चिकित्सा लक्षणों का निदान करने, कंप्यूटर कोड को ठीक करने और वर्चुअल टर्मिनल को नेविगेट करने तक शामिल थे। उन्होंने इसकी तुलना अन्य रोबोटों से की जो खुद को विकसित करने की कोशिश कर रहे थे और उन रोबोटों से भी जिनका हार्नेस इंसानों द्वारा डिजाइन किया गया था।

परिणाम काफी उत्साहजनक थे। प्रयासों के सीमित बजट के तहत (यानी, उन्होंने रोबोट को अनंत काल तक अभ्यास करने नहीं दिया), DREvo ने हर श्रेणी में सबसे अच्छे हार्नेस खोजे।

  • मेडिकल डायग्नोसिस (चिकित्सा निदान) कार्यों पर, DREv ने 89.2% सटीकता प्राप्त की, जो दूसरे सबसे अच्छे तरीके से 2.4 प्रतिशत अंक अधिक थी।
  • लीगल रीजनिंग (कानूनी तर्क) पर, इसने 49.0% हासिल किया, जो अगले सबसे अच्छे से 4.0 प्रतिशत अंक अधिक था।
  • केमिकल रिएक्शन (रासायनिक प्रतिक्रिया) भविष्यवाणी में, इसने 25.0% स्कोर किया, जो रनर-अप से 9.0 प्रतिशत अंक अधिक था।
  • एजेंटिक टास्क (जैसे कोड ठीक करना या कंप्यूटर टर्मिनल का उपयोग करना) के लिए, DREvo ने रीजनिंग कार्यों पर औसतन 16.2% और एजेंट कार्यों पर अन्य तरीकों की तुलना में 13.8% सुधार किया।

शायद सबसे महत्वपूर्ण बात यह है कि शोधकर्ताओं ने देखा कि DREvo की प्रगति सुचारू थी। जबकि अन्य रोबोटों के स्कोर बहुत अधिक ऊपर-नीचे (रिग्रेशन और रिकवरी) होते थे, DREvo की सटीकता लगातार बढ़ती गई। इसने अपने "सोचने के स्थान" (कॉन्टेक्स्ट) को भी छोटा रखा, लगभग 2.9K टोकन, जबकि अन्य तरीकों को 5.3K टोकन से अधिक की आवश्यकता थी और फिर भी वे खराब प्रदर्शन कर रहे थे।

मुख्य निष्कर्ष

यह पेपर सुझाव देता है कि रोबोट को उसके अतीत का इतिहास देना ही पर्याप्त नहीं है। वास्तव में सीखने के लिए, रोबोट को एक ऐसे सिस्टम की आवश्यकता है जो यह जांच सके कि क्या पुराने सबक अभी भी लागू होते हैं और उन संदेशों को स्पष्ट, विशिष्ट निर्देशों में अनुवादित कर सके। DREvo उस सिस्टम के रूप में कार्य करता है, जो प्रयास और त्रुटि के एक अस्त-व्यस्त इतिहास को सुधार के एक सुचारू, विश्वसनीय मार्ग में बदल देता है। यह दिखाता है कि हम अपने अतीत के अनुभवों का उपयोग कैसे करते हैं, इसके बारे में स्मार्ट होकर, हम AI एजेंटों को और भी तेजी से और अधिक विश्वसनीयता के साथ विकसित होने में मदद कर सकते हैं, भले ही हमारे पास उन्हें अभ्यास करने के लिए असीमित समय न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →