AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning
यह शोध पत्र AEM को प्रस्तुत करता है, जो मल्टी-टर्न एजेंटिक रिइन्फोर्समेंट लर्निंग के लिए एक सुपरविजन-फ्री क्रेडिट असाइनमेंट विधि है जो एक्सप्लोरेशन-एक्सप्लोइटेशन ट्रेड-ऑफ को बेहतर बनाने और SWE-bench-Verified जैसे चुनौतीपूर्ण बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए रिस्पॉन्स-लेवल एंट्रॉपी डायनेमिक्स को एडेप्टिवली मॉड्यूलेट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन रोबोट सहायक को जटिल, बहु-चरणीय पहेलियों को हल करना सिखा रहे हैं, जैसे कि किसी वर्चुअल घर में किसी विशिष्ट वस्तु को खोजने के लिए नेविगेट करना या कंप्यूटर कोड के एक हिस्से को डीबग करना। रोबोट अलग-अलग क्रियाएं करता है, लेकिन उसे पूरी प्रक्रिया के अंत में केवल एक "अच्छा काम किया!" (Good Job!) या "फिर से प्रयास करें" (Try Again) ही मिलता है। उसे यह नहीं पता चलता कि किस विशिष्ट कदम ने अंतिम परिणाम में मदद की या उसे बिगाड़ा। यह वही समस्या है जिसे यह पेपर हल करता है: आप सही कदमों को श्रेय कैसे देते हैं जब आपको केवल फिनिश लाइन पर ही इनाम मिलता है?
लेखक एक नई विधि प्रस्तावित करते हैं जिसे AEM (Adaptive Entropy Modulation) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
समस्या: "अंधा" शिक्षक
पारंपरिक प्रशिक्षण में, रोबot क्रियाओं का एक लंबा रास्ता (एक "ट्रैजेक्टरी") लेता है। यदि वह सफल होता है, तो शिक्षक कहता है, "बहुत अच्छा काम किया!" और रोबोट मान लेता है कि उसके द्वारा उठाया गया हर कदम अच्छा था। यदि वह विफल होता है, तो शिक्षक कहता है, "बुरा काम किया!" और रोबोट मान लेता है कि उसका हर कदम बुरा था।
- दोष: यह एक छात्र द्वारा 10-प्रश्नों वाले गणित के टेस्ट देने जैसा है। यदि उन्हें पूर्ण अंक मिलते हैं, तो शिक्षक प्रश्न 3 के लिए उनकी प्रशंसा करता है, भले ही प्रश्न 3 केवल एक तुक्का था और प्रश्न 7 वास्तव में वह कठिन हिस्सा था जिसमें उन्हें संघर्ष करना पड़ा था। रोबोट भ्रमित हो जाता है कि क्या जारी रखना है और क्या बंद करना है।
समाधान: AEM (एक "कॉन्फिडेंस मीटर")
पेपर में एक तरीका पेश किया गया है जिससे रोबोट अपने स्वयं के "आत्मविश्वास" (जिसे पेपर एंट्रॉपी/Entropy कहता है) को देखकर यह पता लगा सकता है कि कौन से कदम वास्तव में अच्छे या बुरे थे।
एंट्रॉपी को रोबोट के अनिश्चितता मीटर के रूप में सोचें:
- उच्च एंट्रॉपी (उच्च अनिश्चितता): रोबोट बेतहाशा अंदाज़ लगा रहा है। वह नए, जोखिम भरे रास्ते खोज रहा है। यह एक ऐसे छात्र की तरह है जो क्योंकि उसे विषय का ज्ञान नहीं है, इसलिए उत्तरों का अनुमान लगा रहा है।
- निम्न एंट्रॉपी (उच्च आत्मविश्वास): रोबोट सुनिश्चित है कि उसका उत्तर सही है। वह जो पहले से जानता है, उसका लाभ उठा रहा है। यह एक ऐसे छात्र की तरह है जो आत्मविश्वास के साथ वह फॉर्मूला लिख रहा है जिसे उसने याद कर लिया है।
AEM कैसे काम करता है: एक "स्मार्ट कोच"
AEM एक स्मार्ट कोच की तरह काम करता है जो वास्तविक समय में रोबोट के कॉन्फिडेंस मीटर को देखता है और स्थिति के आधार पर "प्रशंसा" या "आलोचना" को समायोजित करता है।
जब रोबोट खोजबीन (Exploring) कर रहा होता है (प्रारंभिक प्रशिक्षण के दौरान):
- रोबोट अनिश्चित है और कई अलग-अलग चीजें आज़मा रहा है (उच्च एंट्रॉपी)।
- यदि वह गलती करता है, तो कोच कहता है, "कोई बात नहीं! तुम खोजबीन कर रहे थे। अगली बार कुछ और भी अलग करने की कोशिश करना।" (AEM अन्वेषण/exploration के दबाव को बढ़ाता है)।
- यदि वह भाग्यशाली होकर सफल हो जाता है, तो कोच कहता है, "बहुत बढ़िया! लेकिन चूंकि तुम सिर्फ अंदाज़ा लगा रहे थे, इसलिए अभी बहुत ज्यादा आत्मविश्वासी न बनो।" (AEM खोजबीन को जारी रखता है)।
जब रोबोट विशेषज्ञता (Exploiting) दिखा रहा होता है (देर से प्रशिक्षण के दौरान):
- रोबोट ने नियम सीख लिए हैं और वह आश्वस्त है (निम्न एंट्रॉपी)।
- यदि वह गलती करता है, तो कोच कहता है, "रुको, तुम्हें इस बारे में निश्चित होना चाहिए था! तुम्हें अपनी रणनीति पर फिर से विचार करने की आवश्यकता है।" (AEM बदलाव के लिए दबाव बढ़ाता है)।
- यदि वह सफल होता है, तो कोच कहता है, "परफेक्ट! तुम जानते हो कि तुम क्या कर रहे हो। बिल्कुल यही करते रहो।" (AEM आत्मविश्वासी व्यवहार को सुदृढ़ करता है)।
जादुई ट्रिक:
पेपर गणितीय रूप से सिद्ध करता है कि आप रोबोट के अपने "आश्चर्य" के स्तर (कि उसका उत्तर उसके सामान्य व्यवहार की तुलना में कितना अप्रत्याशित था) का उपयोग करके स्वचालित रूप से यह तय कर सकते हैं कि उसे अधिक साहसी (explore) बनने के लिए प्रोत्साहित करना है या अधिक सावधान (exploit) बनने के लिए। आपको किसी इंसान द्वारा हर कदम को ग्रेड करने की आवश्यकता नहीं है, और न ही आपको अतिरिक्त डेटा की आवश्यकता है। रोबोट खुद को सुधारने के लिए अपने आंतरिक "आत्मविश्वास" का उपयोग करता है।
परिणाम: एक जीतने वाली रणनीति
लेखकों ने इस विधि का परीक्षण तीन अलग-अलग प्रकार के "पहेलियों" पर किया:
- ALFWorld: एक टेक्स्ट-आधारित गेम जहाँ रोबोट को एक वर्चुअल घर को साफ करने, खाना पकाने और व्यवस्थित करने के लिए नेविगेट करना होता है।
- WebShop: एक सिम्युलेटेड ऑनलाइन शॉपिंग कार्य जहाँ रोबोट को विशिष्ट वस्तुओं को खोजने और खरीदने के लिए नेविगेट करना होता है।
- SWE-bench: एक बहुत कठिन कार्य जहाँ रोबोट को वास्तविक सॉफ्टवेयर कोड में बग्स को ठीक करना होता है।
क्या हुआ?
- रोबोट ने पहले की तुलना में तेज़ी से सीखा और अधिक पहेलियाँ हल कीं।
- सबसे कठिन सॉफ्टवेयर इंजीनियरिंग टेस्ट (SWE-bench) पर, मौजूदा सर्वोत्तम विधि में AEM जोड़ने से सफलता दर में 1.4% का सुधार हुआ। हालांकि यह सुनने में छोटा लग सकता है, लेकिन AI की दुनिया में, इतने कठिन कार्य के लिए यह एक बहुत बड़ी छलांग है।
- यह विधि छोटे और बहुत बड़े AI मॉडल्स (1.5 बिलियन से 32 बिलियन "ब्रेन सेल्स" तक) दोनों पर अच्छी तरह से काम करती है।
यह क्यों महत्वपूर्ण है
पेपर का दावा है कि AEM एक "प्लग-इन" टूल है। इसका मतलब है कि आप लगभग किसी भी मौजूदा AI प्रशिक्षण प्रणाली को ले सकते हैं और पूरे सिस्टम को फिर से बनाए बिना या लोगों को रोबोट के काम को ग्रेड करने के लिए नियुक्त किए बिना इसमें यह "कॉन्फिडेंस मीटर" जोड़ सकते हैं। यह AI को स्वाभाविक रूप से यह समझने में मदद करता है कि कब एक साहसी खोजकर्ता बनना है और कब एक केंद्रित विशेषज्ञ बनना है, जिससे कम परेशानी के साथ बेहतर परिणाम मिलते हैं।
संक्षेप में, AEM AI एजेंटों को अपने स्वयं के "अंतर्ज्ञान" (अनिश्चितता) को सुनने के लिए सिखाता है ताकि उन्हें पता चल सके कि कब नई चीजें आज़मानी हैं और कब उस पर टिके रहना है जो काम करता है, जिससे वे बिना किसी मानवीय सूक्ष्म प्रबंधन के जटिल, बहु-चरणीय समस्याओं को हल करने में बहुत बेहतर हो जाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।