From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents
यह शोध पत्र आउटकम-वेरिफाइड कंपैरेटिव सेल्फ-डिस्टिलेशन (OVCSD) का प्रस्ताव करता है, जो LLM एजेंटों के लिए एक नवीन विधि है जो विफल रोलआउट्स को एक प्रीफिक्स ट्री में व्यवस्थित करके, पर्यावरण परिणामों के माध्यम से शिक्षक मार्गदर्शन को सत्यापित करके, और सफल समापन व्यवहारों को आसतित (distill) करने के लिए स्थानीयकृत तुलनात्मक शिक्षण को लागू करके कौशल आंतरिककरण को बढ़ाती है, जिससे यह ALFWorld और WebShop पर मौजूदा बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल वीडियो गेम खेलना सिखा रहे हैं, जैसे कि एक आभासी घर में रहस्य सुलझाना या एक विशाल ऑनलाइन स्टोर में सही वस्तु खोजना। लंबे समय तक, इसे करने का सबसे स्मार्ट तरीका रोबोट को एक "चीट शीट" (cheat sheet) या एक "सुपर-कोच" देना था जो रोबोट के अटकने पर उसे सही चालें फुसफुसाकर बताता था। यह तब तक बहुत अच्छा काम करता था जब तक वह चीट शीट मौजूद थी, लेकिन जैसे ही आपने उसे हटा दिया, रोबोट सब कुछ भूल गया और खुद से नहीं खेल सका। वैज्ञानिक इसे "कैपेबिलिटी एलिसिटेशन" (capability elicitation) कहते हैं—रोबोट केवल इसलिए समझदारी से कार्य करता है क्योंकि उसे उकसाया जा रहा है, न कि इसलिए कि उसने वास्तव में कौशल सीखा है।
इस क्षेत्र का बड़ा लक्ष्य "कैपेबिलिटी इंटरनलाइजेशन" (capability internalization) है। इसे एक ऐसे छात्र और अंतर के रूप में सोचें जिसने परीक्षा के लिए उत्तर रट लिए हैं बनाम एक ऐसा छात्र जिसने गणित को इतनी अच्छी तरह समझ लिया है कि वह बिना किसी पाठ्यपुस्तक के नए सवालों को हल कर सके। शोधकर्ता चाहते हैं कि AI एजेंट इन कौशलों को अपने स्वयं के "मस्तिष्क" में आत्मसात कर लें ताकि वे स्वतंत्र रूप से कार्य कर सकें। चुनौती यह पता लगाने में है कि रोबोट को केवल सही उत्तर दिखाकर नहीं, बल्कि उसे अपनी गलतियों और शिक्षक की सफलताओं से इस तरह सीखने में मदद करके कैसे सिखाया जाए कि वह कौशल स्थायी रूप से बना रहे।
यह शोध पत्र एक चतुर नई प्रशिक्षण विधि पेश करता है जिसे आउटकम-वेरिफाइड कम्पैरेटिव सेल्फ-डिस्टिलेशन (OVCSD) कहा जाता है। लेखक तर्क देते हैं कि AI को सिखाने का पुराना तरीका एक ऐसे शिक्षक की तरह था जो बस कहता था, "वह चाल 10 में से 7 थी," बिना यह जांचे कि क्या उस चाल ने वास्तव में खेल जीतने में मदद की। कभी-कभी एक "अच्छी" चाल बाद में हार का कारण बन सकती है, और एक "खराब" चाल जीत का एकमात्र रास्ता हो सकती थी। पुराने तरीकों ने बहुत सारी जानकारी बर्बाद कर दी क्योंकि उन्होंने विफल प्रयासों को फेंक दिया या शिक्षक की हर सफलता को समान रूप से महत्वपूर्ण माना।
शोधकर्ता एक अधिक स्मार्ट दृष्टिकोण प्रस्तावित करते हैं जो AI के प्रशिक्षण को एक जासूसी कहानी की तरह मानता है। सबसे पहले, वे छात्र AI की सभी विफलताओं को देखते हैं और उन विफलताओं को गलतियों के एक "फैमिली ट्री" (family tree) में व्यवस्थित करते हैं। इससे उन्हें यह देखने में मदद मिलती है कि विभिन्न छात्र वास्तव में किस मोड़ पर एक ही रास्ते पर अटक गए थे। मदद करने के लिए अनुमान लगाने के बजाय, वे एक "शिक्षक" AI (जिसके पास चीट शीट तक पहुंच है) को ठीक उसी बिंदु पर हस्तक्षेप करने देते हैं जहाँ छात्र विफल हुए थे। लेकिन यहाँ एक पेंच है: शिक्षक की मदद तभी गिनी जाती है जब वह वास्तव में गेम के वातावरण में जीत की ओर ले जाए। यदि शिक्षक सुधार करने की कोशिश करता है और फिर भी हार जाता है, तो उस प्रयास को बाहर निकाल दिया जाता है। यह "आउटकम-वेरिफाइड" (outcome-verified) वाला हिस्सा है—वे केवल उसी पर भरोसा करते हैं जो वास्तविक दुनिया में काम करता है, न कि उस पर जो कागजों पर अच्छा दिखता है।
एक बार जब उनके पास एक सत्यापित सफलता मिल जाती है, तो वे दो-चरणीय शिक्षण प्रक्रिया का उपयोग करते हैं। पहले, वे शिक्षक के सफल पथ से छात्र के विफल पथ के अलग होने के बिल्कुल पहले क्षण पर ज़ूम करते हैं। वे छात्र को सिखाते हैं, "देखो, इस सड़क के मोड़ पर, तुमने गलत दरवाजा चुना; शिक्षक ने सही दरवाजा चुना।" यह एक सटीक और केंद्रित सुधार है। दूसरा, वे छात्र को शिक्षक की सफल यात्रा के शेष भाग को देखने देते हैं ताकि वह कार्य को पूरा करना सीख सके।
परिणाम प्रभावशाली हैं। जब दो जटिल कार्यों—ALFWorld (एक आभासी घर जहाँ आपको सफाई, खाना बनाना और व्यवस्थित करना होता है) और WebShop (एक ऑनलाइन शॉपिंग सिमुलेशन) पर परीक्षण किया गया, तो इस नई विधि ने अन्य शीर्ष प्रशिक्षण तकनीकों को लगातार मात दी। OVCSD के साथ प्रशिक्षित किए गए AI एजेंट वास्तविक गेम के दौरान किसी भी चीट शीट की आवश्यकता के बिना इन लंबी, कठिन पहेलियों को हल करने में बहुत बेहतर हो गए। उदाहरण के लिए, घर की सफाई के कार्यों पर, इस नई विधि ने पिछले सबसे मजबूत तरीकों की तुलना में सफलता दर में 29.7 अंक तक सुधार किया, और शॉपिंग कार्यों पर, इसमें 5.4 अंकों का सुधार हुआ। शायद सबसे महत्वपूर्ण बात यह है कि इसने यह लाभ केवल थोड़े से अतिरिक्त "विशेषाधिकार" (शिक्षक की मदद) का उपयोग करते हुए प्राप्त किया—कुल इंटरैक्शन के 3% से भी कम।
संक्षेप में, यह शोध पत्र सुझाव देता है कि विफल छात्र प्रयासों और सत्यापित शिक्षक सफलताओं की सावधानीपूर्वक तुलना करके, और विचलन के सटीक क्षण पर ध्यान केंद्रित करके, हम AI एजेंटों को जटिल कौशल को पहले की तुलना में बहुत अधिक प्रभावी ढंग से आत्मसात करना सिखा सकते हैं। यह केवल रोबोट को एक बेहतर मानचित्र देने के बारे में नहीं है; यह उसे इलाके को पढ़ना सीखने में मदद करने के बारे में है ताकि वह दुनिया में खुद रास्ता बना सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।