AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning
यह शोध पत्र AliyunConsoleAgent को प्रस्तुत करता है, जो एक लागत प्रभावी वेब एजेंट फ्रेमवर्क है जो डिस्टिल्ड ट्रेजेक्टरीज (distilled trajectories) पर सुपरवाइज्ड फाइन-ट्यूनिंग और वास्तविक वातावरण में एक मजबूत रिवॉर्ड सिस्टम के साथ सुदृढीकरण सीखने (reinforcement learning) को संयोजित करने वाले दो-चरणीय प्रशिक्षण प्रतिमान के माध्यम से क्लाउड कंसोल दस्तावेज़ों को सत्यापित करने में अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, निरंतर बदलते हुए थीम पार्क (द क्लाउड कंसोल) के मैनेजर हैं। हर दिन, पार्क में नई राइड्स जोड़ी जाती हैं, टिकट बूथ बदले जाते हैं, और सुरक्षा नियम अपडेट किए जाते हैं। इस बीच, गाइडबुक्स (द डॉक्यूमेंटेशन) को एक अलग टीम द्वारा लिखा जाता है जो उन्हें धीरे-धीरे हाथ से अपडेट करती है।
समस्या:
चूंकि पार्क बहुत तेज़ी से बदलता है, इसलिए गाइडबुक्स जल्दी ही पुरानी हो जाती हैं। बुक में एक स्टेप कह सकता है, "नीला बटन दबाएं," लेकिन लाइव पार्क में, वह बटन अब लाल हो चुका है, या उसे टचस्क्रीन से बदल दिया गया है।
गाइडबुक के हर एक निर्देश की लाइव पार्क के साथ जांच करना एक बुरा सपना है। एक मानव टीम को इसके लिए साल में लाखों घंटे देने होंगे, और वर्तमान में, वे केवल 1% निर्देशों की ही जांच कर पाते हैं। यदि वे ऐसा नहीं करते हैं, तो ग्राहक खो जाते हैं और निराश होते हैं।
पुराना समाधान (और यह क्यों विफल हुआ):
कंपनी ने "सुपर-इंटेलिजेंट रोबोट्स" (फ्रंटियर प्रोप्रायटरी मॉडल्स) को काम पर रखने की कोशिश की। ये रोबोट अविश्वसनीय रूप से स्मार्ट हैं और गाइडबुक्स को पढ़ सकते हैं और पार्क में बिल्कुल सही ढंग से नेविगेट कर सकते हैं। हालांकि, वे महंगे हैं (जैसे हर एक चेक के लिए पीएचडी विशेषज्ञों की एक टीम को काम पर रखना) और जोखिम भरे हैं (आपको उन्हें अपने निजी पार्क मैप दिखाने पड़ते हैं, जो सुरक्षा नियमों का उल्लंघन करता है)। आप उन लाखों चेक्स के लिए उन्हें उपयोग करने का खर्च नहीं उठा सकते जिनकी आवश्यकता है।
नया समाधान: AliyunConsoleAgent
लेखकों ने अपना खुद का "ट्रेनेबल रोबोट" (एक 32-बिलियन पैरामीटर वाला AI मॉडल) बनाया है जो उनके अपने सर्वर पर चलाने के लिए सस्ता और सुरक्षित है। लेकिन एक मानक रोबोट इतना स्मार्ट नहीं होता कि वह एक अराजक, बदलते हुए थीम पार्क को संभाल सके। इसलिए, उन्होंने दो-चरणीय प्रशिक्षण पद्धति का उपयोग किया:
1. "शैडोइंग" चरण (सुपरवाइज्ड फाइन-ट्यूनिंग)
सबसे पहले, उन्होंने उन सुपर-इंटेलिजेंट रोबोट्स को लिया और नए रोबोट को उनका शैडो (अनुसरण) करने के लिए कहा।
- उपमा: कल्पना कीजिए कि एक मास्टर शेफ (सुपर-रोबोट) एक जटिल व्यंजन बना रहा है। नया रोबोट मास्टर को देखता है, हर कटिंग, स्टिरिंग और सीजनिंग स्टेप को याद करता है।
- परिणाम: नया रोबक पार्क में नेविगेट करने और निर्देशों का पालन करने के बेसिक्स सीख जाता है। वह काफी अच्छा हो जाता है, लेकिन वह केवल नकल कर रहा है। यदि पार्क थोड़ा भी बदल जाता है, तो वह भ्रमित हो जाता है क्योंकि वह वास्तव में लक्ष्य को समझता नहीं है, वह केवल स्टेप्स को याद रखता है।
2. "ट्रायल एंड एरर" चरण (रीइन्फोर्समेंट लर्निंग)
इसके बाद, उन्होंने रोबोट को सीखने के लिए एक सिम्युलेटेड पार्क में खुला छोड़ दिया।
- चुनौती: एक वास्तविक क्लाउड वातावरण में, रोबोट अक्सर इसलिए विफल नहीं होता क्योंकि वह मूर्ख है, बल्कि इसलिए होता है क्योंकि "पार्क" तैयार नहीं है। उदाहरण के लिए, वह एक सर्वर को डिलीट करने की कोशिश करता है, लेकिन वह सर्वर अभी मौजूद ही नहीं है। यदि रोबोट को इसके लिए दंडित किया जाता है, तो वह गलत सबक सीखता है (कि वह सर्वर डिलीट करने में बुरा है) बजाय इसके कि उसे सही सबक मिले (कि उसे पहले सर्वर बनाना चाहिए)।
- समाधान (द हाई-डिटरमिनिज्म रोलआउट): टीम ने टेराफॉर्म (एक टूल जो इंफ्रास्ट्रक्चर को लेगो की तरह बनाता है) का उपयोग करके एक विशेष "ट्रेनिंग ग्राउंड" बनाया। रोबोट द्वारा कोई कार्य करने से पहले, यह सिस्टम स्वचालित रूप से आवश्यक पूर्व-आवश्यकताएं (जैसे सर्वर बनाना, नेटवर्क सेटअप करना) तैयार करता है ताकि रोबोट सफल हो सके यदि वह सही कदम उठाता है।
- रिवॉर्ड सिस्टम: किसी इंसान द्वारा रोबोट को ग्रेड देने के बजाय, वे एक डुअल-चैनल जज का उपयोग करते हैं:
- द रूल-चेकर: यह आधिकारिक "ऑडिट लॉग्स" (पार्क के सुरक्षा कैमरा फुटेज) को देखता है कि क्या क्रिया वास्तव में हुई। क्या सर्वर डिलीट हुआ? हाँ/नहीं। यह 100% वस्तुनिष्ठ है।
- द पैनल ऑफ जजेस: यदि कोई स्पष्ट लॉग नहीं है, तो दो अन्य AI मॉडल जज के रूप में कार्य करते हैं। वे केवल तभी "पास" देते हैं जब वे दोनों इस बात पर सहमत हों कि रोबोट सफल रहा। यह रोबोट को एक अकेले जज को "धोखा" देने या चकमा देने से रोकता है।
परिणाम
इस प्रशिक्षण के बाद, रोबोट एक बेजान फॉलोअर से बदलकर एक स्वायत्त समस्या समाधानकर्ता (ऑटोनॉमस प्रॉब्लम सॉल्वर) बन गया।
- पहले: यदि गाइड कहता था "ऑटो-रिन्यूअल बंद करें" लेकिन स्विच पहले से ही बंद था, तो रोबोट बस रुक जाता और कहता "मैं यह नहीं कर सकता।"
- बाद में: रोबोट सोचता है, "रुको, मैं इसे तब तक बंद नहीं कर सकता जब तक यह पहले से बंद न हो। मुझे इसे पहले चालू करना होगा ताकि फिर मैं इसे बंद कर सकूँ ताकि यह साबित हो सके कि मैंने इसे किया है।" उसने खुद तर्क (लॉजिक) विकसित कर लिया।
मुख्य निष्कर्ष:
- प्रदर्शन: उनका नया रोबोट (AliyunConsoleAgent-32B) महंगे "सुपर-रोबोट्स" के लगभग बराबर है (केवल 1.8% का अंतर)।
- लागत: इसे चलाने में 92% कम खर्च होता है।
- प्रभाव: उन्होंने इस सिस्टम का उपयोग 54,000 से अधिक निर्देशों के ऑडिट के लिए किया और लगभग 4,400 वास्तविक त्रुटियां पाईं जिन्हें प्रोडक्ट टीमों ने ठीक किया।
संक्षेप में, उन्होंने एक स्थानीय, किफायती रोबोट को एक जीनियस की तरह सोचने के लिए सिखाया—पहले एक जीनियस का अनुसरण करवाकर, और फिर उसे एक पूरी तरह से तैयार ट्रेनिंग जिम में अभ्यास करने देकर, जहाँ वह उन चीजों के लिए दंडित हुए बिना सीख सके जो उसके नियंत्रण से बाहर थीं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।