← नवीनतम पेपर
🤖 AI

AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning

यह शोध पत्र AliyunConsoleAgent को प्रस्तुत करता है, जो एक लागत प्रभावी वेब एजेंट फ्रेमवर्क है जो डिस्टिल्ड ट्रेजेक्टरीज (distilled trajectories) पर सुपरवाइज्ड फाइन-ट्यूनिंग और वास्तविक वातावरण में एक मजबूत रिवॉर्ड सिस्टम के साथ सुदृढीकरण सीखने (reinforcement learning) को संयोजित करने वाले दो-चरणीय प्रशिक्षण प्रतिमान के माध्यम से क्लाउड कंसोल दस्तावेज़ों को सत्यापित करने में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, निरंतर बदलते हुए थीम पार्क (द क्लाउड कंसोल) के मैनेजर हैं। हर दिन, पार्क में नई राइड्स जोड़ी जाती हैं, टिकट बूथ बदले जाते हैं, और सुरक्षा नियम अपडेट किए जाते हैं। इस बीच, गाइडबुक्स (द डॉक्यूमेंटेशन) को एक अलग टीम द्वारा लिखा जाता है जो उन्हें धीरे-धीरे हाथ से अपडेट करती है।

समस्या:
चूंकि पार्क बहुत तेज़ी से बदलता है, इसलिए गाइडबुक्स जल्दी ही पुरानी हो जाती हैं। बुक में एक स्टेप कह सकता है, "नीला बटन दबाएं," लेकिन लाइव पार्क में, वह बटन अब लाल हो चुका है, या उसे टचस्क्रीन से बदल दिया गया है।
गाइडबुक के हर एक निर्देश की लाइव पार्क के साथ जांच करना एक बुरा सपना है। एक मानव टीम को इसके लिए साल में लाखों घंटे देने होंगे, और वर्तमान में, वे केवल 1% निर्देशों की ही जांच कर पाते हैं। यदि वे ऐसा नहीं करते हैं, तो ग्राहक खो जाते हैं और निराश होते हैं।

पुराना समाधान (और यह क्यों विफल हुआ):
कंपनी ने "सुपर-इंटेलिजेंट रोबोट्स" (फ्रंटियर प्रोप्रायटरी मॉडल्स) को काम पर रखने की कोशिश की। ये रोबोट अविश्वसनीय रूप से स्मार्ट हैं और गाइडबुक्स को पढ़ सकते हैं और पार्क में बिल्कुल सही ढंग से नेविगेट कर सकते हैं। हालांकि, वे महंगे हैं (जैसे हर एक चेक के लिए पीएचडी विशेषज्ञों की एक टीम को काम पर रखना) और जोखिम भरे हैं (आपको उन्हें अपने निजी पार्क मैप दिखाने पड़ते हैं, जो सुरक्षा नियमों का उल्लंघन करता है)। आप उन लाखों चेक्स के लिए उन्हें उपयोग करने का खर्च नहीं उठा सकते जिनकी आवश्यकता है।

नया समाधान: AliyunConsoleAgent
लेखकों ने अपना खुद का "ट्रेनेबल रोबोट" (एक 32-बिलियन पैरामीटर वाला AI मॉडल) बनाया है जो उनके अपने सर्वर पर चलाने के लिए सस्ता और सुरक्षित है। लेकिन एक मानक रोबोट इतना स्मार्ट नहीं होता कि वह एक अराजक, बदलते हुए थीम पार्क को संभाल सके। इसलिए, उन्होंने दो-चरणीय प्रशिक्षण पद्धति का उपयोग किया:

1. "शैडोइंग" चरण (सुपरवाइज्ड फाइन-ट्यूनिंग)

सबसे पहले, उन्होंने उन सुपर-इंटेलिजेंट रोबोट्स को लिया और नए रोबोट को उनका शैडो (अनुसरण) करने के लिए कहा।

  • उपमा: कल्पना कीजिए कि एक मास्टर शेफ (सुपर-रोबोट) एक जटिल व्यंजन बना रहा है। नया रोबोट मास्टर को देखता है, हर कटिंग, स्टिरिंग और सीजनिंग स्टेप को याद करता है।
  • परिणाम: नया रोबक पार्क में नेविगेट करने और निर्देशों का पालन करने के बेसिक्स सीख जाता है। वह काफी अच्छा हो जाता है, लेकिन वह केवल नकल कर रहा है। यदि पार्क थोड़ा भी बदल जाता है, तो वह भ्रमित हो जाता है क्योंकि वह वास्तव में लक्ष्य को समझता नहीं है, वह केवल स्टेप्स को याद रखता है।

2. "ट्रायल एंड एरर" चरण (रीइन्फोर्समेंट लर्निंग)

इसके बाद, उन्होंने रोबोट को सीखने के लिए एक सिम्युलेटेड पार्क में खुला छोड़ दिया।

  • चुनौती: एक वास्तविक क्लाउड वातावरण में, रोबोट अक्सर इसलिए विफल नहीं होता क्योंकि वह मूर्ख है, बल्कि इसलिए होता है क्योंकि "पार्क" तैयार नहीं है। उदाहरण के लिए, वह एक सर्वर को डिलीट करने की कोशिश करता है, लेकिन वह सर्वर अभी मौजूद ही नहीं है। यदि रोबोट को इसके लिए दंडित किया जाता है, तो वह गलत सबक सीखता है (कि वह सर्वर डिलीट करने में बुरा है) बजाय इसके कि उसे सही सबक मिले (कि उसे पहले सर्वर बनाना चाहिए)।
  • समाधान (द हाई-डिटरमिनिज्म रोलआउट): टीम ने टेराफॉर्म (एक टूल जो इंफ्रास्ट्रक्चर को लेगो की तरह बनाता है) का उपयोग करके एक विशेष "ट्रेनिंग ग्राउंड" बनाया। रोबोट द्वारा कोई कार्य करने से पहले, यह सिस्टम स्वचालित रूप से आवश्यक पूर्व-आवश्यकताएं (जैसे सर्वर बनाना, नेटवर्क सेटअप करना) तैयार करता है ताकि रोबोट सफल हो सके यदि वह सही कदम उठाता है।
  • रिवॉर्ड सिस्टम: किसी इंसान द्वारा रोबोट को ग्रेड देने के बजाय, वे एक डुअल-चैनल जज का उपयोग करते हैं:
    1. द रूल-चेकर: यह आधिकारिक "ऑडिट लॉग्स" (पार्क के सुरक्षा कैमरा फुटेज) को देखता है कि क्या क्रिया वास्तव में हुई। क्या सर्वर डिलीट हुआ? हाँ/नहीं। यह 100% वस्तुनिष्ठ है।
    2. द पैनल ऑफ जजेस: यदि कोई स्पष्ट लॉग नहीं है, तो दो अन्य AI मॉडल जज के रूप में कार्य करते हैं। वे केवल तभी "पास" देते हैं जब वे दोनों इस बात पर सहमत हों कि रोबोट सफल रहा। यह रोबोट को एक अकेले जज को "धोखा" देने या चकमा देने से रोकता है।

परिणाम

इस प्रशिक्षण के बाद, रोबोट एक बेजान फॉलोअर से बदलकर एक स्वायत्त समस्या समाधानकर्ता (ऑटोनॉमस प्रॉब्लम सॉल्वर) बन गया।

  • पहले: यदि गाइड कहता था "ऑटो-रिन्यूअल बंद करें" लेकिन स्विच पहले से ही बंद था, तो रोबोट बस रुक जाता और कहता "मैं यह नहीं कर सकता।"
  • बाद में: रोबोट सोचता है, "रुको, मैं इसे तब तक बंद नहीं कर सकता जब तक यह पहले से बंद न हो। मुझे इसे पहले चालू करना होगा ताकि फिर मैं इसे बंद कर सकूँ ताकि यह साबित हो सके कि मैंने इसे किया है।" उसने खुद तर्क (लॉजिक) विकसित कर लिया।

मुख्य निष्कर्ष:

  • प्रदर्शन: उनका नया रोबोट (AliyunConsoleAgent-32B) महंगे "सुपर-रोबोट्स" के लगभग बराबर है (केवल 1.8% का अंतर)।
  • लागत: इसे चलाने में 92% कम खर्च होता है।
  • प्रभाव: उन्होंने इस सिस्टम का उपयोग 54,000 से अधिक निर्देशों के ऑडिट के लिए किया और लगभग 4,400 वास्तविक त्रुटियां पाईं जिन्हें प्रोडक्ट टीमों ने ठीक किया।

संक्षेप में, उन्होंने एक स्थानीय, किफायती रोबोट को एक जीनियस की तरह सोचने के लिए सिखाया—पहले एक जीनियस का अनुसरण करवाकर, और फिर उसे एक पूरी तरह से तैयार ट्रेनिंग जिम में अभ्यास करने देकर, जहाँ वह उन चीजों के लिए दंडित हुए बिना सीख सके जो उसके नियंत्रण से बाहर थीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →