SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents
यह शोधपत्र SeekJudge को प्रस्तुत करता है, जो एक व्यावहारिक मॉडल-आधारित रिवॉर्ड फ्रेमवर्क है, जिसमें चार भूमिका-विशिष्ट एजेंटों और एक डिस्टिल्ड (distilled) 9B बैकबोन का उपयोग किया गया है जो कंप्यूटर-उपयोग एजेंटों के प्रशिक्षण में नियम-आधारित पर्यवेक्षण के बराबर या उससे बेहतर प्रदर्शन करता है, साथ ही लंबी अवधि के कार्यों के लिए स्टेप-लेवल जजमेंट, कम लागत और स्केलेबिलिटी भी प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम की दुनिया में नेविगेट करना सिखा रहे हैं, लेकिन कंट्रोलर के बटन दबाने के बजाय, रोबोट को एक असली कंप्यूटर स्क्रीन पर बिल्कुल इंसान की तरह क्लिक, टाइप और स्क्रॉल करना होगा। यह "कंप्यूटर-यूज़ एजेंटों" (computer-use agents) की दुनिया है। लंबे समय तक, वैज्ञानिकों ने इन रोबोट्स को एक लक्ष्य दिखाकर सिखाने की कोशिश की—जैसे "एक होटल बुक करें"—और फिर यह जाँच की कि क्या वे सफल हुए। जाँच करने का पुराना तरीका एक कठोर चेकलिस्ट की तरह था: यदि रोबोट ने सही समय पर सही बटन क्लिक किया, तो उसे एक अंक मिलता; यदि उसने गलत बटन क्लिक किया, तो उसे शून्य मिलता। लेकिन कंप्यूटर अव्यवस्थित होते हैं और हमेशा बदलते रहते हैं। एक चेकलिस्ट कह सकती है कि "आप विफल रहे" क्योंकि रोबक ने उस बटन को क्लिक किया जो चेकलिस्ट पर दिए गए बटन से थोड़ा अलग दिख रहा था, भले ही रोबोट ने वास्तव में काम को पूरी तरह से पूरा कर लिया हो। यह एक शिक्षक द्वारा छात्र को इस बात के लिए फेल करने जैसा है कि उसने "colour" के बजाय "color" लिखा, भले ही निबंध शानदार था।
इसे ठीक करने के लिए, शोधकर्ताओं ने AI मॉडल का उपयोग 'जजों' के रूप में करना शुरू किया, इस उम्मीद में कि वे नियमों के बजाय कार्य की भावना (spirit) को समझ पाएंगे। हालाँकि, ये AI जज अक्सर भ्रमित हो जाते हैं जब उन्हें रोबोट की सभी क्रियाओं की एक पूरी फिल्म को एक साथ देखना पड़ता है। यह एक 500 पन्नों के उपन्यास में एक विशिष्ट टाइपो (typo) को खोजने के लिए पूरी किताब को एक सेकंड में पढ़ने की कोशिश करने जैसा है; महत्वपूर्ण विवरण शोर में खो जाते हैं। बड़ा सवाल यह था: हम एक ऐसा जज कैसे बनाएं जो मानवीय लक्ष्यों को समझने के लिए पर्याप्त स्मार्ट हो, हजारों बार चलाने के लिए पर्याप्त सस्ता हो जबकि रोबोट सीख रहा हो, और लंबी, जटिल कहानियों को बिना सिरदर्द के संभालने के लिए पर्याप्त तेज़ हो?
यहाँ SeekJudge आता है, जो एक नए फ्रेमवर्क के रूप में कार्य करता है जो एक साथ सब कुछ करने की कोशिश करने वाले एक ओवरवर्क्ड डिटेक्टिव के बजाय, एक रहस्य सुलझाने के लिए मिलकर काम करने वाले चार विशेषज्ञ जासूसों की एक टीम की तरह काम करता है। शोधकर्ताओं ने पाया कि जब आप एक AI को एक ही समय में कंप्यूटर स्क्रीन के बहुत सारे स्क्रीनशॉट देखने के लिए मजबूर करते हैं, तो वह मतिभ्रम (hallucination) का शिकार होने लगता है या सबसे महत्वपूर्ण सुरागों को छोड़ देता है। यह किसी को 100 लोगों की भीड़ में संदिग्ध की पहचान करने के लिए कहने जैसा है; वे एक अजनबी की चमकीली टोपी से विचलित हो सकते हैं और वास्तविक अपराधी को मिस कर सकते हैं। लेकिन यदि आप उन्हें संदिग्ध की केवल एक फोटो दिखा दें, तो वे उसे तुरंत पहचान लेंगे।
SeekJudge इसे काम को विभाजित करके हल करता है। पहले, दो "स्काउट्स" (जिन्हें Condense और Ground एजेंट कहा जाता है) रोबोट की लंबी यात्रा को जल्दी से देखते हैं और क्या हुआ, इसका एक संक्षिप्त, आसानी से पढ़ने योग्य सारांश लिखते हैं। फिर, एक "डिटेक्टिव" (जिसे Seek एजेंट कहा जाता है) इस सारांश को पढ़ता है और निर्णय लेता है, "हम्म, मुझे पक्का करने के लिए स्टेप 42 की फोटो देखनी चाहिए।" इसके बाद वह चौथे एजेंट, Analyze एजेंट को बुलाता है, जो केवल उस एक विशिष्ट स्क्रीनशॉट को देखता है और उसके बारे में एक सटीक प्रश्न का उत्तर देता है। यह आगे-पीछे का लूप तब तक चलता रहता है जब तक कि डिटेक्टिव अपना अंतिम निर्णय देने के लिए आश्वस्त नहीं हो जाता।
पेपर दिखाता है कि यह "खोजो और विश्लेषण करो" (seek and analyze) दृष्टिकोण एक गेम-चेंजर है। जब उन्होंने इसका परीक्षण किया, तो SeekJudge उन पुराने कठोर नियम-चेकर्स के बराबर या उनसे भी बेहतर प्रदर्शन करने वाला पहला AI-आधारित जज था, जिसने रोबोट को नए कार्य सीखने में मदद की। वास्तव में, जब इसे एक रोबोट को प्रशिक्षित करने के लिए उपयोग किया गया, तो पारंपरिक तरीकों की तुलना में SeekJudge के साथ रोबोटों ने तेजी से सीखा और वे अधिक बार सफल हुए।
सबसे अच्छी बात यह है कि यह कितना कुशल है। क्योंकि AI एक समय में एक ही इमेज को देखता है न कि ढेर सारे स्टैक को, इसलिए इसे चलाने के लिए किसी सुपर-महंगे, विशाल कंप्यूटर की आवश्यकता नहीं है। शोधकर्ताओं ने पाया कि उनके सिस्टम की लागत अन्य AI जजों की तुलना में बहुत कम है—बंद-स्रोत (closed-source) विशाल मॉडल का उपयोग करने की तुलना में सैकड़ों गुना सस्ता। यह स्थानीय विशेषज्ञों की एक टीम को कुछ डॉलर के लिए एक-एक सुराग देखने के लिए काम पर रखने बनाम एक सेलिब्रिटी डिटेक्टिव को पूरा केस फाइल एक साथ पढ़ने के लिए भारी शुल्क देने के बीच के अंतर जैसा है।
टीम ने एक नया "प्रशिक्षण मैदान" भी बनाया जिसे CUAS테pBench कहा जाता है, जो 278 विभिन्न कंप्यूटर कार्यों का एक संग्रह है जहाँ मनुषियों ने रोबोट की यात्रा के हर एक चरण को सावधानीपूर्वक लेबल किया है। इसने उनके "डिटेक्टिव" टीम को अविश्वसनीय रूप से तेज बनाने में मदद की। उन्होंने साबित किया कि समस्या को खोजने (localization) और फिर विवरण निकालने (extraction) में विभाजित करके, वे पिछले तरीकों की तुलना में बहुत लंबे और अधिक जटिल कार्यों को संभाल सकते हैं।
संक्षेप में, SeekJudge एक सुपर-इंटेलिजेंट सर्वव्यापी आंख बनने की कोशिश नहीं करता है; इसके बजाय, यह एक स्मार्ट, कुशल टीम की तरह काम करता है जो जानता है कि सबसे महत्वपूर्ण सुराग पर कब ज़ूम इन करना है। यह इसे वास्तविक दुनिया में कंप्यूटर का उपयोग करने वाले रोबोट को प्रशिक्षित करना संभव बनाता है, जहाँ कार्य लंबे होते हैं, स्क्रीन बदलती रहती है, और सख्त नियम पुस्तिकाएं काम नहीं करतीं। यह पेपर सुझाव देता है कि यह दृष्टिकोण उन AI सहायकों को बनाने की कुंजी हो सकता है जो वास्तव में हमारे दैनिक कंप्यूटर कार्यों में मदद कर सकें, जैसे उड़ान बुक करना या फाइलों को व्यवस्थित करना, बिना किसी सुपरकंप्यूटर के उनके होमवर्क को ग्रेड करने की आवश्यकता के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।