Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation
यह शोध पत्र कंप्यूटर-उपयोग एजेंटों के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का प्रस्ताव करता है जो शोर वाले रिवॉर्ड सिग्नल्स (noisy reward signals) उत्पन्न करने के लिए स्वायत्त विजन-लैंग्वेज मॉडल्स का लाभ उठाता है, जिन्हें फिर एक नॉइज़-अवेयर एस्टीमेटर के माध्यम से सुधारा जाता है ताकि विविध डेस्कटॉप वातावरणों में कार्य सफलता दरों को महत्वपूर्ण रूप से सुधारा जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर चलाना सिखा रहे हैं। आप चाहते हैं कि रोबोट एक स्प्रेडशीट खोले, एक विशिष्ट संख्या खोजे, और इसे बॉस को ईमेल करे। शोधकर्ता इसे कंप्यूटर-यूज़ एजेंट (CUA) कहते हैं।
बड़ी समस्या यह है: आप रोबोट को कैसे बताएंगे कि उसने अच्छा काम किया?
वीडियो गेम में, कंप्यूटर को तुरंत पता चल जाता है कि आप जीते या हारे। लेकिन एक वास्तविक डेस्कटॉप (जैसे Windows या macOS) पर, कोई "गेम ओवर" स्क्रीन नहीं होती है। रोबोट सही बटन पर क्लिक कर सकता है, लेकिन विंडो पॉप अप नहीं हो सकती, या वह गलत ईमेल पता टाइप कर सकता है। आमतौर पर, एक इंसान को स्क्रीन देखनी पड़ती है और कहना पड़ता है, "हाँ, यह काम कर गया," या "नहीं, फिर से कोशिश करो।" लेकिन आप हर एक प्रयास को देखने के लिए एक इंसान को काम पर नहीं रख सकते; यह बहुत धीमा और महंगा है।
समाधान: "रोबोट टीचर"
इस शोध पत्र के लेखकों ने एक चतुर तरीका प्रस्तावित किया है। एक इंसान के बजाय, उन्होंने एक सुपर-स्मार्ट AI (एक विजन-लैंग्वेज मॉडल) का उपयोग एक रोबोट टीचर के रूप में किया।
यह सिस्टम इस प्रकार काम करता है:
- स्टूडेंट (छात्र): कंप्यूटर-यूज़ एजेंट कार्य करने का प्रयास करता है।
- टीचर (शिक्षक): कार्य पूरा होने के बाद, रोबोट टीचर स्क्रीन के अंतिम स्क्रीनशॉट और मूल निर्देश को देखता है। इसके बाद वह एक सरल ग्रेड देता है: "पास" (1) या "फेल" (0)।
- लूप: छात्र इस ग्रेड का उपयोग करके सीखता है और फिर से प्रयास करता है।
पेच: टीचर गलतियाँ करता है
समस्या यह है कि रोबोट टीचर एकदम सटीक नहीं है। कभी-कभी वह सोचता है कि एक असफल कार्य सफल था (फॉल्स पॉजिटिव), और कभी-कभी वह सोचता है कि एक सफल कार्य विफल रहा (फॉल्स नेगेटिव)।
यदि आप केवल अंधे होकर टीचर पर भरोसा करते हैं, तो रोबंत गलत सबक सीखता है।
- उपमा: कल्पना कीजिए कि एक कोच गलती से तब ताली बजाता है और उत्साह दिखाता है जब खिलाड़ी गेंद को गलत गोल में किक मार देता है। खिलाड़ी सोचता है, "बहुत बढ़िया!" और वह ऐसा ही करता रहता है। अंततः, खिलाड़ी गलत गोल में स्कोर करने में बहुत माहिर हो जाता है।
जादुई समाधान: "नॉइज़-करेक्टेड" स्कोर
इस शोध पत्र का मुख्य योगदान एक गणितीय "करेक्शन फ़िल्टर" है।
शोधकर्ताओं ने महसूस किया कि वे यह माप सकते हैं कि टीचर कितनी बार गलतियाँ करता है। उन्होंने एक टेस्ट सेट चलाया जहाँ वे वास्तविक उत्तर जानते थे और तुलना की कि टीचर ने क्या कहा। उन्होंने गणना की:
- टीचर कितनी बार "पास" कहता है जब उसे "फेल" कहना चाहिए था?
- टीचर कितनी बार "फेल" कहता है जब उसे "पास" कहना चाहिए था?
इन नंबरों का उपयोग करके, उन्होंने रोबोट को ग्रेड देने से पहले टीचर के ग्रेड को साफ (clean up) करने के लिए एक फॉर्मूला बनाया।
- उपमा: यदि टीचर के बारे में ज्ञात है कि वह 20% अधिक उदार है, तो सिस्टम स्वचालित रूप से हर "पास" ग्रेड से थोड़ी सी "उदारता" घटा देता है इससे पहले कि रोबोट उसे देखे। यह सुनिश्चित करता है कि रोबोट टीचर के पक्षपात से नहीं, बल्कि सच्चाई से सीखता है।
क्या हुआ?
उन्होंने तीन अलग-अलग कंप्यूटर सिस्टम पर इसका परीक्षण किया: macOS, Windows और Linux।
- बिना सुधार के: रोबोट ने थोड़ा सीखा, लेकिन वह अस्थिर था और कभी-कभी सामान्य कार्यों में खराब प्रदर्शन करने लगा क्योंकि वह टीचर की गलतियों से भ्रमित हो रहा था।
- सुधार के साथ: रोबोट में काफी सुधार हुआ। औसतन, इसकी सफलता दर बिना सुधार के शुरू करने की तुलना में 12.6% बढ़ गई, और बिना सुधारा गया टीचर इस्तेमाल करने की तुलना में 5.1% बेहतर थी।
निचोड़
यह शोध पत्र सिद्ध करता है कि आप एक रोबोट को कंप्यूटर चलाने के लिए प्रशिक्षित कर सकते हैं बिना किसी इंसान के हर हरकत को देखे। आपको बस दूसरे AI का उपयोग काम को ग्रेड करने के लिए करना है, बशर्ते आप उस दूसरे AI की गलतियों के लिए गणितीय रूप से सुधार करें।
यह संभव बनाता है कि आप रोबोट को भारी मात्रा में डेटा पर प्रशिक्षित कर सकें, जिससे वे विभिन्न ऑपरेटिंग सिस्टम पर वास्तविक दुनिया के कंप्यूटर कार्यों को संभालने में बहुत बेहतर हो जाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।