OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents
यह शोध पत्र OSWorld-Human प्रस्तुत करता है, जो एक मैन्युअल रूप से एनोटेट किया गया बेंचमार्क है जो यह प्रकट करता है कि वर्तमान कंप्यूटर-उपयोग एजेंट अत्यधिक विलंबता (latency) और अक्षमता से ग्रस्त हैं, जिसका मुख्य कारण योजना बनाने और चिंतन (reflection) के लिए अत्यधिक मॉडल कॉल्स हैं, जिसके परिणामस्वरूप उन्हें कार्य पूरा करने में मनुष्यों की तुलना में 2.7 से 4.3 गुना अधिक कदम उठाने पड़ते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपने कंप्यूटर पर एक सरल कार्य करने के लिए एक बहुत ही बुद्धिमान, लेकिन अविश्वसनीय रूप से धीमे व्यक्तिगत सहायक को काम पर रखा है, जैसे कि किसी दस्तावेज़ में फ़ॉन्ट का आकार बदलना। आप उम्मीद करते हैं कि इसमें 30 सेकंड लगेंगे। इसके बजाय, आपका सहायक 12 मिनट लेता है। क्यों?
यह शोध पत्र, OSWorld-Human, ठीक इसी समस्या की जांच करता है। यह "कंप्यूटर-यूज़ एजेंट्स" (AI प्रोग्राम जो आपके माउस और कीबोर्ड को नियंत्रित करते हैं) पर नज़र डालता है और पूछता है: "वे इतने धीमे क्यों हैं, और हम उन्हें तेज़ कैसे बना सकते हैं?"
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है।
1. समस्या: "ज़रूरत से ज़्यादा सोचने वाला" सहायक
शोधकर्ताओं ने पाया कि हालांकि ये AI एजेंट काम पूरा करने (सटीकता) में बेहतर हो रहे हैं, लेकिन वे इस बात में बहुत खराब हैं कि वे इसे कितनी तेज़ी से करते हैं (दक्षता)।
- इंसान बनाम रोबोट: एक मानव विशेषज्ञ एक दस्तावेज़ में लाइन स्पेसिंग को 30 सेकंड से कम समय में बदल सकता है। AI एजेंट 12 मिनट लेता है।
- रुकावट (The Bottleneck): देरी इसलिए नहीं है क्योंकि AI धीरे-धीरे माउस क्लिक कर रहा है। यह इसलिए है क्योंकि AI लगातार सोचने के लिए रुक जाता है।
- उपमा: कल्पना कीजिए कि आप किराने के सामान के लिए गाड़ी चला रहे हैं। एक मानव ड्राइवर बस गाड़ी चलाता है। यह AI ड्राइवर हर एक चौराहे पर रुक जाता है ताकि एक सुपर-इंटेलिजेंट सलाहकार को फोन करके पूछ सके, "क्या यह सही मोड़ है? क्या मुझे बाएं मुड़ना चाहिए? क्या मैंने सही से बाएं मोड़ लिया? अगले मोड़ के बारे में क्या?"
- वास्तविकता: AI अपने अगले कदम की योजना (plan) बनाने, यह निर्णय (judge) लेने कि क्या कदम काम कर गया, और क्या हुआ इस पर चिंतन (reflect) करने के लिए एक विशाल "मस्तिष्क" (एक Large Language Model) को कॉल करता है। ये फोन कॉल सबसे अधिक समय लेते हैं। वास्तव में, केवल "योजना बनाने" और "निर्णय लेने" के चरणों में कुल समय का लगभग 75% से 96% हिस्सा लग जाता है!
2. जांच: चरणों का विश्लेषण
शोधकर्ताओं ने दो लोकप्रिय AI एजेंटों (Agent S2 और GTA1) को 39 अलग-अलग कंप्यूटर कार्यों को हल करने की कोशिश करते हुए देखा। उन्होंने प्रक्रिया के हर सेकंड का विश्लेषण किया।
- "सोचने" का टैक्स: हर बार जब AI एक कदम उठाता है, तो उसे अपने मस्तिष्क को एक बड़ा संदेश भेजना पड़ता है। जैसे-जैसे कार्य लंबा होता जाता है, संदेश भी बड़ा होता जाता है क्योंकि इसमें पहले किए गए सभी कार्यों का इतिहास शामिल करना पड़ता है।
- उपमा: यह एक डायरी प्रविष्टि लिखने जैसा है। दिन 1 पर, आप एक वाक्य लिखते हैं। दिन 50 पर, आपको एक नया वाक्य जोड़ने के लिए दिन 1 से लेकर अब तक की पूरी किताब फिर से लिखनी पड़ती है। यह बाद के चरणों को शुरुआती चरणों की तुलना में 3 गुना अधिक लंबा बना देता है।
- "गलत मोड़" का लूप: कभी-कभी, AI जानता है कि क्या करना है (जैसे, "Open बटन पर क्लिक करें"), लेकिन वह स्क्रीन पर यह नहीं ढूंढ पाता कि कहाँ क्लिक करना है। वह गलत जगह क्लिक करता है, महसूस करता है कि वह गलत था, और फिर से कोशिश करता है।
- लागत: यह "फँस जाना" अक्सर होता है। एक मामले में, एक AI ने एक फोल्डर खोलने की कोशिश की और स्क्रीन पर सही जगह न मिल पाने के कारण वह 27 मिनट के लूप में फँसा रहा, जिससे कंप्यूटिंग लागत में $8.47 की बर्बादी हुई।
3. समाधान: "मानव बेंचमार्क" (OSWorld-Human)
यह साबित करने के लिए कि ये रोबोट कितने अक्षम हैं, शोधकर्ताओं ने एक नया बेंचमार्क बनाया जिसे OSWorld-Human कहा जाता है।
- यह क्या है? उन्होंने मैन्युअल रूप से सभी 369 कार्यों को देखा और लिखा कि एक इंसान उन्हें पूरा करने के लिए सबसे छोटा, सबसे तार्किक रास्ता क्या लेगा।
- "समूहीकरण" (Grouping) की तकनीक: उन्होंने देखा कि इंसान अक्सर बिना सोचे-समझे एक साथ कई चीजें करते हैं।
- उपमा: एक इंसान एक टेक्स्ट बॉक्स देखता है, एक नाम टाइप करता है, और एक ही सहज गति में "Enter" दबा देता है। हालाँकि, AI बॉक्स देखने के बाद रुक जाता है, टाइप करने की योजना बनाने के लिए अपने मस्तिष्क को कॉल करता है, फिर "Enter" दबाने की योजना बनाने के लिए फिर रुकता है, और फिर से एक विचार के लिए अपने मस्तिष्क को कॉल करता है।
- निष्कर्ष: शोधकर्ताओं ने पाया कि कई कार्यों को एक साथ "समूहित" किया जा सकता है। यदि AI एक "विचार" में तीन क्लिक कर सकता है, तो यह बहुत सारा समय बचाएगा।
4. निर्णय: रोबोट कदम बर्बाद कर रहे हैं
शोधकर्ताओं ने 16 अलग-अलग AI एजेंटों का उनके नए "मानव बेंचमार्क" के विरुद्ध परीक्षण किया।
- परिणाम: यहाँ तक कि सर्वश्रेष्ठ AI एजेंटों ने भी उसी कार्य को पूरा करने के लिए इंसान की तुलना में 2.7 से 4.3 गुना अधिक कदम लिए।
- स्कोर: उन्होंने Weighted Efficiency Score (WES) नामक एक नया स्कोर बनाया।
- यदि कोई AI काम पूरा कर देता है लेकिन आवश्यक समय से 4 गुना अधिक समय लेता है, तो उसका स्कोर भारी रूप से गिर जाता है।
- लीडरबोर्ड पर मौजूद शीर्ष AI, जो पुराने परीक्षणों में बहुत अच्छा दिख रहा था, इस नए दक्षता परीक्षण पर केवल 15.6% स्कोर कर सका। इसका मतलब है कि वह बहुत सारा अनावश्यक काम कर रहा है।
सारांश
शोध पत्र का निष्कर्ष है कि वर्तमान AI कंप्यूटर एजेंट प्रतिभाशाली लेकिन अनाड़ी छात्रों की तरह हैं। वे उत्तर जानते हैं, लेकिन वे हाथ उठाने, शिक्षक के इंतज़ार करने और अपने नोट्स को फिर से पढ़ने में इतना समय बिता देते हैं कि वे कभी भी समय पर परीक्षा पूरी नहीं कर पाते।
इसे ठीक करने के लिए, पेपर तीन मुख्य सुझाव देता है:
- ज़रूरत से ज़्यादा सोचना बंद करें: AI द्वारा अपने "मस्तिष्क" को योजना बनाने और निर्णय लेने के लिए कॉल करने की संख्या कम करें।
- कार्यों को समूह में रखें: AI को एक ही विचार में कई कदम (जैसे टाइप करना और एंटर दबाना) करने दें।
- चीजों को खोजने में बेहतर बनें: AI की क्षमता में सुधार करें ताकि वह सटीक रूप से देख सके कि कहाँ क्लिक करना है ताकि वह लूप में न फँसे।
लक्ष्य केवल AI को स्मार्ट बनाना नहीं है, बल्कि इसे वास्तविक दुनिया के उपयोग के लिए तेज़ और अधिक व्यावहारिक बनाना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।