← नवीनतम पेपर
🤖 AI

GUI vs. CLI: Execution Bottlenecks in Screen-Only and Skill-Mediated Computer-Use Agents

यह शोध पत्र एक नियंत्रित बेंचमार्क प्रस्तुत करता है जो यह प्रदर्शित करता है कि जबकि GUI एजेंट वर्तमान में बेहतर इंटरैक्शन विश्वसनीयता के कारण CLI एजेंटों से बेहतर प्रदर्शन करते हैं, CLI प्रदर्शन अंतराल मुख्य रूप से अपूर्ण कौशल कवरेज (incomplete skill coverage) द्वारा संचालित है न कि अंतर्निहित मॉडल सीमाओं द्वारा, क्योंकि सत्यापनकर्ता-निर्देशित कौशल संवर्धन (verifier-guided skill augmentation) CLI सफलता दर को महत्वपूर्ण रूप से बढ़ाता है।

मूल लेखक: Xiao Zhou, Siyue Zhang, Yilun Zhao, Jinbiao Wei, Tingyu Song, Arman Cohan, Chen Zhao

प्रकाशित 2026-06-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiao Zhou, Siyue Zhang, Yilun Zhao, Jinbiao Wei, Tingyu Song, Arman Cohan, Chen Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट सहायक है जिसे आपके कंप्यूटर पर काम करने की आवश्यकता है। आप इस रोबोट को काम करने के दो अलग-अलग तरीके दे सकते हैं:

  1. "मानवीय" तरीका (GUI): रोबोट आपकी तरह कंप्यूटर स्क्रीन को देखता है। वह आइकन, बटन और मेनू देखता है। वह माउस का उपयोग करके क्लिक करता है, ड्रैग करता है और टाइप करता है, ठीक वैसे ही जैसे आप करते हैं।
  2. "कोड" तरीका (CLI): रोबोट स्क्रीन नहीं देखता। इसके बजाय, वह कमांड्स (कौशलों) की एक विशेष पूर्व-निर्धारित सूची के माध्यम से कंप्यूटर से बात करता है। वह कहता है, "एक ट्रैक जोड़ें," और कंप्यूटर बिना यह देखे कि "ट्रैक जोड़ें" बटन कहाँ है, उसे तुरंत कर देता है।

यह शोध पत्र यह पता लगाने के लिए एक बड़ा प्रयोग है कि कौन सा तरीका बेहतर है। लेकिन इसमें एक पेच है: अतीत में, लोगों ने इन दोनों तरीकों की तुलना गलत तरीके से की थी। वे अक्सर "कोड" रोबोट को आसान कार्य या अलग लक्ष्य देते थे जबकि "मानवीय" रोबोट को अलग। यह एक रेस कार की तुलना साइकिल से करने जैसा था, लेकिन फिर साइकिल को ढलान वाला रास्ता दिया और रेस कार को पहाड़।

बड़ा प्रयोग: एक निष्पक्ष दौड़

शोधकर्ताओं ने एक निष्पक्ष खेल का मैदान बनाया। उन्होंने 440 अलग-अलग कंप्यूटर कार्य बनाए (जैसे वीडियो एडिट करना, संगीत व्यवस्थित करना, या स्प्रेडशीट बनाना)।

  • समान लक्ष्य: दोनों रोबोटों को बिल्कुल एक ही निर्देश मिला (जैसे, "इन तीन गानों का नाम बदलें")।
  • समान शुरुआती बिंदु: दोनों रोबोटों ने कंप्यूटर को बिल्कुल एक ही स्थिति में छोड़ा।
  • समान फिनिश लाइन: एक कंप्यूटर प्रोग्राम ने परिणामों की जांच की कि क्या काम सही ढंग से पूरा हुआ।
  • अलग-अलग उपकरण: एकमात्र अंतर यह था कि उन्हें काम करने के लिए कैसे अनुमति दी गई थी। एक को बटन क्लिक करने थे; दूसरे को कमांड सूची का उपयोग करना था।

परिणाम: कौन जीता?

राउंड 1: मूल दौड़

  • "मानवीय" रोबोट (GUI): इसने 59.1% सफलता दर के साथ जीत हासिल की। यह स्क्रीन पर दिखने वाले संकेतों का पालन करने में काफी अच्छा था।
  • "कोड" रोबोट (CLI): इसने 48.2% सफलता दर के साथ हार मान ली। इसे अधिक संघर्ष करना पड़ा।

कोड रोबोट क्यों हारा?
शोधकर्ताओं ने विफलताओं की गहराई से जांच की और एक आश्चर्यजनक कारण पाया। कोड रोबोट अनिवार्य रूप से "कम बुद्धिमान" नहीं था। बस उसका निर्देश मैनुअल टूटा हुआ था

  • कल्पना कीजिए कि कोड रोबोट के पास 100 कौशलों की एक सूची है, लेकिन कार्य के लिए "कौशल #42" की आवश्यकता थी, जो उसकी सूची में मौजूद नहीं था। रोबोट काम नहीं कर सका, इसलिए नहीं कि वह भ्रमित था, बल्कि इसलिए क्योंकि उपकरण ही गायब था।
  • केवल लगभग 37% कार्यों को कोड रोबोट के पास मौजूद कौशलों की मूल सूची के साथ किया जा सकता था।

राउंड 2: "सुधारे गए मैनुअल" वाली दौड़
इसके बाद शोधकर्ताओं ने कोड रोबोट के मैनुअल को ठीक किया। उन्होंने वे लापता कौशल जोड़ दिए जिनकी रोबोट को परीक्षण पास करने के लिए आवश्यकता थी।

  • नया स्कोर: कोड रोबोट की सफलता दर बढ़कर 69.3% हो गई।
  • निष्कर्ष: एक बार जब कोड रोबोट के पास सही उपकरण आ गए, तो वह वास्तव में मानवीय रोबोट से बेहतर हो गया! यह साबित करता है कि कोड रोबोट की मूल विफलता इसलिए नहीं थी कि वह सोच नहीं सकता था; बल्कि इसलिए थी क्योंकि उसके पास दबाने के लिए सही बटन नहीं थे।

प्रत्येक रोबोट कहाँ चमकता है (और कहाँ लड़खड़ाता है)

शोध पत्र में पाया गया कि प्रत्येक रोबोट की एक अलग "सुपरपावर" और एक अलग "कमजोरी" है:

  • मानवीय रोबोट (GUI):

    • सुपरपावर: उन कार्यों के लिए बेहतरीन जहाँ चरण स्क्रीन पर स्पष्ट होते हैं, जैसे वेबसाइट नेविगेट करना या वीडियो टाइमलाइन को व्यवस्थित करना।
    • कमजोरी: यह आसानी से भटक जाता है। यदि कोई मेनू छिपा हुआ है, या यदि इसे लगातार 20 बार क्लिक करना पड़ता है, तो यह अक्सर भूल जाता है कि यह क्या कर रहा था या गलत चीज़ पर क्लिक कर देता है। यह आँखों पर पट्टी बांधकर भूलभुलैया में चलने जैसा है, जहाँ आप दीवारों को देख तो सकते हैं लेकिन बार-बार उनसे टकरा जाते हैं।
  • कोड रोबोट (CLI):

    • सुपरपावर: उन कार्यों के लिए बेहतरीन जो लेगो ब्लॉक्स (Lego blocks) से बनाने जैसे हैं, जहाँ संरचना स्पष्ट होती है (जैसे फाइलें व्यवस्थित करना या 3D मॉडलिंग)। यदि इसके पास सही कमांड है, तो यह तेज़ और सटीक है।
    • कमजोरी: यह अनुमान लगाने में बहुत बुरा है। यदि कंप्यूटर में कोई "डिफ़ॉल्ट" सेटिंग है जिसे एक इंसान बिना सोचे समझे बस क्लिक कर देगा, तो कोड रोबोट को ठीक से बताया जाना चाहिए कि वह डिफ़ॉल्ट क्या है। यदि मैनुअल में यह नहीं लिखा है कि "डिफ़ॉल्ट नाम 'ट्रैक 1' है," तो रोबोट इसे "ट्रैक 2" नाम दे सकता है और विफल हो सकता है। यह एक ऐसे शेफ की तरह है जो एक बेहतरीन स्टेक तो बना सकता है लेकिन उसे यह नहीं पता कि खाना पकाने से पहले नमक डालना होता है जब तक कि उसे लिखकर न बताया जाए।

मुख्य निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि इन दोनों तरीकों की तुलना यह बताने के बारे में नहीं है कि कौन सा "बेहतर" है। यह इस बारे में है कि तर्क (logic) कहाँ निवास करता है

  • मानवीय (GUI) तरीके में, तर्क दृश्य इंटरफेस (visible interface) में निर्मित होता है। कंप्यूटर आपको चरण दिखाता है, लेकिन आपको उन्हें शारीरिक रूप से खोजना और क्लिक करना होता है।
  • कोड (CLI) तरीके में, तर्क कौशलों की एक छिपी हुई परत में निर्मित होता है। कंप्यूटर भारी काम करता है, लेकिन केवल तभी जब किसी ने मैनुअल में हर एक चरण को लिख दिया हो।

सबक: यदि आप चाहते हैं कि एक रोबोट कंप्यूटर के कार्य करे, तो आपको निर्णय लेना होगा: क्या आप चाहते हैं कि वह "देखे" और "क्लिक" करे (जो लंबे कार्यों के लिए कठिन है), या आप चाहते हैं कि वह "कमांड" दे (जो तेज़ है, लेकिन तभी काम करता है जब आपने कमांड की एक पूर्ण और सटीक लाइब्रेरी बनाई हो)? सबसे अच्छा सिस्टम दोनों का मिश्रण हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →