← नवीनतम पेपर
💻 computer science

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

यह शोधपत्र CUADebug को प्रस्तुत करता है, जो एक फ्रेमवर्क है जिसमें एक त्रुटि वर्गीकरण (error taxonomy), एक मानव-एनोटेटेड बेंचमार्क, और एक सक्रिय, टूल-संवर्धित डिबगर शामिल है जो मल्टीमॉडल प्रक्षेपवक्रों (multimodal trajectories) में मूल कारणों का सटीक पता लगाकर कंप्यूटर-उपयोग एजेंट की विफलताओं के निदान और सुधार में महत्वपूर्ण सुधार करता है ताकि प्रभावी कार्य पुन: निष्पादन सक्षम हो सके।

मूल लेखक: Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

प्रकाशित 2026-08-05
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट असिस्टेंट बनाया है जो आपकी कंप्यूटर स्क्रीन देख सकता है, आपके माउस को चला सकता है और आपके कीबोर्ड पर टाइप कर सकता है, बिल्कुल एक इंसान की तरह। यह सिर्फ कोड के बारे में बात करने वाला कोई चैटबॉट नहीं है; यह एक "कंप्यूटर-यूज़ एजेंट" (Computer-Use Agent) है जो वास्तव में वास्तविक डिजिटल दुनिया में काम करता है, जैसे फॉर्म भरना, दस्तावेज़ों को संपादित करना या फ़ाइलों को व्यवस्थित करना। लेकिन यहाँ एक पेंच है, ठीक वैसे ही जैसे एक इंसान नया वीडियो गेम सीखते समय गलतियाँ करता है, ये रोबोट भी गलतियाँ करते हैं। कभी-कभी वे गलत बटन पर क्लिक कर देते हैं, कभी-कभी वे जो देखते हैं उसे समझने में चूक जाते हैं, या कभी-कभी वे निर्देशों की एक लंबी सूची में खो जाते हैं। बड़ा सवाल वैज्ञानिकों के लिए यह है कि जब रोबट विफल होता है, तो हम यह कैसे पता लगाएँ कि वह ठीक कहाँ गलत हुआ? क्या इसलिए कि वह स्क्रीन पर छोटे टेक्स्ट को नहीं देख सका? क्या वह पाँच कदम पहले बनाई गई अपनी योजना को भूल गया? या उसने बस गलत चीज़ पर क्लिक कर दिया? इन्हें ठीक करना कठिन है क्योंकि त्रुटि बहुत शुरुआत में हुई हो सकती है, लेकिन रोबोट आपको अंत में केवल टूटा हुआ परिणाम दिखाता है।

यह शोध पत्र डिजिटल जासूसों की एक नई टीम CUADebug को इस रहस्य को सुलझाने के लिए पेश करता है। केवल रोबोट से यह पूछने के बजाय कि "तुम क्यों विफल हुए?" और एक अच्छे उत्तर की उम्मीद करने के बजाय, CUADebug एक फॉरेंसिक अन्वेषक की तरह कार्य करता है। इसके पास उपकरणों का एक विशेष सेट है जो इसे रोबोट के इतिहास को रोकने, हर एक क्लिक के "पहले" और "बाद" की तस्वीरों को देखने और इसकी तुलना करने की अनुमति देता है कि रोबोट क्या करने की कोशिश कर रहा था। शोधकर्ताओं ने वास्तविक जीवन की रोबोट विफलताओं (जिसे CUAErrorBench कहा जाता है) का एक विशाल पुस्तकालय बनाया है जहाँ मनुष्यों ने सावधानीपूर्वक लेबल किया है कि वास्तव में क्या गलत हुआ था। उन्होंने पाया कि जबकि रोबोट अक्सर बड़े स्तर की योजना बनाने में विफल होते हैं, वे छोटी चीजों जैसे कि बारीक विवरण देखने या सही जगह क्लिक करने में भी संघर्ष करते हैं। इस जासूसी कार्य का उपयोग करके, टीम ने दिखाया कि वे न केवल यह समझा सकते हैं कि एक रोबोट क्यों विफल हुआ, बल्कि वे इसे फिर से प्रयास करने के लिए एक विशिष्ट "रिपेयर रेसिपी" (मरम्मत की विधि) भी दे सकते हैं। जब उन्होंने रोबोट को इन रेसिपीज़ का उपयोग करके कार्य को फिर से करने की अनुमति दी, तो वह अंधे होकर प्रयास करने की तुलना में बहुत अधिक बार सफल रहा।

जासूस का टूलकिट: CUADebug कैसे काम करता है

एक कंप्यूटर-उपयोग करने वाले एजेंट को एक ऐसे छात्र के रूप में सोचें जो व्हाइटबोर्ड पर एक जटिल गणित की समस्या हल करने की कोशिश कर रहा है। यदि छात्र अंतिम उत्तर गलत देता है, तो एक शिक्षक केवल कह सकता है, "फिर से प्रयास करें।" लेकिन एक स्मार्ट शिक्षक (जैसे CUADebug) छात्र के काम को चरण-दर-चरण देखेगा। वे पूछेंगे, "क्या आपने चरण 3 में संख्या को गलत पढ़ा? क्या आपने चरण 5 में गलत सूत्र का उपयोग किया? या क्या आप बस थक गए और एक लाइन छोड़ दी?"

शोधकर्ताओं ने महसूस किया कि कंप्यूटर एजेंटों के लिए, "व्हाइटबोर्ड" कंप्यूटर स्क्रीन है, और "चरण" माउस क्लिक और कीबोर्ड प्रेस हैं। समस्या यह है कि ये एजेंट अक्सर उन तरीकों से विफल होते हैं जिन्हें पहचानना कठिन होता है। एक रोबोट गलत विंडो पर क्लिक कर सकता है क्योंकि उसने सोचा कि एक छोटा सा आइकन एक बटन है, या वह प्रोग्राम बंद करने से पहले फ़ाइल को सेव करना भूल सकता है। ये विफलताएं विजुअल परसेप्शन (वह क्या देखता है), स्पेशियल ग्राउंडिंग (चीजें कहाँ हैं), इंटरेक्शन (वह कैसे क्लिक करता है) और रीज़निंग (योजना) का मिश्रण हैं।

इसे हल करने के लिए, टीम ने CUADebugger बनाया, जो एक टूल-संवर्धित जासूस है। डेटा के विशाल ढेर से पूरी कहानी का अनुमान लगाने के बजाय, CUADebugger सक्रिय रूप से जांच करता है। यह एक "ReAct" लूप का उपयोग करता है, जो एक जासूस के समान है जो कहता है, "मुझे संदेह है कि चरण 12 समस्या है। मुझे चरण 12 से पहले की स्क्रीन और चरण 12 के बाद की स्क्रीन को देखने दें।" यह इन दोनों स्क्रीनशॉट की तुलना रोबोट के अपने नोट्स से करता है कि उसका इरादा क्या था। यदि रोब का कहना है, "मैं लाल बटन क्लिक करने जा रहा हूँ," लेकिन स्क्रीनशॉट दिखाता है कि उसने नीला बटन क्लिक किया है, तो जासूस इसे विफलता के रूप में चिह्नित करता है।

रहस्यमय पुस्तकालय: CUAErrorBench

आप एक जासूस को प्रशिक्षण दिए बिना नहीं सिखा सकते। शोधकर्ताओं ने CUAErrorBench बनाया, जो विभिन्न रोबोट एजेंटों (Claude 4.5, Gemini 2.5 Pro, और Qwen 3.5 जैसे मॉडल का उपयोग करते हुए) द्वारा किए गए विफल मिशनों का एक पुस्तकालय है। मनुष्यों ने इन विफलताओं को देखा और उन्हें एक विशिष्ट "टैक्सोनॉमी" (वर्गीकरण प्रणाली) के साथ लेबल किया। उन्होंने पाया कि विफलता की सबसे बड़ी श्रेणी टास्क रीज़निंग एंड कंट्रोल (110 में से 204 मामले) थी। यह ऐसा है जैसे रोबोट योजना भूल गया या लक्ष्य को लेकर भ्रमित हो गया। अगली सबसे बड़ी श्रेणियां परसेप्शन (36 मामले, जहाँ रोबोट कुछ देख नहीं पाया) और ग्राउंडिंग/इंटरेक्शन (25 मामले, जहाँ उसने गलत चीज़ पर क्लिक किया) थीं।

पेपर का तर्क है कि आप केवल रोबोट को अपनी गलतियों के नियम खुद बनाने के लिए नहीं छोड़ सकते। एक प्रयोग में, उन्होंने एक शक्तिशाली AI को शुरू से ही गलतियों की श्रेणियों की अपनी सूची बनाने की अनुमति दी। परिणाम क्या रहा? AI बार-बार अपना मन बदलता रहा। एक बार इसने गलती को "विजुअल एरर" कहा, और अगली बार उसी चीज़ को "एक्शन पॉलिसी फेल्योर" कहा। शोधकर्ताओं ने पाया कि बिना मानव-निर्मित मार्गदर्शिका के, AI समस्याओं का वर्णन करने के लिए एक स्थिर तरीका तय करने में सक्षम नहीं था। यह सुझाव देता है कि डिबगिंग के लिए "खेल के नियम" परिभाषित करने के लिए अभी भी मानव विशेषज्ञों की आवश्यकता है।

मरम्मत: स्पष्टीकरण से क्रिया तक

इस पेपर का सबसे रोमांचक हिस्सा वह है जो तब होता है जब जासूस सुराग ढूंढ लेता है। कई AI सिस्टम आपको यह बताने के लिए एक लंबा, फैंसी स्पष्टीकरण दे सकते हैं कि वे क्यों विफल हुए, लेकिन वह वास्तव में समस्या को ठीक नहीं करता है। CUADebugger अलग है क्योंकि यह निदान को एक रिपेयर सिग्नल (मरम्मत संकेत) में बदल देता है।

कल्पना कीजिए कि रोबोट एक प्रेजेंटेशन में स्लाइड नंबरों का रंग बदलने की कोशिश कर रहा है।

  1. विफलता: रोबोट गलत बॉक्स पर क्लिक करता है, यह सोचकर कि वह टेक्स्ट चुन रहा है, लेकिन वास्तव में वह फ्रेम चुन लेता है। बाद में, नंबर लाल के बजाय ग्रे ही रहते हैं।
  2. निदान: CUADebugger पीछे मुड़कर देखता है, गलत क्लिक देखता है, और कहता है, "त्रुटि चरण 2 में थी। रोबोट ने सोचा कि वह टेक्स्ट पर क्लिक कर रहा है, लेकिन उसने फ्रेम पर क्लिक किया। सुधार यह है कि विशेष रूप से टेक्स्ट पर डबल-क्लिक करें।"
  3. मरम्मत: रोबोट को इस नए निर्देश के साथ चरण 2 पर वापस भेजा जाता है।

इस "मरम्मत" के परिणाम प्रभावशाली थे। जब रोबोट को जासूस की सलाह का उपयोग करके गलती से दोबारा शुरू करने की अनुमति दी गई:

  • सिंगल रिट्राय (एकल पुनः प्रयास): यदि रोबोट बिना मदद के बस चलते रहने की कोशिश करता, तो वह केवल 13.89% बार सफल होता। जासूस के विशिष्ट मरम्मत निर्देशों के साथ, सफलता बढ़कर 29.90% हो गई।
  • कंटीन्यूअस रिट्राय (निरंतर पुनः प्रयास): यदि रोबोट को बार-बार प्रयास करने की अनुमति दी गई, तो सफलता दर 12.2% से बढ़कर उनके तरीके के साथ 25.86% हो गई। यह उस स्तर के बहुत करीब है जो एक मानव विशेषज्ञ प्राप्त कर सकता था (जो कि 29.21% था)।

भविष्य के लिए इसका क्या अर्थ है

यह शोध पत्र सुझाव देता है कि रोबोट एजेंटों को ठीक करने का भविष्य केवल उन्हें स्मार्ट बनाने या उन्हें अधिक मेमोरी देने के बारे में नहीं है। यह बेहतर "डिबगिंग" सिस्टम बनाने के बारे में है जो सटीक रूप से उस क्षण को पहचान सकें जब रोबोट पटरी से उतर जाता है और उसे ठीक करने का एक ठोस तरीका दे सकें। शोधकर्ताओं ने पाया कि जबकि रीजनिंग त्रुटियां सबसे आम हैं, विजुअल और इंटरेक्शन त्रुटियां भी पकड़ने के लिए उतनी ही महत्वपूर्ण हैं।

उन्होंने यह भी दिखाया कि एक सक्रिय जासूस (CUADebugger) जो स्क्रीनशॉट और क्रियाओं को देखता है, वह एक ऐसे जासूस की तुलना में बहुत बेहतर है जो केवल जो हुआ उसकी एक लंबी कहानी पढ़ता है (मानक दृष्टिकोण)। उदाहरण के लिए, मुख्य परीक्षण समूह पर, सक्रिय जासूस ने सटीक गलती खोजने की सटीकता को 11.2% से बढ़ाकर 19.6% कर दिया। हालांकि यह संख्या बहुत बड़ी नहीं लग सकती है, लेकिन जटिल रोबोट कार्यों की दुनिया में, ठीक करने के लिए सटीक चरण ढूंढना अविश्वसनीय रूप से कठिन है।

अंततः, यह कार्य दिखाता है कि हम उस युग से आगे बढ़ रहे हैं जहाँ हम केवल रोबोट को विफल होते देखते हैं और कहते हैं, "ओह, यह बुरा हुआ।" हम एक ऐसे युग में प्रवेश कर रहे हैं जहाँ हम ऐसे सिस्टम बना सकते हैं जो फॉरेंसिक वैज्ञानिकों की तरह कार्य करते हैं, विफलता के मूल कारण को ढूंढते हैं और रोबोट को फिर से प्रयास करने के लिए एक नक्शा सौंपते हैं, इस बार सही ढंग से। पेपर यह दावा नहीं करता है कि इसने सभी रोबोट विफलताओं को हमेशा के लिए हल कर दिया है, लेकिन यह एक शक्तिशाली नया टूलकिट प्रदान करता है जो उन्हें ठीक करना काफी आसान और अधिक प्रभावी बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →