← नवीनतम पेपर
🤖 AI

SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?

यह शोध पत्र SaaS-Bench प्रस्तुत करता है, जो 23 पेशेवर SaaS प्रणालियों में 106 यथार्थवादी कार्यों वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान कंप्यूटर-उपयोग करने वाले एजेंट जटिल, दीर्घकालिक वर्कफ़्लो में काफी संघर्ष करते हैं, और नियोजन, स्टेट ट्रैकिंग तथा त्रुटि सुधार की सीमाओं के कारण 4% से भी कम एंड-टू-एंड सफलता प्राप्त करते हैं।

मूल लेखक: Kean Shi, Zihang Li, Tianyi Ma, Zengji Tu, Jialong Wu, Xinbo Xu, Qingyao Yang, Ruoyu Wu, Weichu Xie, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

प्रकाशित 2026-05-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kean Shi, Zihang Li, Tianyi Ma, Zengji Tu, Jialong Wu, Xinbo Xu, Qingyao Yang, Ruoyu Wu, Weichu Xie, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने सबसे जटिल कार्यदिवस को संभालने के लिए एक नया सहायक रख रहे हैं। आप केवल चाहते हैं कि वे आपके ईमेल का उत्तर दें ही नहीं; आप चाहते हैं कि वे आपके बैंक, आपके प्रोजेक्ट मैनेजमेंट सॉफ्टवेयर, आपके मेडिकल रिकॉर्ड और आपके डिजाइन टूल्स में लॉग इन करें ताकि वे वास्तव में काम कर सकें।

यह पेपर एक नया "फाइनल एग्जाम" पेश करता है जिसे SaaS-Bench कहा जाता है, ताकि यह परीक्षण किया जा सके कि AI असिस्टेंट (जिन्हें कंप्यूटर-यूज़िंग एजेंट कहा जाता है) वास्तव में इस तरह की वास्तविक दुनिया की नौकरी करने में कितने अच्छे हैं।

यहाँ बताया गया है कि उन्होंने क्या किया और उन्हें क्या मिला, सरल उपमाओं (analogies) का उपयोग करते हुए।

1. समस्या: "वीडियो गेम" बनाम "असली नौकरी"

अब तक, AI असिस्टेंट के लिए अधिकांश परीक्षण वीडियो गेम खेलने जैसे थे। उनके स्तर छोटे थे, नियम सरल थे, और यदि आप फंस जाते, तो गेम बस रीसेट हो जाता था।

  • पुराना तरीका: "लाल बटन पर क्लिक करें, फिर 'नमस्ते' टाइप करें।" (आसान, छोटा, अलग-थलग)।
  • असली दुनिया: "एक कर्मचारी को निकालने के लिए HR सिस्टम पर जाएं, फिर अंतिम वेतन की गणना करने के लिए अकाउंटिंग सिस्टम पर जाएं, फिर अपने क्लाइंट्स को पुनर्वितरित करने के लिए CRM पर जाएं, और सुनिश्चित करें कि तारीखें पूरी तरह से मेल खाती हों।" (कठिन, लंबा, अव्यवस्थित)।

लेखकों ने महसूस किया कि "वीडियो गेम" परीक्षणों को पास करने का मतलब यह नहीं था कि AI एक वास्तविक नौकरी संभाल सकता है। इसलिए, उन्होंने एक नया परीक्षण बनाया जो 23 वास्तविक, तैनात सॉफ्टवेयर सिस्टम (जैसे वास्तविक मेडिकल रिकॉर्ड सिस्टम, अकाउंटिंग टूल्स और प्रोजेक्ट मैनेजर्स) पर आधारित है जिनका उपयोग पेशेवर वास्तव में करते हैं।

2. परीक्षा: SaaS-Bench

SaaS-Bench को एक विशाल, बहु-दिवसीय बाधा दौड़ (obstacle course) के रूप में समझें।

  • कोर्स: इसमें छह अलग-अलग "पड़ोस" (जैसे हेल्थकेयर, फाइनेंस और सॉफ्टवेयर इंजीनियरिंग) के माध्यम से 106 विभिन्न कार्य हैं।
  • नियम: AI को इन सिस्टम्स में वेब ब्राउज़र का उपयोग करके नेविगेट करना होगा, ठीक वैसे ही जैसे एक इंसान करता है। वह डेटाबेस कोड देखकर नकल नहीं कर सकता; उसे बटन क्लिक करने होंगे और स्क्रीन को पढ़ना होगा।
  • कठिनाई: ये 5 मिनट के कार्य नहीं हैं। औसत कार्य में 100 से अधिक चरण (क्लिक, टाइप और स्क्रॉल) लगते हैं। यह एक केक बनाने, उसके लिए रेसिपी लिखने, रेसिपी को दोस्त को मेल करने और फिर आटे की रसीद को फाइल करने के लिए पूछने जैसा है, और वह भी एक ही बार में।

3. परिणाम: AI रास्ता भटक गया

शोधकर्ताओं ने उपलब्ध सबसे स्मार्ट AI मॉडल (जैसे AI की दुनिया के "टॉप स्टूडेंट्स") का इस परीक्षा पर परीक्षण किया। परिणाम चिंताजनक थे:

  • स्कोर: यहाँ तक कि सबसे अच्छा AI मॉडल भी इन कार्यों में से 4% से भी कम को शुरुआत से अंत तक पूरा कर पाया।
  • "लगभग" वाला जाल: AI कार्यों की शुरुआत में अच्छा था। यह 80% तक पहुँच सकता था। यह पहला फॉर्म भर सकता था, सही बटन क्लिक कर सकता था और पहला दस्तावेज़ बना सकता था।
  • क्रैश: लेकिन फिर, यह एक छोटी सी गलती कर देता था (जैसे गलत तारीख टाइप करना), गलती को पहचानने में विफल रहता था, और फिर गलत रास्ते पर चलते रहना जारी रखता था। जब तक यह अंत तक पहुँचता, पूरा परिणाम गलत हो जाता।

उपमा: कल्पना कीजिए कि एक GPS है जो आपको "बाएँ मुड़ें" और "5 मील तक ड्राइव करें" बताने में बहुत अच्छा है। लेकिन अगर आप गलती से एक मोड़ चूक जाते हैं, तो GPS यह नहीं कहता है, "आप रास्ता भटक गए हैं, चलिए फिर से गणना करते हैं।" इसके बजाय, वह आत्मविश्वास के साथ आपको तब तक सीधे चलते रहने के लिए कहता है जब तक कि आपकी गैस खत्म न हो जाए। AI आत्मविश्वासी है, लेकिन अक्सर गलत होता है।

4. वे क्यों असफल हुए? (चार बड़ी बाधाएं)

पेपर इन चार मुख्य कारणों की पहचान करता है कि AI को संघर्ष क्यों करना पड़ा, इसके लिए कुछ बेहतरीन रूपकों का उपयोग किया गया है:

  • "ताश के पत्तों का घर" प्रभाव (नाजुकता - Fragility): इन लंबे कार्यों में, हर चरण पिछले चरण पर निर्भर करता है। यदि आप चरण 10 में गलती करते हैं, तो चरण 11 से 100 तक सब बर्बाद हो जाता है। AI चरण 10 में इतना अच्छा है कि उसे लगता है कि वह बहुत अच्छा कर रहा है, लेकिन उसकी एक छोटी सी गलती पूरे ढांचे को ढहा देती है।
  • "मौन जहर" (त्रुटि का प्रसार - Error Cascading): कभी-कभी AI एक ऐसी गलती करता है जो सतह पर सही दिखती है।
    • उदाहरण: AI "एलेना" नाम का एक ग्राहक बनाता है जबकि उसे "आर्कटुरस डिजिटल" बनाना चाहिए था। स्क्रीन दिखाती है "एलेना (आर्कटुरस)", तो AI सोचता है, "बढ़िया, मैंने कर दिया!" लेकिन क्योंकि नाम तकनीकी रूप से गलत है, उसके बाद होने वाला हर वित्तीय लेनदेन गलत व्यक्ति से जुड़ा होता है। AI को कभी पता ही नहीं चलता कि उसने कुएं में जहर घोल दिया है।
  • "आत्मविश्वासी झूठा" (आत्म-धोखा - Self-Deception): AI के पास एक "मेमोरी" होती है जहाँ वह खुद को बताता है कि उसने क्या किया। कभी-कभी, वह एक गलती देखता है, उसे ठीक करने की कोशिश करता है, लेकिन फिर यह जांचना भूल जाता है कि क्या सुधार काम कर गया। फिर वह रिपोर्ट लिखता है कि, "मैंने इसे ठीक कर दिया!" भले ही स्क्रीन अभी भी त्रुटि दिखा रही हो। यह उस छात्र की तरह है जिसे एहसास होता है कि उसने गणित में गलती की है, वह उसे मिटाने की कोशिश करता है, लेकिन फिर बस उत्तर लिख देता है और कहता है, "मैं हो गया।"
  • "सिक्का उछालना" (अविश्वसनीयता - Unreliability): यदि आप एक ही AI को एक ही कार्य तीन बार करने के लिए कहते हैं, तो वह पहली बार में परफेक्ट स्कोर ला सकता है, दूसरी बार में पूरी तरह विफल हो सकता है, और तीसरी बार में ठीक-ठाक कर सकता है। यह सुसंगत (consistent) नहीं है। इसका मतलब है कि आप आज इसे भरोसेमंद तरीके से काम करने के लिए नहीं कह सकते, भले ही इसने कल काम किया हो।

5. निष्कर्ष

पेपर पूछता है: "क्या AI एजेंट पेशेवर काम को हल करने के लिए वास्तविक दुनिया के सॉफ्टवेयर का उपयोग कर सकते हैं?"

उत्तर है: अभी नहीं।

हालांकि ये AI मॉडल भाषा को समझने और बात करने में अविश्वसनीय रूप से स्मार्ट हैं, लेकिन वे वर्तमान में लंबे, जटिल, वास्तविक दुनिया के निष्पादन (execution) में बहुत खराब हैं। वे विवरणों में खो जाते हैं, अपने काम की दोबारा जाँच नहीं करते हैं, और जब वे गलती करते हैं तो उससे उबर नहीं पाते हैं। जब तक AI गलत उत्तर के बारे में आत्मविश्वासी हुए बिना 100-चरणीय वर्कफ़्लो को संभाल नहीं सकता, तब तक यह आपकी पेशेवर नौकरी संभालने के लिए तैयार नहीं है।

लेखकों ने यह परीक्षण (SaaS-Bench) इसलिए नहीं बनाया कि यह कहा जा सके कि AI बेकार है, बल्कि इसलिए बनाया ताकि वे हमें दिखा सकें कि यह वास्तव में कहाँ टूटता है ताकि हम इसे ठीक कर सकें। जब तक AI भ्रमित हुए बिना या गलत उत्तर के बारे में आत्मविश्वासी हुए बिना एक 100-चरणीय वर्कफ़्लो को नहीं संभाल सकता, तब तक यह आपकी पेशेवर नौकरी लेने के लिए तैयार नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →