AutomationBench
यह शोध पत्र AutomationBench को पेश करता है, जो एक चुनौतीपूर्ण नया बेंचमार्क है जो REST API के माध्यम से जटिल, क्रॉस-एप्लिकेशन वर्कफ़्लो को ऑर्केस्ट्रेट करने की उनकी क्षमता के आधार पर AI एजेंटों का मूल्यांकन करता है, जिसमें वे स्वायत्त रूप से एंडपॉइंट्स की खोज करते हैं और व्यावसायिक नीतियों का पालन करते हैं, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल इन वास्तविक दुनिया की व्यावसायिक मांगों के साथ काफी संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपने छोटे से व्यवसाय को चलाने के लिए एक सुपर-इंटेलिजेंट रोबोट असिस्टेंट को काम पर रखा है। आप उसे कहते हैं, "कृपया हमारी सेल्स टीम का शेड्यूल व्यवस्थित करें, हमारी कस्टमर लिस्ट अपडेट करें, और हमारे सबसे बड़े क्लाइंट को धन्यवाद नोट भेजें।"
एक आदर्श दुनिया में, रोबोट को तुरंत पता चल जाएगा कि कौन सा कंप्यूटर प्रोग्राम खोलना है, कौन सा बटन क्लिक करना है, और एक जगह से दूसरी जगह डेटा कैसे ले जाना है। लेकिन वास्तविकता में, आज का AI एक ऐसे प्रतिभाशाली छात्र की तरह है जिसने लाइब्रेरी की हर किताब पढ़ ली है लेकिन उसे कभी किताबें छूने या दरवाजे खोलने की अनुमति नहीं मिली है। वह जानता है कि क्या करना है, लेकिन अलग-अलग सिस्टम्स के बीच यह समझने में भटक जाता है कि इसे कैसे करना है।
AutomationBench एक नया, बहुत कठिन टेस्ट है जिसे यह देखने के लिए बनाया गया है कि क्या AI एजेंट्स वास्तव में वास्तविक दुनिया में काम पूरा कर सकते हैं। यहाँ इस पेपर का एक सरल विवरण दिया गया है:
1. समस्या: व्यवसाय का "टॉवर ऑफ बेबेल" (Tower of Babel)
व्यवसाय टूल्स के एक अराजक मिश्रण का उपयोग करते हैं: सेल्स के लिए एक CRM, ईमेल के लिए Gmail, चैट के लिए Slack, मीटिंग्स के लिए Google Calendar, और फाइनेंस के लिए स्प्रेडशीट्स।
- पुराने टेस्ट: पिछले AI टेस्ट किसी रोबोट को "वेबसाइट पर बिल्ली की तस्वीर ढूंढने" या "इस बटन पर क्लिक करने" जैसा काम देने की तरह थे। वे बहुत सरल थे या केवल एक समय में एक ही ऐप को देखते थे।
- असली चुनौती: एक वास्तविक व्यावसायिक कार्य रिले रेस की तरह है जहाँ बैटन (baton) पाँच बार हाथों से बदलता है। AI को कैलेंडर से ईमेल पर, फिर स्प्रेडशीट पर, और अंत में चैट ऐप पर कूदना होगा, और वह भी सख्त कंपनी नियमों का पालन करते हुए।
2. समाधान: एक "डिजिटल बाधा दौड़" (Digital Obstacle Course)
लेखकों (Zapier से) ने एक सिम्युलेटेड दुनिया बनाई है जो एक डिजिटल बाधा दौड़ की तरह काम करती है।
- नक्शा छिपा हुआ है: AI को कोई नक्शा नहीं दिया जाता है। उसे "डिजिटल शहर" (APIs) में घूमना पड़ता है और यह पता लगाना पड़ता है कि कौन सा दरवाजा "सेल्स ऑफिस" की ओर जाता है और कौन सा "फाइनेंस वॉल्ट" की ओर।
- शोर (Noise): यह कोर्स विकर्षणों से भरा है। इसमें फर्जी रिकॉर्ड, भ्रामक संकेत और अप्रासंगिक डेटा मौजूद हैं। यह एक व्यस्त बाजार में चलने जैसा है जहाँ कोई गलत दिशा निर्देश चिल्ला रहा हो।
- नियम: AI को एक "रूलबुक" (बिजनेस पॉलिसी) का पालन करना होगा जो कह सकती है, "CEO के ईमेल को तब तक अनदेखा करें जब जब तक उसमें एक विशिष्ट विषय (subject line) न हो।"
3. स्कोरिंग: "क्या केक बन गया?"
कई AI टेस्ट में, AI को इस बारे में एक अच्छा निबंध लिखने के लिए अंक मिलते हैं कि वह केक कैसे बनाएगा।
- AutomationBench निबंध की परवाह नहीं करता। यह केवल अंत में किचन की जांच करता है।
- क्या केक वास्तव में ओवन में दिखाई दिया? क्या वह सही फ्लेवर का था? क्या चीनी सही मात्रा में मापी गई थी?
- यदि AI ने एक अजीब रास्ता लिया, 50 गलतियाँ कीं, लेकिन अंत में उन सभी को ठीक कर दिया, तो उसे पूरे अंक मिलते हैं। यदि उसने एक परफेक्ट योजना बनाई लेकिन कटोरे में आटा डालना भूल गया, तो उसे शून्य मिलता है।
4. परिणाम: "प्रतिभाशाली लेकिन अनाड़ी" वास्तविकता
पेपर ने दुनिया के सबसे स्मार्ट AI मॉडल्स (जैसे कि 2026 के "सुपर-ब्रेन") का इस बाधा दौड़ पर परीक्षण किया।
- स्कोर: बेहतरीन मॉडल्स ने भी 10% से कम स्कोर किया।
- उपमा: कल्पना कीजिए कि आपने पीएचडी छात्रों के एक समूह को एक जटिल पहेली दी। उन्होंने निर्देशों को पूरी तरह से पढ़ा, लेकिन जब उन्होंने इसे हल करने की कोशिश की, तो वे टुकड़े गिराते रहे, रंगों को भ्रमित करते रहे, या यह भूल गए कि कौन सा टुकड़ा किस बॉक्स का है।
- वे क्यों विफल हुए:
- झूठी आत्म-निर्भरता (False Confidence): उन्होंने अक्सर "हो गया!" कहा जबकि उन्होंने वास्तव में काम पूरा नहीं किया था।
- हार मान लेना: जब वे तुरंत डेटा का कोई टुकड़ा नहीं ढूंढ पाए, तो उन्होंने मान लिया कि वह मौजूद ही नहीं है, बजाय इसके कि वे और गहराई से खोज करते।
- कदम छोड़ देना: उन्होंने 10 ईमेल प्रोसेस किए लेकिन 11वें को चेक करना भूल गए।
5. यह क्यों महत्वपूर्ण है
यह बेंचमार्क एक रियलिटी चेक है। यह दिखाता है कि हालांकि AI बात करने और सोचने में बेहतर हो रहा है, लेकिन यह अभी भी अलग-अलग कंप्यूटर प्रोग्रामों में जटिल, बहु-चरणीय कार्यों को करने में बहुत बुरा है।
मुख्य बात (Takeaway):
हम वर्तमान में AI ऑटोमेशन के "टॉडलर फेज" (Toddler Phase - छोटे बच्चों की अवस्था) में हैं। वे "नमस्ते" और "कृपया" कह सकते हैं, लेकिन अभी उन पर बिना निरंतर निगरानी के पूरा व्यवसाय चलाने के लिए भरोसा नहीं किया जा सकता। AutomationBench वह ट्रेनिंग ग्राउंड है जिसे इन डिजिटल टॉडलर्स को विश्वसनीय कर्मचारियों में बदलने के लिए डिज़ाइन किया गया है।
संक्षेप में: इस पेपर ने AI के खेलने के लिए एक बहुत कठिन वीडियो गेम बनाया है। AI खिलाड़ी लगभग हर लेवल हार रहे हैं, जो यह साबित करता है कि "स्मार्ट चैटबॉट्स" और "स्वायत्त श्रमिकों" (autonomous workers) के बीच अभी भी एक बड़ा अंतर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।