How Benchmarks Mis-Score Computer-Use Agents
यह शोधपत्र कार्य निर्माण, अवलोकन और स्कोरिंग में प्रणालीगत दोषों की पहचान करके वर्तमान कंप्यूटर-उपयोग एजेंट बेंचमार्क की विश्वसनीयता की आलोचना करता है जो त्रुटिपूर्ण विफलता निर्णयों की ओर ले जाते हैं, और मूल्यांकन सटीकता में सुधार के लिए एक नैदानिक ढांचे और डिज़ाइन नियमों का प्रस्ताव करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप टीवी पर एक हाई-स्टेक्स कुकिंग कॉम्पिटिशन देख रहे हैं। जजों को व्यंजन चखने चाहिए और तय करना चाहिए कि कौन जीता। लेकिन क्या होगा अगर जज एक टूटे हुए टेस्ट का उपयोग कर रहे हों? क्या होगा अगर वे जिस रेसिपी का पालन कर रहे हैं वह गायब होने वाली स्याही (disappearing ink) में लिखी हो, या जिस ओवन का वे उपयोग कर रहे हैं वह वास्तव में एक खिलौना हो जो गर्म ही न होता हो? आर्टिफिशियल इंटेलिजेंस की दुनिया में, विशेष रूप से "कंप्यूटर-यूज़ एजेंट्स" (स्मार्ट बॉट्स जो इंसानों की तरह क्लिक, टाइप और वेब ब्राउज़ कर सकते हैं) के मामले में, हमारे पास एक समान समस्या है। इन बॉट्स का परीक्षण यह देखने के लिए किया जा रहा है कि क्या वे टैक्स भरने या उड़ान बुक करने जैसे वास्तविक काम कर सकते हैं। हालांकि, उन्हें ग्रेड देने वाले "स्कोरकार्ड" अक्सर दोषपूर्ण होते हैं। वे एक ऐसे बॉट को फेलिंग ग्रेड दे सकते हैं जिसने वास्तव में बहुत अच्छा काम किया हो, या वे इस तथ्य को भी मिस कर सकते हैं कि बॉट इसलिए फेल हुआ क्योंकि टेस्ट खुद टूटा हुआ था। यह पेपर एक जासूसी कहानी की तरह है जहाँ लेखक इस बात की जांच कर रहे हैं कि ये स्कोरकार्ड हमें झूठ क्यों बोल रहे हैं।
"हाउ बेंचमार्क्स मिस-स्कोर कंप्यूटर-यूज़ एजेंट्स" शीर्षक वाला यह पेपर तर्क देता है कि इन AI बॉट्स को टेस्ट करने का हमारा वर्तमान तरीका गहराई से त्रुटिपूर्ण है। लेखकों ने पाया कि जब एक बॉट को "FAIL" स्कोर मिलता है, तो इस बात की आश्चर्यजनक रूप से उच्च संभावना होती है कि स्कोर वास्तव में गलत है। 150 विशिष्ट उदाहरणों की उनकी जांच में, जहाँ बॉट्स को विफल (failure) के रूप में चिह्नित किया गया था, उन्होंने पाया कि उन "FAIL" फैसलों में से 15.3% गलतियाँ थीं।
ये गलतियाँ इस प्रकार हुईं:
- जज बहुत ज्यादा सख्त था (10.7%): कभी-कभी बॉट ने सही काम किया, लेकिन ऑटोमेटेड चेकर बहुत कठोर था। यह एक शेफ को इसलिए फेल करने जैसा था क्योंकि उसने रेसिपी कार्ड में दिए गए चाकू के बजाय थोड़ा अलग चाकू इस्तेमाल किया था, भले ही खाना एकदम स्वादिष्ट बना हो।
- टेस्ट टूटा हुआ था (4.7%): कभी-कभी बॉट इसलिए काम पूरा नहीं कर सका क्योंकि टेस्ट एनवायरनमेंट (वातावरण) टूटा हुआ था। यह एक शेफ को बिना बिजली वाले ओवन में केक बेक करने के लिए कहने जैसा है। बॉट फेल हुआ, लेकिन इसलिए नहीं कि वह खाना बनाने में बुरा था; बल्कि रसोई ही खराब थी।
लेखकों ने उन बॉट्स को भी देखा जो वास्तव में फेल हुए थे। उन्होंने पाया कि मुख्य कारण आमतौर पर यह नहीं था कि बॉट ने गलत बटन दबाया (जो कि एक अनाड़ी हाथ की तरह है)। इसके बजाय, बॉट्स ज्यादातर इसलिए फेल हुए क्योंकि वे खराब प्लानिंग के लूप (loop) में फंस गए थे या उन्हें यह एहसास नहीं हुआ कि उनके कार्य काम नहीं कर रहे थे (जैसे कि एक शेफ जो उस बर्तन को हिलाता रहता है जो पहले से ही खाली है)।
पेपर सुझाव देता है कि हम केवल एक संख्या, जैसे कि "पास रेट", को देखकर यह नहीं जान सकते कि एक AI अच्छा है या नहीं। वह संख्या बहुत सारे रहस्य छिपा लेती है। इसके बजाय, हमें बेहतर टेस्ट बनाने की आवश्यकता है जो टूटने में कठिन हों, ऐसे स्मार्ट जज जो समस्या को हल करने के विभिन्न तरीकों को समझ सकें, और टेस्ट के पूर्ण वीडियो रिकॉर्डिंग प्रदान करने की आवश्यकता है ताकि हम देख सकें कि वास्तव में कहाँ गलतियाँ हुईं। लक्ष्य यह है कि बॉट्स को उन चीजों के लिए फेल होने से रोका जाए जो उनकी गलती नहीं हैं, और हमें यह समझने में मदद मिले कि उन्हें वास्तव में उपयोगी सहायक बनने के लिए क्या सीखने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।