Design and Report Benchmarks for Knowledge Work
यह शोध पत्र ज्ञान-कार्य बेंचमार्क (knowledge-work benchmarks) को डिजाइन करने और रिपोर्ट करने के लिए एक तीन-चरणीय ढांचे का प्रस्ताव करता है जो मूल्यांकन किए गए कार्यों, परीक्षण सेटिंग्स और स्कोरिंग मानदंडों को वास्तविक दुनिया की कार्य गतिविधियों के साथ स्पष्ट रूप से संरेखित करता है ताकि यह सुनिश्चित किया जा सके कि बेंचमार्क स्कोर वास्तविक तैनाती परिदृश्यों में एक सिस्टम की क्षमता को विश्वसनीय रूप से दर्शाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "डिज़ाइन एंड रिपोर्ट बेंचमार्क्स फॉर नॉलेज वर्क" (Design and Report Benchmarks for Knowledge Work) पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ अनुवाद दिया गया है।
बड़ी समस्या: "ड्राइविंग टेस्ट" बनाम "असली सफर"
कल्पना कीजिए कि आप एक ड्राइवर को काम पर रखना चाहते हैं। आप उन्हें एक ड्राइविंग टेस्ट देते हैं जहाँ वे एक खाली मैदान में कार पार्क करते हैं और सीधी रेखा में गाड़ी चलाते हैं। वे इसमें बेहतरीन स्कोर करते हैं। आप उन्हें नौकरी पर रख लेते हैं।
लेकिन उनके पहले ही दिन, वे ट्रैफिक में रास्ता भटक जाते हैं, अचानक आई बारिश को नहीं संभाल पाते, और एक डरे हुए यात्री से बात करना नहीं जानते। वे असली काम में फेल हो जाते हैं, भले ही उन्होंने टेस्ट में टॉप किया था।
यह पेपर तर्क देता है कि वर्तमान AI बेंचमार्क उसी खाली पार्किंग लॉट वाले टेस्ट की तरह हैं। वे यह मापने में बहुत अच्छे हैं कि क्या कोई AI किसी सवाल का जवाब दे सकता है या कोड की एक लाइन लिख सकता है। लेकिन वे यह अनुमान लगाने में बहुत खराब हैं कि क्या AI वास्तव में "नॉलेज वर्क" (जैसे कि एक शोधकर्ता, एक डॉक्टर, या एक ऑफिस मैनेजर) कर सकता है, जो कि वास्तविक दुनिया की उलझनों से भरा होता है।
लेखक कहते हैं: सिर्फ इसलिए कि एक AI ने टेस्ट में उच्च स्कोर प्राप्त किया है, इसका मतलब यह नहीं है कि वह वास्तव में वह काम कर सकता है।
समाधान: एक तीन-चरणीय "जॉब डिस्क्रिप्शन" (कार्य विवरण)
इसे ठीक करने के लिए, लेखक AI टेस्ट को डिज़ाइन करने और रिपोर्ट करने का एक नया तरीका प्रस्तावित करते हैं। केवल यह कहने के बजाय कि "इस AI ने गणित के टेस्ट में 90% अंक प्राप्त किए," हमें यह समझाना होगा कि उस 90% का वास्तव में क्या अर्थ है। वे हर टेस्ट के लिए तीन-चरणीय चेकलिस्ट का सुझाव देते हैं:
1. "जॉब एक्टिविटी" को परिभाषित करें (वे वास्तव में क्या कर रहे हैं?)
अधिकांश टेस्ट केवल इतना कहते हैं, "यह एक 'मेडिकल' टेस्ट है" या "यह एक 'कोडिंग' टेस्ट है।" यह बहुत अस्पष्ट है। "मेडिकल" का अर्थ मरीज का निदान करना, बीमा फॉर्म भरना, या सामान मंगवाना हो सकता है। ये पूरी तरह से अलग काम हैं।
- पेपर का समाधान: लेखकों ने 18 विशिष्ट प्रकार के कार्यों का एक "मेन्यू" बनाया है (जैसे कि जांच (Investigation), समन्वय (Coordination), रिकॉर्ड-कीपिंग (Record-Keeping), या ट्रबलशूटिंग (Troubleshooting))।
- उपमा (Analogy): यह कहने के बजाय कि "हमने एक शेफ का परीक्षण किया," हमें कहना चाहिए "हमने उनकी सब्जी काटने की क्षमता का परीक्षण किया।" हो सकता है कि वे सब्जी काटने में बहुत अच्छे हों लेकिन स्वाद (seasoning) देने में बहुत खराब। हमें यह जानने की जरूरत है कि हम किस विशिष्ट "सब्जी काटने" के कौशल का परीक्षण कर रहे हैं।
2. "वर्क सेटिंग" को स्पष्ट करें (उनके पास कौन से उपकरण और नियम थे?)
वास्तविक दुनिया में, एक वकील के पास एक लाइब्रेरी, सहायकों की एक टीम और एक सख्त समय सीमा होती है। एक टेस्ट में, AI को उत्तर कुंजी (answer key) दी जा सकती है, कोई समय सीमा नहीं होती, और कोई टीम नहीं होती।
- पेपर का समाधान: टेस्ट रिपोर्ट में यह स्पष्ट रूप से सूचीबद्ध होना चाहिए कि AI को क्या उपयोग करने की अनुमति दी गई थी। क्या उसे अपनी जानकारी खुद ढूंढनी थी, या उसे कागजों का एक ढेर थमा दिया गया था? क्या वह एक बॉस के रूप में कार्य कर रहा था या एक सहायक के रूप में?
- उपमा: यदि आप एक बढ़ई (carpenter) का परीक्षण करते हैं, तो आपको जानना होगा: क्या उनके पास पावर सॉ (आरी) और एक पूरी वर्कशॉप थी? या उन्हें केवल एक मक्खन वाले चाकू और एक अकेले कील के साथ एक कुर्सी बनानी थी? स्कोर का अर्थ पूरी तरह से बदल जाता है यदि उपकरणों का ज्ञान अलग हो।
3. "वर्क प्रोडक्ट" को स्कोर दें (वे पीछे क्या छोड़ते हैं?)
कई AI टेस्ट में, सिस्टम केवल एक अंतिम उत्तर देता है (जैसे "उत्तर 42 है")। लेकिन वास्तविक ज्ञान के कार्यों (knowledge work) में, प्रक्रिया मायने रखती है। एक डॉक्टर केवल यह नहीं कहता कि "आपको जुकाम है"; वे एक चार्ट, एक पर्चा और नर्स के लिए एक नोट भी छोड़ते हैं।
- पेपर का समाधान: केवल अंतिम उत्तर को ग्रेड न दें। उस आर्टिफैक्ट (artifact/उत्पाद) को ग्रेड दें जिसे AI ने पीछे छोड़ा है। क्या उसने यह स्पष्ट रास्ता छोड़ा कि वह उत्तर तक कैसे पहुँचा? क्या दस्तावेज़ ऐसा है जिसे कोई और उपयोग कर सके?
- उपमा: यदि कोई छात्र निबंध लिखता है, तो केवल अंतिम "A" ग्रेड न दें। ड्राफ्ट, नोट्स और उद्धरणों (citations) को भी ग्रेड दें। यदि निबंध एकदम सही है लेकिन छात्र यह नहीं समझा सकता कि उसने इसे कैसे लिखा, तो उसने वास्तव में कौशल नहीं सीखा है।
पेपर से वास्तविक दुनिया के उदाहरण
लेखकों ने अपने विचार का परीक्षण करने के लिए तीन मौजूदा AI बेंचमार्क का उपयोग किया है:
GDPVAL (एक "ऑफिस मैनेजर" टेस्ट):
- पुराना दृष्टिकोण: "यह AI 'अनुदान प्रशासन' (Grant Administration) में अच्छा है।"
- नया दृष्टिकोण: "यह AI एक विशिष्ट जोखिम-आकलन फॉर्म को डिजाइन करने में अच्छा है। लेकिन हमें यह नहीं पता कि क्या यह वास्तविक फाइलिंग या अनुमोदन (approval) प्रक्रिया को संभाल सकता है क्योंकि टेस्ट ने उसका अनुकरण (simulate) नहीं किया।"
- कमी (Gap): टेस्ट ने डिजाइन को मापा, वर्कफ़्लो को नहीं।
OFFICEQA PRO (एक "शोधकर्ता" टेस्ट):
- पुराना दृष्टिकोण: "यह AI 'दस्तावेज़ विश्लेषण' में अच्छा है।"
- नया दृष्टिकोण: "यह AI एक दस्तावेज़ में एक विशिष्ट संख्या खोजने और गणित करने में अच्छा है। लेकिन इसने मानव समीक्षा के लिए कोई रिसर्च मेमो या साइटेशन लिस्ट नहीं छोड़ी।"
- कमी (Gap): टेस्ट ने उत्तर को मापा, साक्ष्य के निशान (evidence trail) को नहीं।
APEX-SWE (एक "सॉफ्टवेयर इंजीनियर" टेस्ट):
- पुराना दृष्टिकोण: "यह AI 'सॉफ्टवेयर इंजीनियरिंग' में अच्छा है।"
- नया दृष्टिकोण: "यह AI एक ऐसा स्क्रिप्ट लिखने में अच्छा है जो एक विशिष्ट स्वचालित टेस्ट को पास करता है। लेकिन इसने वह कोड रिव्यू, डिप्लॉयमेंट, या रखरखाव (maintenance) नहीं किया जो वास्तविक इंजीनियर करते हैं।"
- कमी (Gap): टेस्ट ने कोड निष्पादन (execution) को मापा, इंजीनियरिंग जिम्मेदारी को नहीं।
मुख्य निष्कर्ष (The Takeaway)
पेपर यह नहीं कह रहा है कि AI बुरा है। यह कह रहा है कि हम रिपोर्ट कार्ड का गलत अर्थ निकाल रहे हैं।
यदि आप किसी AI का 95% स्कोर देखते हैं, तो आपको यह मानकर नहीं चलना चाहिए कि, "यह AI मेरा काम कर सकता है।" इसके बजाय, आपको पूछना चाहिए:
- इसने कौन सी विशिष्ट गतिविधि की? (जैसे, "इसने डेटा का विश्लेषण किया।")
- इसने किस सेटिंग में काम किया? (जैसे, "इसके पास सटीक डेटा था और कोई समय का दबाव नहीं था।")
- इसने क्या उत्पाद छोड़ा? (जैसे, "इसने एक संख्या दी, लेकिन कोई स्पष्टीकरण नहीं दिया।")
इस तरह विशिष्ट होकर, हम AI के बारे में बहुत अधिक वादे करने से बचते हैं और यह समझने लगते हैं कि वह वास्तव में कहाँ मददगार है और कहाँ उसे अभी भी मानवीय मदद की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।