Economic Evaluations of Language Models
यह शोध पत्र EconEvals को प्रस्तुत करता है, जो एक लागत प्रभावी, ओपन-सोर्स मूल्यांकन सूट और सिमुलेशन फ्रेमवर्क है जो अमेरिकी व्यवसायों में समय बचाने की भाषा मॉडलों की क्षमता का आकलन करता है, जिससे यह पता चलता है कि जबकि वर्तमान मॉडल लगभग आधे सभी नौकरियों पर महत्वपूर्ण प्रभाव डाल सकते हैं, उनका वास्तविक अपनाना वर्तमान में तकनीकी क्षमता के बजाय गोपनीयता संबंधी चिंताओं और मालिकाना सिस्टम बाधाओं द्वारा सीमित है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की दुनिया की कल्पना एक विशाल, हलचल भरी लाइब्रेरी के रूप में करें जहाँ किताबें हर दिन और भी स्मार्ट होती जा रही हैं। लंबे समय से, लाइब्रेरियन (वैज्ञानिक) इन नई, सुपर-स्मार्ट किताबों का परीक्षण करने के लिए उन्हें गणित की पहेलियाँ सुलझाने या कोड लिखने के लिए कह रहे हैं। यह ऐसा है जैसे यह जाँच करना कि क्या एक नई कार रेस ट्रैक पर जीत सकती है। लेकिन समस्या यह है: वास्तविक जीवन कोई रेस ट्रैक नहीं है। वास्तविक जीवन एक अस्त-व्यस्त, जटिल शहर है जहाँ लोग पाइप ठीक करने से लेकर अस्पतालों के प्रबंधन तक हज़ारों अलग-अलग काम करते हैं। वह बड़ा सवाल जो हर कोई पूछ रहा है, वह यह है: "यदि ये AI किताबें इतनी स्मार्ट हैं, तो वे वास्तव में हमारे दैनिक कार्यों में कितनी मदद करेंगी? क्या वे हमारा समय बचाएँगी, या वे बस शेल्फ पर पड़ी रहेंगी?"
इसे समझने के लिए, हमें कुछ चीज़ों को समझना होगा। पहला, "बेंचमार्क" (benchmarks) हैं, जो AI के लिए मानकीकृत परीक्षणों की तरह हैं। यदि कोई AI उच्च स्कोर प्राप्त करता है, तो इसका अर्थ है कि वह उस विशिष्ट परीक्षण में अच्छा है। दूसरा, "एक्सपोज़र" (exposure) है, जो एक फैंसी शब्द है जिसका अर्थ है, "एक कार्यकर्ता के दिन का कितना हिस्सा यह AI वास्तव में अपने हाथ में ले सकता है?" और अंत में, वह अंतर जो AI एक परीक्षण में कर सकता है और वह जो वह वास्तव में वास्तविक दुनिया में करता है। हमें इसकी परवाह इसलिए है क्योंकि यदि हमें उत्तर नहीं पता होगा, तो हम भविष्य की योजना नहीं बना पाएंगे। हम सोच सकते हैं कि AI कल सब कुछ बदलने वाला है, या हम सोच सकते हैं कि यह कुछ भी नहीं बदलेगा, और दोनों अनुमान गलत हो सकते हैं।
यहाँ स्टैनफोर्ड और यूनिवर्सिटी ऑफ साओ पाउलो के शोधकर्ताओं की एक टीम आई जिन्होंने केवल अनुमान लगाना बंद कर दिया और मापना शुरू किया। उन्होंने एक नया, ओपन-सोर्स टूलकिट बनाया जिसे ECONEVALS कहा जाता है। इस टूलकिट को पूरे अमेरिकी जॉब मार्केट के एक विशाल, डिजिटल मानचित्र के रूप में समझें। केवल सॉफ्टवेयर इंजीनियरों जैसे कुछ लोकप्रिय व्यवसायों को देखने के बजाय, उन्होंने 1,000 से अधिक विभिन्न व्यवसायों का मानचित्रण किया, जिन्हें लगभग 19,000 सूक्ष्म कार्यों में विभाजित किया गया। यह एक सूक्ष्मदर्शी (microscope) रखने जैसा है जो एक कार्यकर्ता द्वारा किए जाने वाले हर एक कार्य पर ज़ूम कर सकता है, जैसे कि "फोन का उत्तर देना" से लेकर "पुल डिजाइन करना" तक।
टीम के सामने एक कठिन समस्या थी: उन्हें यह जानने की आवश्यकता थी कि वास्तविक लोग काम करते समय AI से वास्तव में क्या पूछते हैं, लेकिन वह अधिकांश डेटा निजी होता है। इसलिए, उन्होंने दो काम किए। पहले, उन्होंने लाखों सार्वजनिक बातचीत की छानबीन की ताकि वास्तविक कार्य-संबंधी प्रश्न खोजे जा सकें। दूसरा, जब उन्हें किसी विशिष्ट नौकरी के लिए वास्तविक डेटा नहीं मिला, तो उन्होंने "सिंथेटिक" (synthetic) डेटा बनाया। कल्पना कीजिए कि एक रोबोट अभिनेता एक नर्स, एक शिक्षक या एक निर्माण कार्यकर्ता की भूमिका निभा रहा है, और अपने विशिष्ट दैनिक कार्यों के लिए AI से मदद मांग रहा है। उन्होंने वास्तविक और भूमिका-निभाए गए डेटा के इस मिश्रण का उपयोग 10 अलग-अलग AI मॉडलों का परीक्षण करने के लिए किया।
उन्होंने क्या पाया? उनके परिणाम थोड़े "क्षमता बनाम वास्तविकता" की कहानी जैसे हैं। शोधकर्ताओं ने पाया कि वर्तमान AI मॉडल वास्तव में काम में मदद करने के लिए काफी अच्छे हैं। वास्तव में, उनके सिमुलेशन बताते हैं कि 47% अमेरिकी व्यवसायों के लिए, AI श्रमिकों के दैनिक कार्यों के कम से कम आधे हिस्से पर उनका काफी समय बचा सकता है। यह कार्यबल का एक बहुत बड़ा हिस्सा है!
हालाँकि, यहाँ एक मोड़ है: सिर्फ इसलिए कि AI वह काम कर सकता है, इसका मतलब यह नहीं है कि लोग उस काम को करने के लिए इसका उपयोग कर रहे हैं। टीम ने पाया कि उन 79% कार्यों के लिए जहाँ AI सैद्धांतिक रूप से बहुत समय बचा सकता है, लोग वास्तव में क्लॉड (Claude) जैसे उपकरणों का बहुत अधिक उपयोग नहीं कर रहे हैं। यह आपके गैरेज में एक फेरारी रखने जैसा है जो 200 मील प्रति घंटे की रफ्तार से चल सकती है, लेकिन आप इसे केवल मेलबॉक्स तक जाने के लिए चला रहे हैं क्योंकि आप गति से डरते हैं या आपको गियर बदलना नहीं आता।
तो, हमें AI का अधिक उपयोग करने से क्या रोक रहा है? शोधकर्ताओं ने एक विशेष सिमुलेशन चलाया जहाँ उन्होंने ठीक से विश्लेषण किया कि AI कुछ कार्यों में समय क्यों नहीं बचा पा रहा है। उन्होंने पाया कि सबसे बड़ी बाधा यह नहीं है कि AI बहुत मंद है; बल्कि यह है कि वास्तविक दुनिया बहुत जटिल है। वे मुख्य कारण जिनसे AI अभी मदद नहीं कर पा रहा है, उनमें शामिल हैं:
- शारीरिक क्रियाएं: AI हथौड़ा नहीं उठा सकता या लीक होता पाइप ठीक नहीं कर सकता।
- गोपनीयता (Privacy): आप AI को अपने निजी मेडिकल रिकॉर्ड या कानूनी फाइलें नहीं पढ़ने दे सकते।
- मालिकाना सिस्टम (Proprietary systems): कई कंपनियाँ पुराने, गुप्त सॉफ़्टवेयर का उपयोग करती हैं जिनसे AI कनेक्ट नहीं हो सकता।
- लाइव इंटरेक्शन: AI वास्तविक समय की, आमने-सामने की बातचीत में संघर्ष करता है जहाँ चीजें तुरंत बदल जाती हैं।
शोध पत्र ने उनके नए, विस्तृत तरीके की तुलना मापने के पुराने तरीकों से भी की। पुराने तरीके सुपरपावर्स की एक सूची देखने जैसे थे और यह कहने जैसे थे, "यह AI सब कुछ कर सकता है!" नया तरीका वास्तव में AI को काम करने की कोशिश करते हुए देखने और यह देखने जैसा है कि वह कहाँ लड़खड़ाता है। उन्होंने पाया कि पुराने तरीके बहुत अधिक आशावादी थे, जो भविष्यवाणी करते थे कि AI 68% नौकरियों में मदद कर सकता है, जबकि उनका अधिक यथार्थवादी सिमुलेशन बताता है कि यह 47% के करीब है।
संक्षेप में, यह पेपर हमें बताता है कि AI एक शक्तिशाली उपकरण है जो हमारे बहुत से काम में मदद करने के लिए तैयार है, लेकिन हम इसका उपयोग अभी नहीं कर रहे हैं क्योंकि गोपनीयता नियमों और शारीरिक हाथों की आवश्यकता जैसी वास्तविक दुनिया की बाधाएं हैं। शोधकर्ताओं ने एक मानचित्र और एक मापने वाला पैमाना बनाया है जिसे AI के स्मार्ट होने पर अपडेट किया जा सकता है, जिससे हमें यह समझने में मदद मिलती है कि यह तकनीक वास्तव में कहाँ पहुंचेगी, न कि केवल अनुमान लगाने में। वे यह नहीं कह रहे हैं कि AI ने अर्थव्यवस्था को हल कर दिया है, लेकिन उन्होंने हमें यह समझने के लिए एक स्पष्ट तस्वीर दी है कि बाधाएं कहाँ हैं और खुले रास्ते कहाँ हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।