How much technical talent is there? A systematic estimate of the ML research pool among 3 million consultants
यह शोध पत्र व्यवस्थित रूप से अनुमान लगाता है कि 403 वैश्विक एमएल (ML) परामर्श फर्मों के भीतर लगभग 1,121 अत्यधिक तकनीकी एमएल अनुसंधान प्रतिभाएं मौजूद हैं—जो MATS पूर्व छात्रों के आकार से दोगुनी है—जबकि यह भी उल्लेख करता है कि 2025 के अंत तक कोई भी प्रतिभागी एक कठोर एआई (AI) सुरक्षा कार्य परीक्षण पास करने में सक्षम नहीं हो सका है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य प्रश्न: "छिपे हुए AI जादूगर कहाँ हैं?"
कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस (AI) सुरक्षा की दुनिया एक बहुत ही सुरक्षित पुल बनाने के लिए एक विशाल निर्माण परियोजना की तरह है। हम ब्लूप्रिंट (गणित और सिद्धांत) तो जानते हैं, लेकिन हम इस वजह से अटके हुए हैं क्योंकि हमारे पास इसे वास्तव में बनाने के लिए पर्याप्त कुशल इंजीनियर नहीं हैं।
बड़ी लैब्स (जैसे OpenAI या Google DeepMind) के पास बेहतरीन इंजीनियर हैं, लेकिन उनकी संख्या बहुत कम है। इस पेपर के लेखकों ने एक सरल प्रश्न पूछा: "क्या सामान्य आईटी कंसल्टिंग कंपनियों में कुशल AI इंजीनियरों की एक छिपी हुई सेना काम कर रही है जिसे हमने अभी तक नोटिस नहीं किया है?"
इन कंसल्टिंग फर्मों को विशाल गोदामों के रूप में सोचें। गोदाम का अधिकांश हिस्सा सामान्य श्रमिकों (जो बुनियादी कोडिंग या डेटा एंट्री करते हैं) से भरा है, लेकिन लेखकों को संदेह था कि पीछे कहीं, कुछ मास्टर शिल्पकार छिपे हो सकते हैं जो सबसे कठिन, उच्च-स्तरीय AI रिसर्च करने में सक्षम हैं।
उन्होंने कैसे खोजा: "डिजिटल डिटेक्टिव" गेम
इन छिपी हुई प्रतिभाओं को खोजने के लिए, शोधकर्ताओं ने केवल दरवाज़े नहीं खटखटाए; उन्होंने एक उच्च-तकनीकी, बहु-चरणीय जासूसी प्रक्रिया का उपयोग किया:
- द नेट: उन्होंने इंटरनेट पर एक विशाल डिजिटल जाल फैलाया, 2,121 कंपनियों को स्कैन किया ताकि उन 403 कंपनियों को खोजा जा सके जो वास्तव में मशीन लर्निंग (ML) का काम करने का दावा करती थीं।
- द रेज़्यूमे स्कैन: उन्होंने लगभग 33 लाख कर्मचारियों की लिंक्डइन प्रोफाइल देखी। कल्पना कीजिए कि 33 लाख रेज़्यूमे को हाथ से पढ़ने की कोशिश करना—इसमें एक जीवन बीत जाएगा! इसके बजाय, उन्होंने "डिजिटल सहायकों" (GPT-4 और Gemini जैसे AI मॉडल) की एक टीम का उपयोग किया जो रेज़्यूमे को पढ़ सके।
- द फ़िल्टर: ये AI सहायक एक क्लब के बाउंसर की तरह काम करते थे। उन्होंने विशिष्ट कीवर्ड्स और वाक्यांशों को देखा जो यह साबित करते थे कि कोई व्यक्ति वास्तव में शून्य से एक जटिल AI बना सकता है, न कि केवल एक बने-बनाए टूल का उपयोग कर रहा है। उन्होंने उन लोगों को फ़िल्टर कर दिया जो केवल AI के बारे में "बात" करते थे और उन्हें रखा जो AI को "कर" सकते थे।
- द मैथ: उन्होंने कीवर्ड सर्च और रेज़्यूमे को पढ़ने वाले AI के परिणामों को एक सांख्यिकीय मॉडल (एक फैंसी तरीका यह कहने का कि उन्होंने विश्वसनीय संख्या प्राप्त करने के लिए अनुमानों का औसत निकाला) का उपयोग करके जोड़ा।
निष्कर्ष: कच्चे रूप में सोने की खान
परिणाम आश्चर्यजनक रूप से उत्साहजनक थे।
- संख्या: उन्होंने अनुमान लगाया कि इन कंसल्टिंग फर्मों के भीतर लगभग 1,100 अत्यधिक कुशल AI शोधकर्ता छिपे हुए हैं।
- वितरण: ये केवल एक बड़ी कंपनी में नहीं हैं। वे सैकड़ों फर्मों में बिखरे हुए हैं, जिनमें से अधिकांश छोटी और मध्यम आकार की हैं।
- घनत्व: विशाल कंसल्टिंग फर्मों (जैसे Accenture या Deloitte) में, "AI जादूगर" बहुत दुर्लभ हैं (कर्मचारियों का 0.1% से भी कम)। लेकिन छोटी, विशिष्ट फर्मों में, प्रतिभा का संकेंद्रण बहुत अधिक है—कभी-कभी टीम का 20% तक!
उपमा: सोने की तलाश करने की कल्पना करें। विशाल शहरों (बड़ी टेक कंपनियों) में सोना हर जगह है, लेकिन यह इतनी मिट्टी के साथ मिला हुआ है कि इसे ढूंढना मुश्किल है। छोटे, शांत कस्बों (विशेषज्ञ कंसल्टेंसी) में, कुल मिलाकर सोना कम है, लेकिन यदि आप जानते हैं कि कहाँ देखना है, तो ज़मीन बहुत समृद्ध है।
"टेस्ट ड्राइव": क्या वे वास्तव में काम करते हैं?
रेज़्यूमे पर नाम मिलना एक बात है; यह साबित करना कि वे काम कर सकते हैं, दूसरी बात है। इसे परखने के लिए, शोधकर्ताओं ने 8 कंपनियों को 3-दिवसीय "वर्क ट्रायल" के लिए आमंत्रित किया।
- कार्य: उन्होंने टीमों को एक बहुत ही कठिन, विशिष्ट कोडिंग चुनौती दी जिसमें एक AI मॉडल से डेटा को "अनलर्न" (unlearn) करना शामिल था (एक जटिल सुरक्षा कार्य)।
- प्रतियोगिता: उन्होंने शीर्ष स्तर के AI कोडिंग बॉट्स (जैसे ChatGPT के उन्नत संस्करण) को भी उसी पहेली को हल करने की कोशिश करने के लिए दिया।
- परिणाम:
- मानव टीमें: 8 में से 5 टीमों ने टेस्ट पास किया! कुछ को तो पूर्णकालिक काम के लिए भी अनुशंसित किया गया। उन्होंने सफलतापूर्वक जटिल कोड बनाया।
- AI बॉट्स: AI बॉट्स विफल रहे। वे कार्य को पूरा नहीं कर सके।
टेकअवे: इसने साबित कर दिया कि वहां वास्तविक, जीवित इंसान मौजूद हैं जो कठिन AI सुरक्षा कार्य कर सकते हैं जिसे हमारे सबसे स्मार्ट वर्तमान AI उपकरण भी अभी तक नहीं कर सकते।
सीमाएं: यह परफेक्ट क्यों नहीं है?
लेखक अपने मानचित्र की खामियों के बारे में ईमानदार हैं:
- रेज़्यूमे का झूठ: कभी-कभी लोग अपने रेज़्यूमे पर झूठ बोलते हैं, या स्मार्ट दिखने के लिए कीवर्ड्स का उपयोग करते हैं। AI को मूर्ख बनाया जा सकता है।
- ब्लाइंड स्पॉट्स: उन्होंने मुख्य रूप से अंग्रेजी बोलने वाली कंपनियों और लिंक्डइन पर मौजूद कंपनियों को देखा। वे अन्य देशों के या उन कंपनियों के प्रतिभाशाली लोगों को मिस कर सकते हैं जो लिंक्डइन का उपयोग नहीं करते हैं।
- "सिंथेटिक" अनुमान: सबसे बड़ी कंपनियों के लिए, वे हर एक रेज़्यूमे नहीं देख सके, इसलिए उन्हें अन्य स्थानों पर देखे गए पैटर्न के आधार पर शिक्षित अनुमान (सिंथेटिक डेटा) लगाने पड़े।
निष्कर्ष: कार्रवाई का आह्वान
पेपर एक स्पष्ट संदेश के साथ समाप्त होता है जो AI सुरक्षा अनुसंधान को वित्तपोषित करने वाले लोगों के लिए है: केवल प्रसिद्ध AI लैब्स को ही देखना बंद करें।
आईटी कंसल्टिंग की दुनिया में एक "लेटेंट कैपेसिटी" (एक सोता हुआ दिग्गज) है। यदि फंडर्स और संगठन इन कंपनियों से भर्ती करना शुरू करते हैं, तो वे AI को सुरक्षित बनाने के लिए आवश्यक कार्यबल का तेजी से विस्तार कर सकते हैं।
संक्षेप में: हमें नियमित कंसल्टिंग फर्मों में काम करने वाले लगभग 1,000 विशेषज्ञ AI इंजीनियरों का एक छिपा हुआ पूल मिला है। वे काम करने के लिए तैयार हैं, उन्होंने एक कठिन परीक्षण पास किया है, और वे एक महत्वपूर्ण संसाधन हैं जिसे हमें AI सुरक्षा की सबसे बड़ी चुनौतियों को हल करने के लिए उपयोग करने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।