← नवीनतम पेपर
💻 computer science

Doctoral Theses in France (1985-2025): A Linked Dataset of PhDs, Academic Networks, and Institutions

यह शोध पत्र 1985 से 2025 तक के फ्रांसीसी डॉक्टरेट थीसिसों का एक व्यापक, लिंक्ड डेटासेट प्रस्तुत करता है, जिसे शैक्षणिक करियर, नेटवर्क और संस्थागत विकास के विस्तृत विश्लेषण को सक्षम करने के लिए राष्ट्रीय मेटाडेटा को संकलित और समृद्ध करके निर्मित किया गया है।

मूल लेखक: William Aboucaya, Dastan Jasim

प्रकाशित 2026-04-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: William Aboucaya, Dastan Jasim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि फ्रांस में एक विशाल, धूल भरी लाइब्रेरी है जिसमें 1985 से वहां बचाव की गई हर एक पीएचडी थीसिस (PhD thesis) की कहानियाँ रखी हैं। दशकों तक, ये कहानियाँ अलग-अलग अलमारियों में बिखरी हुई थीं, अलग-अलग लिखावट में लिखी गई थीं, और कभी-कभी इनमें महत्वपूर्ण पन्ने गायब थे जैसे कि "निर्णायक मंडल (judging panel) में कौन था" या "प्रोफेसर का जन्म का वर्ष क्या था।"

यह शोध पत्र उन पुस्तकालयाध्यक्षों (लेखकों) की कहानी है जिन्होंने यह निर्णय लिया कि वे इस लाइब्रेरी को साफ करेंगे, इसे व्यवस्थित करेंगे, और इसे एक सुपर-पावर्ड, खोजने योग्य डिजिटल मानचित्र में बदल देंगे।

यहाँ उन्होंने क्या किया, इसका विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: एक बिखरा हुआ अटारी (Messy Attic)

इस परियोजना से पहले, यदि आप अध्ययन करना चाहते थे कि फ्रांस में पीएचडी कैसे काम करती है, तो आपको एक अराजक अटारी में खुदाई करनी पड़ती। आपको एक थीसिस शीर्षक मिल सकता था, लेकिन निर्णायकों (ज्यूरी/jury) की सूची गायब हो सकती थी, या प्रोफेसरों के नाम अलग-अलग रिकॉर्ड में अलग-अलग तरह से लिखे हो सकते थे। यह एक पहेली को हल करने जैसा था जहाँ आधे टुकड़े किसी दूसरे बॉक्स के थे।

2. समाधान: "मास्टर की" (Master Key) सिस्टम

लेखकों ने एक नया डेटासेट बनाया है जिसमें उन्होंने पीएचडी की आधिकारिक फ्रांसीसी सरकारी सूची (जिसे Thèses.fr कहा जाता है) को एक नया रूप दिया है। इस प्रक्रिया को आप तीन मुख्य चरणों के रूप में देख सकते हैं:

  • चरण 1: जासूसी कार्य (सफाई): उन्होंने पाया कि नाम उलझे हुए थे (जैसे "पहला अंतिम" बनाम "अंतिम पहला") और उन्होंने उन्हें ठीक किया। उन्हें "भूतिया" आईडी (ghost IDs) भी मिलीं—ऐसे नंबर जो किसी व्यक्ति से जुड़ने के लिए होने चाहिए थे लेकिन वास्तव में मौजूद नहीं थे। उन्होंने इन 168 टूटे हुए लिंक को मैन्युअल रूप से ठीक किया ताकि सब कुछ सही ढंग से जुड़ सके।
  • चरण 2: क्रिस्टल बॉल (अनुमान लगाना): मूल सूची में हमेशा यह नहीं बताया गया था कि कोई प्रोफेसर पुरुष है या महिला। इसलिए, लेखकों ने एक स्मार्ट कंप्यूटर टूल (एक बहुत ही उन्नत नाम-अनुमान लगाने वाले ऐप की तरह) का उपयोग किया ताकि नामों के आधार पर लिंग (gender) का अनुमान लगाया जा सके। इसने एक बड़ा अंतर भर दिया, जिससे हजारों "अज्ञात" डेटा बिंदु "ज्ञात" डेटा बिंदुओं में बदल गए।
  • चरण 3: सुपर-कनेक्टर (जोड़ना): वे केवल थीसिस की सूची तक ही नहीं रुके। उन्होंने अन्य विशाल फ्रांसीसी डेटाबेस (जैसे IdRef, TEL, और SUDOC) से "आईडी कार्ड" भी जुटाए।
    • उपमा: कल्पना कीजिए कि आपके पास किसी व्यक्ति का फोन नंबर है। इस परियोजना ने उस फोन नंबर में उनका घर का पता, उनकी जन्म तिथि और उनका सोशल सिक्योरिटी नंबर भी जोड़ दिया। अब, आप केवल उनका नाम ही नहीं, बल्कि उनके पूरे जीवन की कहानी तुरंत देख सकते हैं।

3. बॉक्स के अंदर क्या है?

अंतिम परिणाम एक विशाल स्प्रेडशीट (डेटासेट) है जो फ्रांसीसी शैक्षणिक इतिहास के 40 वर्षों को कवर करती है। यह छह मुख्य "फ़ोल्डरों" में व्यवस्थित है:

  1. थीसिस: शीर्षक, तारीख और विषय (जैसे "चिकित्सा" या "इतिहास")।
  2. छात्र: थीसिस किसने बचाव की?
  3. बॉस (पर्यवेक्षक): छात्र का मार्गदर्शन किसने किया?
  4. निर्णायक (Judges): पैनल में बैठकर "पास" या "फेल" किसने कहा?
  5. स्कूल (संस्थान): कौन से विश्वविद्यालय और अनुसंधान प्रयोगशालाएं शामिल थीं?
  6. सामग्री: कई विभिन्न भाषाओं में सारांश (abstract) और कीवर्ड।

4. यह क्यों मायने रखता है? ("आहा!" क्षण)

यह केवल नामों की सूची नहीं है; यह अध्ययन करने के लिए एक टाइम मशीन है कि विज्ञान और शिक्षा कैसे काम करती है।

  • "कौन किसे जानता है" नेटवर्क का मानचित्रण: क्योंकि डेटासेट में प्रत्येक निर्णायक और प्रत्येक पर्यवेक्षक सूचीबद्ध है, शोधकर्ता एक विशाल मानचित्र बना सकते हैं कि कौन किसे जानता है। वे देख सकते हैं कि क्या कुछ प्रोफेसर हमेशा मिलकर काम करते हैं, या क्या कोई विशिष्ट विश्वविद्यालय एक "हब" है जो सभी से जुड़ा हुआ है।
    • उपमा: यह एक टीवी शो के पूरे कलाकारों का मानचित्र बनाने जैसा है ताकि यह देखा जा सके कि कौन किसका दोस्त है, और "कूल किड्स" (केंद्रीय शोधकर्ता) नए छात्रों से कैसे जुड़े हुए हैं।
  • समय को ट्रैक करना: आप देख सकते हैं कि 40 वर्षों में चीजें कैसे बदलीं। उदाहरण के लिए, शोध पत्र नोट करता है कि अतीत में, थीसिस ज्यूरी छोटी होती थी। अब, वे बहुत बड़ी हैं। यह डेटासेट ठोस आंकड़ों के साथ इस बदलाव को साबित करता है।
  • इतिहास का "लुप्त हिस्सा": लेखक बताते हैं कि 2006 से पहले, फ्रांसीसी विश्वविद्यालयों में औपचारिक "डॉक्टोरल स्कूल" नहीं थे। इसलिए, यदि आप 1990 का डेटा देखते हैं, तो आपको स्कूल के नाम नहीं दिखेंगे। यह डेटा में गलती नहीं है; यह एक ऐतिहासिक तथ्य है जिसे यह डेटासेट पूरी तरह से संरक्षित करता है।

5. बड़ी तस्वीर

लेखकों ने इस डेटा को किसी के भी उपयोग के लिए मुफ्त बनाया है। वे चाहते हैं कि समाजशास्त्री, इतिहासकार और डेटा वैज्ञानिक बड़े सवालों के जवाब देने के लिए इसका उपयोग करें जैसे कि:

  • "क्या समय के साथ पीएचडी निर्णायकों के पैनलों में महिलाओं की संख्या बढ़ रही है?"
  • "अनुसंधान दल विभिन्न देशों में कैसे बनते हैं?"
  • "विज्ञान की भाषा कैसे बदली है?"

संक्षेप में: यह शोध पत्र फ्रांसीसी पीएचडी के एक बिखरे हुए, खंडित इतिहास को लेता है, उसे पॉलिश करता है, सभी बिंदुओं को जोड़ता है, और आपको एक चमकदार, इंटरैक्टिव मानचित्र सौंपता है ताकि आप ज्ञान कैसे बनाया जाता है और साझा किया जाता है, इसके छिपे हुए पैटर्न को खोज सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →