← नवीनतम पेपर
💬 NLP

ICE-ID: A Novel Historical Census Dataset for Longitudinal Identity Resolution

यह शोध पत्र ICE-ID प्रस्तुत करता है, जो 220 वर्षों के आइसलैंडिक जनगणना डेटा से लगभग दस लाख रिकॉर्ड का एक नवीन बेंचमार्क डेटासेट है, जिसे पैट्रोनिमिक नेमिंग (पितृनाम पद्धति) और टेम्पोरल ड्रिफ्ट (सामयिक विचलन) जैसी अनुदैर्ध्य पहचान समाधान (लॉन्जिट्यूडिनल आइडेंटिटी रेजोल्यूशन) की अनूठी चुनौतियों को संबोधित करने के लिए डिज़ाइन किया गया है, साथ ही यह व्यापक विश्लेषण आर्टिफैक्ट्स और एक परिनियोजन-सत्य मूल्यांकन प्रोटोकॉल भी प्रदान करता है।

मूल लेखक: Gonçalo Hora de Carvalho, Lazar S. Popov, Sander Kaatee, Mário S. Correia, Kristinn R. Thórisson, Tangrui Li, Pétur Húni Björnsson, Eiríkur Smári Sigurðarson, Jilles S. Dibangoye

प्रकाशित 2026-02-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gonçalo Hora de Carvalho, Lazar S. Popov, Sander Kaatee, Mário S. Correia, Kristinn R. Thórisson, Tangrui Li, Pétur Húni Björnsson, Eiríkur Smári Sigurðarson, Jilles S. Dibangoye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, सदियों पुराने पहेली को सुलझाने की कोशिश कर रहे हैं जहाँ पहेली के टुकड़े इंसान हैं, लेकिन तस्वीर बार-बार बदलती रहती है। टुकड़ों पर लिखे नाम गलत लिखे जाते हैं, उन देशों की सीमाएं बदल जाती हैं जहाँ वे रहते हैं, और कभी-कभी तो टुकड़े पूरी तरह से गायब ही हो जाते हैं।

यह वह चुनौती है जिसका सामना शोधकर्ता पुराने जनगणना रिकॉर्ड का उपयोग करके इतिहास के माध्यम से व्यक्तियों को ट्रैक करने की कोशिश करते समय करते हैं। इसे हल करने में मदद करने के लिए, आइसलैंड और अन्य जगहों के वैज्ञानिकों की एक टीम ने कंप्यूटरों के लिए एक नया, विशाल "प्रशिक्षण मैदान" बनाया है जिसे ICE-ID कहा जाता है।

यहाँ इस शोध पत्र का एक सरल विवरण दिया गया है, जिसमें कुछ रोजमर्रा के उपमाओं का उपयोग किया गया है।

1. समस्या: मशीन में "भूत" (The Ghost in the Machine)

कल्पना कीजिए कि आप 200 साल पुराने दस्तावेजों के ढेर में अपने परदादा को खोजने की कोशिश कर रहे हैं।

  • नाम का खेल: आइसलैंड में, उपनाम (last names) स्थिर नहीं होते हैं; वे पिता के नाम पर आधारित होते हैं (जैसे, "जॉन का पुत्र" बन जाता है Jónsson)। इसका मतलब है कि हजारों लोग "जॉन जोन्सन" (Jón Jónsson) जैसे हो सकते हैं। यह एक ऐसे शहर में किसी विशिष्ट "जॉन स्मिथ" को खोजने जैसा है जहाँ हर कोई "जॉन स्मिथ" नाम का है।
  • बदलता लक्ष्य: लोग पलायन करते हैं, शादी करते हैं, बच्चे पैदा करते हैं और मृत्यु को प्राप्त होते हैं। कस्बों और काउंटियों की सीमाएं भी समय के साथ बदल जाती हैं। एक व्यक्ति 1800 में "फार्म ए" में और 1850 में "फार्म बी" में रह सकता है, भले ही वह एक ही परिवार हो।
  • गायब टुकड़े: पुराने रिकॉर्ड अव्यवस्थित होते हैं। कभी-कभी जन्म का वर्ष गायब होता है, या पिता का नाम खाली होता है।

रिकॉर्ड मिलाने के लिए उपयोग किए जाने वाले अधिकांश कंप्यूटर प्रोग्राम (जैसे अमेज़न पर डुप्लिकेट उत्पादों को खोजना) साफ और स्थिर डेटा पर प्रशिक्षित होते हैं। वे इस अव्यवस्थित, बदलते और ऐतिहासिक यथार्थ का सामना करने में बुरी तरह विफल हो जाते हैं।

2. समाधान: "समय यात्रा करने वाला जासूस" डेटासेट

लेखकों ने ICE-ID बनाया है, जिसमें 16 अलग-अलग जनगणना लहरों से लगभग 10 लाख रिकॉर्ड शामिल हैं, जो 1703 से 1920 तक के आइसलैंड के इतिहास को दर्शाते हैं।

इस डेटासेट को AI जासूसों के लिए एक जिम के रूप में सोचें।

  • वर्कआउट: केवल "जूता A" को "जूता B" से मिलाने के बजाय, AI को "जॉन जोन्सन, आयु 30, वर्ष 1820 में फार्म X में रहने वाला" को "जॉन जोन्सन, आयु 55, वर्ष 1845 में फार्म Y में रहने वाला" से मिलाना होगा।
  • चीट शीट: शोधकर्ताओं ने केवल कच्चा डेटा नहीं डाला; उन्होंने इसे तैयार करने में वर्षों बिताए। उन्होंने एक "गोल्ड स्टैंडर्ड" सूची बनाई कि कौन वास्तव में कौन है। वे निश्चित रूप से जानते हैं कि रिकॉर्ड A और रिकॉर्ड B एक ही वास्तविक व्यक्ति के हैं। यह उन्हें यह परीक्षण करने की अनुमति देता है कि क्या AI वास्तव़ में सीख रहा है या केवल अनुमान लगा रहा है।

3. यह अलग क्यों है (विशेष सॉस/Special Sauce)

AI के परीक्षण के लिए मौजूदा अधिकांश डेटासेट स्थिर स्नैपशॉट की तरह हैं। वे किराने की दुकान की एक फोटो की तरह हैं। वे आसान हैं क्योंकि उत्पाद हिलते नहीं हैं और नाम बदलते नहीं हैं।

ICE-ID अलग है क्योंकि:

  • यह एक फोटो नहीं, बल्कि एक फिल्म है: यह 220 वर्षों तक लोगों को ट्रैक करता है। AI को "टाइम ड्रिफ्ट" (समय के साथ बदलाव) का सामना करना पड़ता है—कैसे एक व्यक्ति का नाम, पता और परिवार दशकों में बदल जाता है।
  • यह एक सूची नहीं, बल्कि एक वंशावली है: इसमें बिखरे हुए पारिवारिक संबंध शामिल हैं (पिता कौन है? जीवनसाथी कौन है?)। यह एक जासूस को केस सुलझाने में मदद करने के लिए वंशावली के बारे में कुछ सुराग देने जैसा है, भले ही कई सुराग गायब हों।
  • यह पदानुक्रमित (Hierarchical) है: यह भूगोल को एक रूसी नेस्टिंग डॉल की तरह समझता है: फार्म → पैरिश → जिला → काउंटी। यदि किसी शहर का नाम बदल जाता है, तो AI को यह समझने की आवश्यकता है कि वह "फार्म" अभी भी वही स्थान है, बस एक नए लेबल के तहत।

4. चुनौती: "नाम का टकराव" (Name Collision)

शोध पत्र एक मजेदार लेकिन कठिन समस्या को उजागर करता है: नाम का टकराव
नामकरण की परंपरा के कारण, डेटासेट में सबसे आम नाम, "जॉन जोन्सन" (Jón Jónsson), 15,599 बार दिखाई देता है।

  • उपमा: एक हाई स्कूल की कल्पना करें जहाँ 15,000 छात्र सभी "जॉन" नाम के हैं। यदि आप ईयरबुक में "जॉन" को खोजने की कोशिश करते हैं, तो आपको केवल नाम की नहीं, बल्कि उसके जन्म वर्ष, उसके माता-पिता के नाम और उसके रहने की जगह की आवश्यकता होगी। ICE-ID AI को यह सीखने के लिए मजबूर करता है कि "जॉन्स" के बीच अंतर करने के लिए उन अतिरिक्त सुरागों का उपयोग कैसे किया जाए।

5. लक्ष्य: AI को इतिहासकार बनाना

इस डेटासेट को जारी करने का अंतिम लक्ष्य बेहतर AI उपकरण बनाना है जो:

  • सामाजिक गतिशीलता (Social Mobility) को ट्रैक कर सकें: देख सकें कि कैसे परिवार पीढ़ियों में गरीब खेतों से शहरों की ओर बढ़े।
  • बीमारी का अध्ययन कर सकें: समझ सकें कि महामारियाँ विशिष्ट परिवारों या क्षेत्रों के माध्यम से समय के साथ कैसे फैलीं।
  • इतिहास को ठीक कर सकें: टूटे हुए रिकॉर्ड को स्वचालित रूप से जोड़ सकें ताकि इतिहासकार बिना 100 घंटे लाइब्रेरी में बिताए, अपने पूर्वज की पूरी जीवन कहानी देख सकें।

सारांश

संक्षेप में, ICE-ID आइसलैंड के इतिहास का एक विशाल, ओपन-सोर्स लाइब्रेरी है जिसे कंप्यूटर को ऐतिहासिक जासूस बनने के सिखाने के लिए डिज़ाइन किया गया है। यह केवल "मिलान" करने से आगे बढ़कर AI को यह सिखाता है कि सदियों से मानव जीवन की अव्यवस्थित, परिवर्तनशील और भ्रमित करने वाली वास्तविकता को कैसे संभाला जाए। इस डेटा को जारी करके, लेखक आधुनिक तकनीक का उपयोग करके हमारे अतीत को समझने के नए तरीके खोलने की उम्मीद करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →