CitiLink-Minutes: A Multilayer Annotated Dataset of Municipal Meeting Minutes
यह शोध पत्र CitiLink-Minutes प्रस्तुत करता है, जो 120 यूरोपीय पुर्तगाली नगर पालिका बैठक के विवरणों से एक मिलियन से अधिक टोकन वाला एक बहुस्तरीय एनोटेटेड डेटासेट है, जिसमें स्थानीय शासन के लिए प्राकृतिक भाषा प्रसंस्करण और सूचना पुनर्प्राप्ति में अनुसंधान को आगे बढ़ाने के लिए संरचित मेटाडेटा, चर्चा के विषय और मतदान के परिणाम शामिल हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक नगर परिषद की बैठक की कल्पना एक विशाल, अराजक पुस्तकालय के रूप में करें जहाँ हर साल सैकड़ों पुस्तकें लिखी जाती हैं। ये पुस्तकें बैठक का विवरण (meeting minutes) हैं—वे आधिकारिक रिकॉर्ड कि राजनेताओं ने क्या चर्चा की, उन्होंने कौन से कानून पारित किए, और किसने किस बात पर वोट दिया।
लंबे समय तक, ये पुस्तकें एक अंधेरे कमरे में बंद थीं। इन्हें एक भ्रमित करने वाली शैली में लिखा गया था, जो कानूनी शब्दावली से भरी थी, और इन्हें कभी व्यवस्थित नहीं किया गया था। कंप्यूटर प्रोग्राम (AI) इन्हें पढ़ने और हमारे शहरों के काम करने के तरीके को समझने में मदद करना चाहते थे, लेकिन वे ऐसा नहीं कर सके क्योंकि ये पुस्तकें बहुत अव्यवस्थित थीं और उनमें कोई "इंडेक्स" या "विषय-सूची" नहीं थी जो उनका मार्गदर्शन कर सके।
यह शोध पत्र CitiLink-Minutes का परिचय देता है, जो इन नगर परिषद की पुस्तकों के लिए एक सुपर-व्यवस्थित लाइब्रेरियन (पुस्तकालयाध्यक्ष) के रूप में कार्य करता है। यहाँ इसका सरल विवरण दिया गया है:
1. समस्या: टेक्स्ट की एक दीवार
नगर परिषद के विवरण को स्टिकी नोट्स के एक विशाल, बिना क्रम वाले ढेर के रूप में सोचें।
- समस्या: यदि आप जानना चाहते हैं, "क्या नगर परिषद ने उत्तर जिले में गड्ढे ठीक करने के लिए वोट दिया था?" तो आपको उस एक वाक्य को खोजने के लिए हजारों पृष्ठों को पढ़ना होगा।
- अंतराल (Gap): जबकि शोधकर्ताओं ने भाषणों (जैसे टीवी बहसों के ट्रांसक्रिप्ट) का विश्लेषण करने के लिए बेहतरीन उपकरण बनाए हैं, उनके पास लिखित नगर रिकॉर्ड के लिए अच्छे उपकरण नहीं थे। उनके पास अपने AI को प्रशिक्षित करने के लिए एक स्वच्छ, लेबल किया गया डेटासेट नहीं था।
2. समाधान: "CitiLink" सुपर-इंडेक्स
शोधकर्ताओं ने CitiLink-Minutes नामक एक नया डेटासेट बनाया। कल्पना कीजिए कि उन्होंने इन अस्त-व्यस्त "स्टिकी नोट" पुस्तकों में से छह अलग-अलग पुर्तगाली शहरों की 120 पुस्तकें लीं और उन्हें पूरी तरह से नया रूप दिया।
उन्होंने केवल पृष्ठों को स्कैन नहीं किया; उन्होंने हर एक वाक्य में चार स्तरों की "हाइलाइटिंग" (एनोटेशन) जोड़ी, जो एक कलर-कोडेड स्टडी गाइड की तरह है:
- लेयर 1: "कौन" (व्यक्तिगत जानकारी): उन्होंने प्रत्येक नाम और भूमिका (जैसे "मेयर" या "काउंसलर") को खोजा और फिर वास्तविक नामों को मिटा दिया (उन्हें "व्यक्ति A" या "काउंसलर B" से बदल दिया)। यह फोटो में चेहरों को धुंधला करने जैसा है ताकि AI बिना गोपनीयता का उल्लंघन किए बैठक की संरचना को सीख सके।
- लेयर 2: "कब और कहाँ" (मेटाडेटा): उन्होंने तारीख, समय, स्थान और बैठक के प्रकार को टैग किया। यह हर पुस्तक पर एक सटीक लाइब्रेरी कार्ड लगाने जैसा है।
- लेयर 3: "क्या" (विषय): उन्होंने मुख्य विषयों की पहचान की। क्या बैठक "बजट" के बारे में थी? "सड़कें"? "स्कूल"? उन्होंने हर विषय को लेबल किया ताकि आप विषय के आधार पर खोज सकें।
- लेयर 4: "परिणाम" (मतदान): यह सबसे रोमांचक हिस्सा है। उन्होंने ट्रैक किया कि किसने "हाँ" में, किसने "ना" में वोट दिया, कौन अनुपस्थित रहा, और अंतिम निर्णय क्या था। यह टेक्स्ट के एक पैराग्राफ को एक स्पष्ट स्कोरबोर्ड में बदल देता है।
3. मानवीय स्पर्श
आप सोच सकते हैं कि यह काम कंप्यूटर ने किया, लेकिन ऐसा नहीं है। शोधकर्ताओं ने इन पृष्ठों को पढ़ने और इन टैग्स को हाथ से लागू करने के लिए भाषाविदों (विशेषज्ञ संपादकों की तरह) की एक टीम को काम पर रखा।
- क्यों? क्योंकि कंप्यूटर अव्यवस्थित मानवीय भाषा से भ्रमित हो जाते हैं। एक इंसान मजाक और एक गंभीर वोट के बीच अंतर कर सकता है; एक कंप्यूटर अक्सर ऐसा नहीं कर पाता।
- परिणाम: उन्होंने एक "गोल्ड स्टैंडर्ड" डेटासेट बनाया। यह एक अभ्यास परीक्षा की तरह है जिसमें उत्तर कुंजी भी शामिल है, ताकि अन्य शोधकर्ता अपने AI को यही काम करने के लिए प्रशिक्षित कर सकें।
4. AI का परीक्षण (बेसलाइन्स)
इस डेटासेट की प्रभावशीलता सिद्ध करने के लिए, शोधकर्ताओं ने दो प्रकार के AI को ये विवरण पढ़ने के लिए प्रशिक्षित किया:
- "रीडर" (एन्कोडर): एक मॉडल जो टेक्स्ट पढ़ता है और तथ्यों को निकालता है।
- "राइटर" (जेनेरेटिव): एक मॉडल जो सारांश बनाने या प्रश्नों के उत्तर देने का प्रयास करता है।
परिणाम: "रीडर" मॉडल (विशेष रूप से पुर्तगाली पर प्रशिक्षित एक मॉडल) ने शानदार काम किया। यह उच्च सटीकता के साथ मतदान के परिणाम और विषयों को खोज सका। "राइटर" मॉडल ठीक-ठाक था लेकिन उसने अधिक गलतियाँ कीं। यह हमें बताता है कि इस विशिष्ट कार्य के लिए, एक बातूनी, सारांश बनाने वाले मॉडल की तुलना में एक सावधानीपूर्वक, तथ्य खोजने वाला AI बेहतर है।
5. यह क्यों मायने रखता है?
CitiLink-Minutes को नगर परिषद के "ब्लैक बॉक्स" के दरवाजे खोलने के रूप में देखें।
- पत्रकारों के लिए: वे तुरंत पता लगा सकते हैं कि किसी विशिष्ट मुद्दे पर किसी विशिष्ट राजनेता ने कैसे वोट दिया।
- नागरिकों के लिए: वे बिना 50 पन्नों का कानूनी टेक्स्ट पढ़े देख सकते हैं कि उनका स्थानीय सरकार वास्तव में क्या कर रही है।
- शोधकर्ताओं के लिए: उनके पास लोकतंत्र को समझने के लिए बेहतर उपकरण बनाने के लिए अंततः एक स्वच्छ, सुरक्षित और व्यवस्थित खेल का मैदान है।
कमी (सीमाएँ)
पेपर स्वीकार करता है कि डेटासेट अभी भी पूर्ण नहीं है:
- यह केवल छह शहरों को कवर करता है। यह केवल छह कस्बों के मानचित्र होने जैसा है; यह अलग नियमों वाले दूसरे देश के शहर के लिए पूरी तरह से काम नहीं कर सकता है।
- कुछ मतदान विवरण अभी भी थोड़े अस्पष्ट हैं (उदाहरण के लिए, हमें पता है कि एक "पार्टी" ने वोट दिया, लेकिन हमेशा हर एक व्यक्ति का पता नहीं चलता)।
- नाम वर्तमान में केवल "व्यक्ति A" हैं, लेकिन भविष्य के संस्करणों में पहचान छिपाने के अधिक स्मार्ट तरीकों का उपयोग किया जा सकता है जो डेटा को उपयोगी बनाए रखें।
संक्षेप में
यह शोध पत्र उबाऊ, अव्यवस्थित और कठिन से पढ़ने वाले नगर बैठकों के रिकॉर्ड को एक स्वच्छ, खोजने योग्य और गोपनीयता-सुरक्षित डेटाबेस में बदलने के बारे में है। यह पहली बार है जब यह काम इतने गहन रूप से किया गया है, जिससे AI को अंततः यह समझने में मदद करने का मौका मिला है कि हमारे स्थानीय सरकार वास्तव में कैसे काम करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।