← नवीनतम पेपर
💬 NLP

CitiLink-Minutes: A Multilayer Annotated Dataset of Municipal Meeting Minutes

यह शोध पत्र CitiLink-Minutes प्रस्तुत करता है, जो 120 यूरोपीय पुर्तगाली नगर पालिका बैठक के विवरणों से एक मिलियन से अधिक टोकन वाला एक बहुस्तरीय एनोटेटेड डेटासेट है, जिसमें स्थानीय शासन के लिए प्राकृतिक भाषा प्रसंस्करण और सूचना पुनर्प्राप्ति में अनुसंधान को आगे बढ़ाने के लिए संरचित मेटाडेटा, चर्चा के विषय और मतदान के परिणाम शामिल हैं।

मूल लेखक: Ricardo Campos, Ana Filipa Pacheco, Ana Luísa Fernandes, Inês Cantante, Rute Rebouças, Luís Filipe Cunha, José Miguel Isidro, José Pedro Evans, Miguel Marques, Rodrigo Batista, Evelin Amorim, Alípio J
प्रकाशित 2026-03-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ricardo Campos, Ana Filipa Pacheco, Ana Luísa Fernandes, Inês Cantante, Rute Rebouças, Luís Filipe Cunha, José Miguel Isidro, José Pedro Evans, Miguel Marques, Rodrigo Batista, Evelin Amorim, Alípio Jorge, Nuno Guimarães, Sérgio Nunes, António Leal, Purificação Silvano

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक नगर परिषद की बैठक की कल्पना एक विशाल, अराजक पुस्तकालय के रूप में करें जहाँ हर साल सैकड़ों पुस्तकें लिखी जाती हैं। ये पुस्तकें बैठक का विवरण (meeting minutes) हैं—वे आधिकारिक रिकॉर्ड कि राजनेताओं ने क्या चर्चा की, उन्होंने कौन से कानून पारित किए, और किसने किस बात पर वोट दिया।

लंबे समय तक, ये पुस्तकें एक अंधेरे कमरे में बंद थीं। इन्हें एक भ्रमित करने वाली शैली में लिखा गया था, जो कानूनी शब्दावली से भरी थी, और इन्हें कभी व्यवस्थित नहीं किया गया था। कंप्यूटर प्रोग्राम (AI) इन्हें पढ़ने और हमारे शहरों के काम करने के तरीके को समझने में मदद करना चाहते थे, लेकिन वे ऐसा नहीं कर सके क्योंकि ये पुस्तकें बहुत अव्यवस्थित थीं और उनमें कोई "इंडेक्स" या "विषय-सूची" नहीं थी जो उनका मार्गदर्शन कर सके।

यह शोध पत्र CitiLink-Minutes का परिचय देता है, जो इन नगर परिषद की पुस्तकों के लिए एक सुपर-व्यवस्थित लाइब्रेरियन (पुस्तकालयाध्यक्ष) के रूप में कार्य करता है। यहाँ इसका सरल विवरण दिया गया है:

1. समस्या: टेक्स्ट की एक दीवार

नगर परिषद के विवरण को स्टिकी नोट्स के एक विशाल, बिना क्रम वाले ढेर के रूप में सोचें।

  • समस्या: यदि आप जानना चाहते हैं, "क्या नगर परिषद ने उत्तर जिले में गड्ढे ठीक करने के लिए वोट दिया था?" तो आपको उस एक वाक्य को खोजने के लिए हजारों पृष्ठों को पढ़ना होगा।
  • अंतराल (Gap): जबकि शोधकर्ताओं ने भाषणों (जैसे टीवी बहसों के ट्रांसक्रिप्ट) का विश्लेषण करने के लिए बेहतरीन उपकरण बनाए हैं, उनके पास लिखित नगर रिकॉर्ड के लिए अच्छे उपकरण नहीं थे। उनके पास अपने AI को प्रशिक्षित करने के लिए एक स्वच्छ, लेबल किया गया डेटासेट नहीं था।

2. समाधान: "CitiLink" सुपर-इंडेक्स

शोधकर्ताओं ने CitiLink-Minutes नामक एक नया डेटासेट बनाया। कल्पना कीजिए कि उन्होंने इन अस्त-व्यस्त "स्टिकी नोट" पुस्तकों में से छह अलग-अलग पुर्तगाली शहरों की 120 पुस्तकें लीं और उन्हें पूरी तरह से नया रूप दिया।

उन्होंने केवल पृष्ठों को स्कैन नहीं किया; उन्होंने हर एक वाक्य में चार स्तरों की "हाइलाइटिंग" (एनोटेशन) जोड़ी, जो एक कलर-कोडेड स्टडी गाइड की तरह है:

  • लेयर 1: "कौन" (व्यक्तिगत जानकारी): उन्होंने प्रत्येक नाम और भूमिका (जैसे "मेयर" या "काउंसलर") को खोजा और फिर वास्तविक नामों को मिटा दिया (उन्हें "व्यक्ति A" या "काउंसलर B" से बदल दिया)। यह फोटो में चेहरों को धुंधला करने जैसा है ताकि AI बिना गोपनीयता का उल्लंघन किए बैठक की संरचना को सीख सके।
  • लेयर 2: "कब और कहाँ" (मेटाडेटा): उन्होंने तारीख, समय, स्थान और बैठक के प्रकार को टैग किया। यह हर पुस्तक पर एक सटीक लाइब्रेरी कार्ड लगाने जैसा है।
  • लेयर 3: "क्या" (विषय): उन्होंने मुख्य विषयों की पहचान की। क्या बैठक "बजट" के बारे में थी? "सड़कें"? "स्कूल"? उन्होंने हर विषय को लेबल किया ताकि आप विषय के आधार पर खोज सकें।
  • लेयर 4: "परिणाम" (मतदान): यह सबसे रोमांचक हिस्सा है। उन्होंने ट्रैक किया कि किसने "हाँ" में, किसने "ना" में वोट दिया, कौन अनुपस्थित रहा, और अंतिम निर्णय क्या था। यह टेक्स्ट के एक पैराग्राफ को एक स्पष्ट स्कोरबोर्ड में बदल देता है।

3. मानवीय स्पर्श

आप सोच सकते हैं कि यह काम कंप्यूटर ने किया, लेकिन ऐसा नहीं है। शोधकर्ताओं ने इन पृष्ठों को पढ़ने और इन टैग्स को हाथ से लागू करने के लिए भाषाविदों (विशेषज्ञ संपादकों की तरह) की एक टीम को काम पर रखा।

  • क्यों? क्योंकि कंप्यूटर अव्यवस्थित मानवीय भाषा से भ्रमित हो जाते हैं। एक इंसान मजाक और एक गंभीर वोट के बीच अंतर कर सकता है; एक कंप्यूटर अक्सर ऐसा नहीं कर पाता।
  • परिणाम: उन्होंने एक "गोल्ड स्टैंडर्ड" डेटासेट बनाया। यह एक अभ्यास परीक्षा की तरह है जिसमें उत्तर कुंजी भी शामिल है, ताकि अन्य शोधकर्ता अपने AI को यही काम करने के लिए प्रशिक्षित कर सकें।

4. AI का परीक्षण (बेसलाइन्स)

इस डेटासेट की प्रभावशीलता सिद्ध करने के लिए, शोधकर्ताओं ने दो प्रकार के AI को ये विवरण पढ़ने के लिए प्रशिक्षित किया:

  1. "रीडर" (एन्कोडर): एक मॉडल जो टेक्स्ट पढ़ता है और तथ्यों को निकालता है।
  2. "राइटर" (जेनेरेटिव): एक मॉडल जो सारांश बनाने या प्रश्नों के उत्तर देने का प्रयास करता है।

परिणाम: "रीडर" मॉडल (विशेष रूप से पुर्तगाली पर प्रशिक्षित एक मॉडल) ने शानदार काम किया। यह उच्च सटीकता के साथ मतदान के परिणाम और विषयों को खोज सका। "राइटर" मॉडल ठीक-ठाक था लेकिन उसने अधिक गलतियाँ कीं। यह हमें बताता है कि इस विशिष्ट कार्य के लिए, एक बातूनी, सारांश बनाने वाले मॉडल की तुलना में एक सावधानीपूर्वक, तथ्य खोजने वाला AI बेहतर है।

5. यह क्यों मायने रखता है?

CitiLink-Minutes को नगर परिषद के "ब्लैक बॉक्स" के दरवाजे खोलने के रूप में देखें।

  • पत्रकारों के लिए: वे तुरंत पता लगा सकते हैं कि किसी विशिष्ट मुद्दे पर किसी विशिष्ट राजनेता ने कैसे वोट दिया।
  • नागरिकों के लिए: वे बिना 50 पन्नों का कानूनी टेक्स्ट पढ़े देख सकते हैं कि उनका स्थानीय सरकार वास्तव में क्या कर रही है।
  • शोधकर्ताओं के लिए: उनके पास लोकतंत्र को समझने के लिए बेहतर उपकरण बनाने के लिए अंततः एक स्वच्छ, सुरक्षित और व्यवस्थित खेल का मैदान है।

कमी (सीमाएँ)

पेपर स्वीकार करता है कि डेटासेट अभी भी पूर्ण नहीं है:

  • यह केवल छह शहरों को कवर करता है। यह केवल छह कस्बों के मानचित्र होने जैसा है; यह अलग नियमों वाले दूसरे देश के शहर के लिए पूरी तरह से काम नहीं कर सकता है।
  • कुछ मतदान विवरण अभी भी थोड़े अस्पष्ट हैं (उदाहरण के लिए, हमें पता है कि एक "पार्टी" ने वोट दिया, लेकिन हमेशा हर एक व्यक्ति का पता नहीं चलता)।
  • नाम वर्तमान में केवल "व्यक्ति A" हैं, लेकिन भविष्य के संस्करणों में पहचान छिपाने के अधिक स्मार्ट तरीकों का उपयोग किया जा सकता है जो डेटा को उपयोगी बनाए रखें।

संक्षेप में

यह शोध पत्र उबाऊ, अव्यवस्थित और कठिन से पढ़ने वाले नगर बैठकों के रिकॉर्ड को एक स्वच्छ, खोजने योग्य और गोपनीयता-सुरक्षित डेटाबेस में बदलने के बारे में है। यह पहली बार है जब यह काम इतने गहन रूप से किया गया है, जिससे AI को अंततः यह समझने में मदद करने का मौका मिला है कि हमारे स्थानीय सरकार वास्तव में कैसे काम करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →