← नवीनतम पेपर
💬 NLP

CitiLink-Summ: Summarization of Discussion Subjects in European Portuguese Municipal Meeting Minutes

यह शोध पत्र CitiLink-Summ को प्रस्तुत करता है, जो इस डोमेन में स्वचालित सारांश (automatic summarization) के लिए डेटा की कमी को दूर करने और अत्याधुनिक जनरेटिव मॉडल्स एवं लार्ज लैंग्वेज मॉडल्स के लिए बेसलाइन प्रदर्शन स्थापित करने हेतु 2,322 हस्तनिर्मित सारांशों के साथ यूरोपीय पुर्तगाली नगर पालिका बैठक के कार्यवृत्त (municipal meeting minutes) का पहला कॉर्पस है।

मूल लेखक: Miguel Marques, Ana Luísa Fernandes, Ana Filipa Pacheco, Rute Rebouças, Inês Cantante, José Isidro, Luís Filipe Cunha, Alípio Jorge, Nuno Guimarães, Sérgio Nunes, António Leal, Purificação Silvano, Ri
प्रकाशित 2026-02-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Miguel Marques, Ana Luísa Fernandes, Ana Filipa Pacheco, Rute Rebouças, Inês Cantante, José Isidro, Luís Filipe Cunha, Alípio Jorge, Nuno Guimarães, Sérgio Nunes, António Leal, Purificação Silvano, Ricardo Campos

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नगर परिषद (सिटी काउंसिल) की बैठक में जाते हैं। कमरा खचाखच भरा है, हवा औपचारिक भाषा से भारी है, और अधिकारी दर्जनों अलग-अलग विषयों पर चर्चा कर रहे हैं: गड्ढे ठीक करना, एक नया पार्क स्वीकृत करना, बजट पर बहस करना। जब तक बैठक समाप्त होती है, आधिकारिक रिकॉर्ड (जिसे "मिनट्स" कहा जाता है) एक विशाल, 50 पन्नों का दस्तावेज़ बन चुका होता है जो सख्त, कानूनी पुर्तगाली भाषा में लिखा गया है।

एक औसत नागरिक के लिए, यह जानने के लिए कि क्या हुआ, उस दस्तावेज़ को पढ़ना ऐसा है जैसे आग लगी हुई घास के ढेर में एक विशिष्ट सुई को ढूँढना। यह बहुत लंबा, बहुत उबाऊ और बहुत भ्रमित करने वाला है।

पेश है "CitiLink-Summ"।

यह शोध पत्र एक नए टूल और कंप्यूटरों के लिए एक नए "ट्रेनिंग जिम" (प्रशिक्षण केंद्र) का परिचय देता है ताकि इस समस्या को हल किया जा सके। यहाँ सरल विवरण दिया गया है कि शोधकर्ताओं ने क्या किया है:

1. समस्या: "टेक्स्ट की दीवार" (The Wall of Text)

नगर पालिका की बैठकों के मिनट्स आवश्यक तो हैं, लेकिन वे पठनीयता के मामले में बहुत खराब हैं। वे सघन, औपचारिक और भारी मात्रा में जानकारी से भरे होते हैं। यदि आप जानना चाहते हैं कि क्या आपका शहर एक नया पुस्तकालय बना रहा है, तो आपको उस एक वाक्य को खोजने के लिए कानूनी शब्दावली के 40 पन्नों को पढ़ने की आवश्यकता नहीं होनी चाहिए।

2. समाधान: AI के लिए एक नया "जिम"

कंप्यूटरों को इन दस्तावेजों का सारांश (summarize) बनाना सिखाने के लिए, आपको एक शिक्षक (एक डेटासेट) की आवश्यकता होती है। लेकिन यूरोपीय पुर्तगाली के लिए, कोई पाठ्यपुस्तक उपलब्ध नहीं थी। यह रेगिस्तान में किसी को तैरना सिखाने की कोशिश करने जैसा था क्योंकि वहाँ कोई पूल नहीं था।

शोधकर्ताओं ने वह पूल बनाया। उन्होंने CitiLink-Summ बनाया, जो एक विशाल डेटासेट है जिसमें शामिल है:

  • छह अलग-अलग पुर्तगाली शहरों के 120 वास्तविक बैठक दस्तावेज़
  • 2,880 मानव-लिखित सारांश

उन्होंने इसे कैसे बनाया?
कल्पना कीजिए कि चार विशेषज्ञ भाषाविदों ( "शिक्षकों") की एक टीम इन दस्तावेजों के साथ बैठी है। उन्होंने केवल वाक्यों को कॉपी-पेस्ट नहीं किया। उन्होंने एक विशिष्ट विषय को पढ़ा, मूल विचार को समझा, और फिर उसे अपने शब्दों में एक छोटे, स्पष्ट सारांश के रूप में फिर से लिखा

  • उपमा: यदि मूल टेक्स्ट एक 20 मिनट का लंबा भाषण था, तो सारांश एक संक्षिप्त 30 सेकंड की न्यूज़ क्लिप की तरह था।
  • उन्होंने इसे अत्यधिक सावधानी के साथ किया, यह सुनिश्चित करने के लिए बार-बार जाँच की कि सारांश सटीक हो लेकिन साथ ही 'एब्स्ट्रैक्ट' (अमूर्त) भी हो (अर्थात, उन्होंने केवल शब्दों को कॉपी नहीं किया; उन्होंने वास्तव में अर्थ को समझा)।

3. चुनौती: "एब्स्ट्रैक्ट" बनाम "कॉपी-पेस्ट"

शोधकर्ता चाहते थे कि उनके सारांश ऐसे हों जिन्हें कंप्यूटर आसानी से नकल न कर सकें। उन्होंने यह मापा कि सारांश मूल टेक्स्ट के कितने शब्दों का "पुन: उपयोग" करते हैं।

  • कम पुन: उपयोग (उच्च एब्स्ट्रैक्शन/अमूर्तता): कंप्यूटर को सोचना और पुनर्गठित करना पड़ता है।
  • उच्च पुन: उपयोग (कम एब्स्ट्रैक्शन/अमूर्तता): कंप्यूटर केवल कट और पेस्ट करता है।

उन्होंने पाया कि उनके मानव-लिखित सारांश अत्यधिक अमूर्त (highly abstract) थे। यह अच्छी खबर है क्योंकि इसका मतलब है कि यह डेटासेट एक कठिन, उच्च-गुणवत्ता वाला परीक्षण है। यह AI को वास्तव में सारांश बनाना सीखने के लिए मजबूर करता है, न कि केवल एक फोटोकॉपी करने की मशीन बनने के लिए।

4. टेस्ट ड्राइव: AI को काम पर लगाना

एक बार जब उन्होंने डेटासेट बना लिया, तो उन्होंने इसे परखने के लिए रख दिया। उन्होंने उपलब्ध सबसे स्मार्ट AI मॉडल (जैसे BART, PRIMERA, और यहाँ तक कि विशाल Gemini) को लिया और उन्हें दस्तावेज़ों का सारांश बनाने के लिए कहा।

  • परिणाम: AI मॉडल ने ठीक-ठाक काम किया, लेकिन वे अभी भी पूर्ण नहीं थे। सबसे अच्छे मॉडल (जैसे PRIMERA जैसे "बड़े दिमाग") ने उच्चतम स्कोर प्राप्त किए, लेकिन अभी भी सुधार की बहुत गुंजाइश है।
  • निष्कर्ष: यह एक छात्र को गणित का सवाल दिखाने जैसा है। उन्होंने अधिकांश समय सही उत्तर दिया, लेकिन वे अभी भी कुछ मूर्खतापूर्ण गलतियाँ करते हैं। यह डेटासेट शोधकर्ताओं को एक स्पष्ट "उत्तर कुंजी" प्रदान करता है ताकि वे AI को बेहतर बनाने के लिए प्रशिक्षित कर सकें।

5. यह क्यों मायने रखता है?

यह केवल फैंसी कंप्यूटर विज्ञान के बारे में नहीं है; यह लोकतंत्र के बारे में है।

  • नागरिकों के लिए: एक ऐप की कल्पना करें जहाँ आप टाइप कर सकें, "पोर्टो काउंसिल ने नए बस रूट के बारे में क्या निर्णय लिया?" और तुरंत एक स्पष्ट, 2-वाक्य का उत्तर प्राप्त कर सकें।
  • पारदर्शिता के लिए: यह सरकार को एक गुप्त क्लब के बजाय एक खुली बातचीत बनाता है।

मुख्य बात (The Bottom Line)

लेखकों ने पुर्तगाली नगर परिषद की बैठकों का सारांश बनाने के लिए पहला- way "प्रशिक्षण मैनुअल" बनाया है। उन्होंने दिखाया है कि जबकि AI इस काम में अच्छा हो रहा है, इसे अभी भी और अभ्यास की आवश्यकता है। इस डेटा को जनता के लिए जारी करके, वे अन्य वैज्ञानिकों को एक अंतिम "सिटी काउंसिल ट्रांसलेटर" बनाने में मदद करने के लिए आमंत्रित कर रहे हैं जो स्थानीय सरकार को वकीलों और विशेषज्ञों के बजाय सभी के लिए सुलभ बनाएगा।

संक्षेप में: उन्होंने एक उबाऊ, अपठनीय टेक्स्ट की दीवार को कंप्यूटरों के लिए एक स्पष्ट, सिखाने योग्य पाठ में बदल दिया है, जिसका अंतिम लक्ष्य आम लोगों को यह समझने में मदद करना है कि उनका शहर क्या कर रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →