← नवीनतम पेपर
💬 NLP

VotIE: Information Extraction from Meeting Minutes

यह शोध पत्र VotIE को प्रस्तुत करता है, जो विषम नगर पालिका बैठक कार्यवृत्त (meeting minutes) में संरचित मतदान घटनाओं की पहचान करने के लिए एक नया सूचना निष्कर्षण कार्य और बेंचमार्क है, जिसमें यह पाया गया है कि जबकि फाइन-ट्यून्ड एनकोडर इन-डोमेन कार्यों के लिए अधिक कुशल हैं, अनदेखे नगर पालिकाओं में सामान्यीकरण करने के संदर्भ में फ्यू-शॉट LLMs बेहतर सुदृढ़ता प्रदर्शित करते हैं।

मूल लेखक: José Pedro Evans, Luís Filipe Cunha, Purificação Silvano, Alípio Jorge, Nuno Guimarães, Sérgio Nunes, Ricardo Campos

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: José Pedro Evans, Luís Filipe Cunha, Purificação Silvano, Alípio Jorge, Nuno Guimarães, Sérgio Nunes, Ricardo Campos

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

"डिजिटल सेक्रेटरी" की समस्या: स्थानीय लोकतंत्र को पठनीय बनाना

कल्पना कीजिए कि आप एक पत्रकार हैं जो यह पता लगाने की कोशिश कर रहे हैं कि आपकी स्थानीय नगर परिषद महत्वपूर्ण मुद्दों पर—जैसे कि एक नया पार्क बनाना या स्कूल के बजट में बदलाव करना—कैसे मतदान कर रही है। आप शहर की वेबसाइट पर जाकर "मिनट्स" (बैठक के आधिकारिक लिखित रिकॉर्ड) पढ़ने जाते हैं।

लेकिन एक समस्या है: ये रिकॉर्ड व्यवस्थित स्प्रेडशीट नहीं हैं। वे लंबी, घुमावदार कहानियाँ हैं। एक शहर लिख सकता है, "परिषद ने बहुमत से पार्क बजट को मंजूरी दी," जबकि दूसरा लिख सकता है, "पार्क के संबंध में, प्रस्ताव पारित हुआ, हालांकि पार्षद स्मिथ ने इससे परहेज किया।"

यदि आप दस वर्षों में सैकड़ों शहरों में इन वोटों को ट्रैक करना चाहते हैं, तो आपको लाखों पन्ने पढ़ने होंगे। यह एक इंसान के लिए असंभव है, और एक मानक कंप्यूटर के लिए भी कठिन है।

यह शोध पत्र "VotIE" पेश करता है, जो कंप्यूटर को एक सुपर-फास्ट, अत्यधिक सटीक डिजिटल सेक्रेटरी की तरह काम करने के लिए सिखाने का एक नया तरीका है, जो इन अव्यवस्थित कहानियों को पढ़ सकता है और उन्हें साफ, व्यवस्थित डेटा में बदल सकता है।


"छात्रों" के दो प्रकार (मॉडल)

शोधकर्ताओं ने यह देखने के लिए कि कौन इस काम को सबसे अच्छी तरह से कर सकता है, दो अलग-अलग प्रकार के "AI छात्रों" का परीक्षण किया। इन्हें दो अलग-अलग प्रकार के सहायकों की तरह समझें:

1. विशेषज्ञ (द फाइन-ट्यून्ड एनकोडर)

एक ऐसे सहायक की कल्पना करें जिसने केवल आपके स्थानीय शहर के नोट्स लिखने के विशिष्ट तरीके को समझने में ही कई साल बिताए हैं।

  • ताकत: वे अविश्वसनीय रूप से सटीक हैं। वे आपको केवल यह नहीं बताते कि क्या हुआ; वे उस वाक्य में सटीक शब्द की ओर इशारा कर सकते हैं जहाँ वोट का उल्लेख किया गया था। वे एक स्केलपेल (शल्य चिकित्सा उपकरण) के साथ काम करने वाले सर्जन की तरह हैं।
  • कमजोरी: वे "संकीर्ण सोच" वाले हैं। यदि आप इस सहायक को पुर्तगाल के एक छोटे से शहर से हटाकर एक बड़े शहर में ले जाते हैं जहाँ लिखने की शैली थोड़ी अलग है, तो वे भ्रमित हो जाते हैं और बुरी तरह विफल हो जाते हैं। वे विशेषज्ञ हैं, लेकिन उनमें लचीलेपन की कमी है।

2. सामान्यज्ञ (लार्ज लैंग्वेज मॉडल / LLM)

एक अत्यंत विद्वान प्रोफेसर की कल्पना करें जिसने इंटरनेट पर मौजूद लगभग सब कुछ पढ़ा है।

  • ताकत: वे अविश्वसनीय रूप से अनुकूलन योग्य हैं। आप उन्हें एक बिल्कुल नए शहर में छोड़ सकते हैं जिसके बारे में उन्होंने पहले कभी नहीं सुना है, और वे तुरंत वोटिंग का "सार" समझ लेंगे। वे केवल शब्दों को ही नहीं, बल्कि शब्दों के पीछे के अर्थ को भी समझते हैं।
  • कमजोरी: वे "बातूनी" होते हैं और कभी-कभी "भ्रमित जानकारी" (हैलुसिनेट) देते हैं। केवल सटीक शब्द की ओर इशारा करने के बजाय, वे वाक्य को फिर से लिख सकते हैं या गलती से ऐसी जानकारी गढ़ सकते हैं जो वहां मौजूद नहीं थी (जिसे शोधकर्ता "स्प्यूरियस" त्रुटियां कहते हैं)। वे एक कहानीकार की तरह हैं—बड़ी तस्वीर के लिए बेहतरीन, लेकिन कभी-कभी बारीकियों में अव्यवस्थित।

निर्णय: कौन जीता?

शोधकर्ताओं ने एक "गोल्डिलॉक्स" (संतुलित) स्थिति पाई:

  • उच्च-गति, उच्च-सटीकता वाले काम के लिए: यदि आपके पास किसी विशिष्ट क्षेत्र का बहुत सारा डेटा है, तो विशेषज्ञ का उपयोग करें। वे तेज़, सस्ते हैं और वोट के सटीक "कौन, क्या और कैसे" को खोजने में बहुत अधिक सटीक हैं।
  • नए क्षेत्र की खोज के लिए: यदि आप एक नए क्षेत्र में जा रहे हैं जहाँ आपके पास कोई प्रशिक्षण डेटा नहीं है, तो सामान्यज्ञ का उपयोग करें। वे बहुत मजबूत हैं और जब लिखने की शैली बदलती है तो वे "खराब" नहीं होते।

यह क्यों मायने रखता है?

इस "VotIE" प्रणाली को बनाने और इसे दुनिया के साथ साझा करके, शोधकर्ता पारदर्शिता के लिए एक उपकरण बना रहे हैं। यह स्थानीय सरकारी निर्णयों को छिपाने वाली "टेक्स्ट की दीवार" को एक स्पष्ट, खोजने योग्य डेटाबेस में बदलने का एक तरीका है। यह नागरिकों, पत्रकारों और शोधकर्ताओं को यह देखने के लिए जवाबदेह बनाने की अनुमति देता है कि वे वास्तव में कैसे वोट देते हैं, बिना धूल भरे अभिलेखों को पढ़ने में अपना पूरा जीवन बिताए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →