The GDN-CC Dataset: Automatic Corpus Clarification for AI-enhanced Democratic Citizen Consultations
यह शोध पत्र GDN-CC डेटासेट और एक कॉर्पस क्लेरिफिकेशन (Corpus Clarification) ढांचे को प्रस्तुत करता है जो शोर वाले लोकतांत्रिक परामर्श डेटा को संरचित तर्कपूर्ण इकाइयों में मानकीकृत करने के लिए है, यह प्रदर्शित करते हुए कि छोटे, ओपन-वेट भाषा मॉडल इस प्रक्रिया को प्रभावी ढंग से स्वचालित कर सकते हैं और बड़े पैमाने पर राजनीतिक विश्लेषण को सक्षम कर सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत बड़े शहर के मेयर हैं, और आप अपने हर एक नागरिक से शहर की समस्याओं को हल करने के लिए अपने विचार लिखने के लिए कहते हैं। आपको 240,000 पत्र मिलते हैं।
अब, उन पत्रों को पढ़ने की कल्पना करें। कुछ छोटे हैं, कुछ लंबे। कुछ एकदम सही व्याकरण में लिखे गए हैं, जबकि कुछ जल्दबाजी में गलतियों के साथ लिखे गए हैं। कुछ लोग एक ही पैराग्राफ में तीन अलग-अलग विषय मिला देते हैं: "सड़कें खराब हैं, और मुझे नया टैक्स भी पसंद नहीं है, और वैसे भी, मेरा बिल्ली बीमार है।"
यदि आप यह जानने के लिए ये सभी पढ़ना प्रयास करते हैं कि लोग वास्तव में क्या चाहते हैं, तो आपका दिमाग फट जाएगा। यह बहुत अव्यवस्थित है। यही वह समस्या है जिसे इस शोध पत्र के शोधकर्ता हल करने की कोशिश कर रहे हैं। वे अपने प्रोजेक्ट को GDN-CC कहते हैं, और उन्होंने इसे सरल रूप में कैसे ठीक किया, यहाँ बताया गया है।
समस्या: "शोर भरा कमरा"
मूल नागरिक योगदान को एक शोर भरे, अराजक कमरे के रूप में सोचें जहाँ 240,000 लोग एक साथ चिल्ला रहे हैं।
- कुछ लोग टैक्स के बारे में चिल्ला रहे हैं।
- कुछ गति सीमा (speed limits) के बारे में चिल्ला रहे हैं।
- कुछ एक ही समय में दोनों के बारे में चिल्ला रहे हैं।
- कुछ बस बेमतलब के शब्द चिल्ला रहे हैं।
यदि आप इस कमरे को सुनने और विचारों का सारांश निकालने के लिए एक कंप्यूटर (विशेष रूप से एक सुपर-स्मार्ट AI जिसे लार्ज लैंग्वेज मॉडल या LLM कहा जाता है) का उपयोग करने का प्रयास करते हैं, तो दो बुरी चीजें होती हैं:
- AI भ्रमित हो जाता है क्योंकि शोर बहुत तेज़ है।
- AI एक "ब्लैक बॉक्स" है। यह एक मैजिक 8-बॉल की तरह है। आप इससे एक सवाल पूछते हैं, यह आपको उत्तर देता है, लेकिन आपको यह नहीं पता कि इसने निर्णय कैसे लिया। एक लोकतंत्र में, हमें पता होना चाहिए कि निर्णय क्यों लिया गया था, और हमें काम की जाँच करने में सक्षम होना चाहिए। इसके अलावा, ये सुपर-स्मार्ट AI अक्सर बड़ी निजी कंपनियों के स्वामित्व में होते हैं, जो सार्वजनिक सरकारी कार्यों के लिए जोखिम भरा लगता है।
समाधान: "कॉर्पस क्लेरिफिकेशन" फैक्ट्री
लेखकों ने शोर को साफ करने के लिए एक फैक्ट्री बनाई है। वे इस प्रक्रिया को कॉर्पस क्लेरिफिकेशन (Corpus Clarification) कहते हैं।
उन अव्यवस्थित पत्रों को ले जाने वाले एक कन्वेयर बेल्ट की कल्पना करें। इस फैक्ट्री में तीन स्टेशन हैं:
स्टेशन 1: सॉर्टर (आर्ग्युमेंटेटिव यूनिट एक्सट्रैक्शन)
पहला मशीन एक अव्यवस्थित पत्र को देखती है और कहती है, "रुको, यह व्यक्ति तीन अलग-अलग चीजों के बारे में बात कर रहा है।"
- मूल: "ईंधन महंगा है! साथ ही, स्पीड लिमिट बहुत कम है, और हमें अधिक पार्क चाहिए।"
- कार्रवाई: मशीन उस पत्र को तीन अलग-अलग, साफ कार्डों में काट देती है।
- कार्ड A: "ईंधन महंगा है।"
- कार्ड B: "स्पीड लिमिट बहुत कम है।"
- कार्ड C: "हमें अधिक पार्क चाहिए।"
स्टेशन 2: लेबलर (आर्ग्युमेंटेटिव स्ट्रक्चर डिटेक्शन)
अब, मशीन प्रत्येक कार्ड को देखती है और पूछती है, "यह किस तरह का विचार है?"
- क्या यह एक कथन (Statement) है? (एक राय: "ईंधन महंगा है।")
- क्या यह एक समाधान (Solution) है? (एक सुधार: "हमें अधिक पार्क चाहिए।")
- क्या यह एक आधार (Premise) है? (एक कारण: "क्योंकि वर्तमान टैक्स बहुत अधिक है।")
यह प्रत्येक कार्ड पर एक छोटा स्टिकर लगा देती है ताकि कोई इंसान बाद में उन्हें जल्दी से स्कैन कर सके।
स्टेशन 3: एडिटर (आर्ग्युमेंटेटिव यूनिट क्लेरिफिकेशन)
यह सबसे महत्वपूर्ण चरण है। मशीन कार्ड को बेहतर बनाने के लिए उसे फिर से लिखती है।
- मूल अव्यवस्थित कार्ड: "ईंधन पर टैक्स लगाना एक गलती थी!! यह पहले से ही बहुत महंगा है। वही बात 80 Kmh की स्पीड लिमिट की भी है..."
- संशोधित कार्ड: "ईंधन पर टैक्स लगाना एक गलती है क्योंकि यह पहले से ही बहुत महंगा है। 80 किमी/घंटा की स्पीड लिमिट का निर्णय स्थानीय स्तर पर लिया जाना चाहिए।"
मशीन स्पेलिंग ठीक करती है, गुस्से को हटाती है, और यह सुनिश्चित करती है कि वाक्य अपने आप में पूरी तरह समझ में आए, बिना बाकी के पत्र की आवश्यकता के।
गुप्त हथियार: छोटे, स्थानीय रोबोट
आमतौर पर, इस तरह के पुनर्लेखन के लिए, आपको एक विशाल, महंगे AI रोबोट की आवश्यकता होती है (जैसे कि वे जो बड़ी टेक कंपनियों के पास क्लाउड में होते हैं)।
लेकिन शोधकर्ताओं ने पूछा: "क्या हम छोटे, सस्ते रोबोट का उपयोग कर सकते हैं जिन्हें हम अपने खुद के बेसमेंट में रख सकें?"
उन्होंने "स्मॉल लैंग्वेज मॉडल्स" (SLMs) का परीक्षण किया। इन्हें बड़े AI के सुपर-कंप्यूटरों की तुलना में स्मार्ट कैलकुलेटर के रूप में समझें।
- परिणाम: आश्चर्यजनक रूप से, छोटे रोबोटों ने, एक बार जब उन्हें "प्रशिक्षित" (इस विशिष्ट कार्य को करने के लिए सिखाया गया) कर दिया गया, तो उन्होंने विशाल सुपर-कंप्यूटरों के समान ही अच्छा काम किया।
- यह क्यों मायने रखता है: क्योंकि ये छोटे रोबोट सामान्य कंप्यूटरों पर चल सकते हैं, इसलिए कोई भी (यहाँ तक कि एक छोटा नगर निगम भी) इनका उपयोग कर सकता है। किसी को भी किसी निगम के स्वामित्व वाले गुप्त ब्लैक बॉक्स पर भरोसा करने की आवश्यकता नहीं है। यह प्रक्रिया पारदर्शी और खुली है।
ग्रैंड प्राइज: एक साफ लाइब्रेरी
अपने छोटे रोबмों के काम करने को साबित करने के बाद, शोधकर्ताओं ने पूरे 240,000 पत्रों पर इस पूरी फैक्ट्री को चलाया।
- उन्होंने 240,000 पत्रों के उस अस्त-व्यस्त, अराजक कमरे को 300,000 स्पष्ट, लेबल किए गए कार्डों की एक व्यवस्थित, संगठित लाइब्रेरी में बदल दिया।
- उन्होंने इस लाइब्रेरी (जिसे GDN-CC-large कहा जाता है) को जनता के लिए जारी किया।
हमें इसकी परवाह क्यों करनी चाहिए?
- बेहतर लोकतंत्र: अब, राजनेता और शोधकर्ता शोर में खोए बिना वास्तव में देख सकते हैं कि लोग क्या चाहते हैं। वे समान विचारों को आसानी से एक साथ समूहबद्ध कर सकते हैं।
- पारदर्शिता: क्योंकि उन्होंने छोटे, खुले मॉडलों का उपयोग किया है, हम देख सकते हैं कि कंप्यूटर ने टेक्स्ट को कैसे प्रोसेस किया। कोई जादुई ट्रिक नहीं।
- दक्षता (Efficiency): उन्होंने साबित किया कि सार्वजनिक राय का विश्लेषण करने के लिए आपको अरबों डॉलर के AI की आवश्यकता नहीं है। आप इसे एक लैपटॉप और कुछ स्मार्ट, ओपन-सोर्स सॉफ्टवेयर के साथ कर सकते हैं।
संक्षेप में: यह शोध पत्र सार्वजनिक राय के लिए एक सफाई मशीन बनाने के बारे में है। यह अव्यवस्थित, भ्रमित करने वाले नागरिक पत्रों को लेता है, उन्हें छाँटता है, व्याकरण ठीक करता है, और उन्हें स्पष्ट, व्यवस्थित विचारों में बदल देता है जिन्हें कोई भी समझ और भरोसा कर सकता है। और सबसे अच्छी बात? उन्होंने इस मशीन को महंगे, गुप्त उपकरणों के बजाय छोटे, खुले उपकरणों का उपयोग करके बनाया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।