ClaimPT: A Portuguese Dataset of Annotated Claims in News Articles
यह शोध पत्र ClaimPT को प्रस्तुत करता है, जो LUSA न्यूज़ एजेंसी के 1,308 समाचार लेखों का एक उच्च-गुणवत्ता वाला यूरोपीय पुर्तगाली डेटासेट है जिसमें 6,875 एनोटेटेड तथ्यात्मक दावे शामिल हैं, जिसे कम संसाधन वाली भाषाओं के लिए स्वचालित तथ्य-जांच (ऑटोमेटेड फैक्ट-चेकिंग) हेतु संसाधनों की कमी को दूर करने और दावा पहचान (क्लेम डिटेक्शन) के लिए आधारभूत बेंचमार्क स्थापित करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, अराजक बाजार है। हर दिन, लाखों लोग तथ्य, राय, अफवाहें और झूठ चिल्ला रहे हैं। फैक्ट-चेकिंग (तथ्य-जांच) उन "सत्य निरीक्षकों" का काम है जो यह सत्यापित करने के लिए इधर-उधर दौड़ रहे हैं कि लोग जो चिल्ला रहे हैं वह वास्तव में सच है या नहीं।
समस्या क्या है? चिल्लाने वाले बहुत अधिक हैं और निरीक्षक बहुत कम। जब तक कोई निरीक्षक किसी झूठ को सत्यापित करता है, तब तक वह दुनिया के तीन चक्कर लगा चुका होता है। हमें रोबोटों की मदद की जरूरत है, लेकिन रोबोट वर्तमान में इस काम में बहुत खराब हैं क्योंकि उन्हें पर्याप्त उदाहरणों पर प्रशिक्षित नहीं किया गया है, विशेष रूप से अंग्रेजी के अलावा अन्य भाषाओं में।
यह शोध पत्र ClaimPT पेश करता है, जो एक नया टूल है जिसे इन रोबोटों को पुर्तगाली समाचारों में सत्य को पहचानने के लिए सिखाने के लिए डिज़ाइन किया गया है। यहाँ एक सरल विवरण दिया गया है कि उन्होंने क्या किया:
1. समस्या: "भूसे के ढेर में सुई"
समाचारों की दुनिया में, अधिकांश वाक्य केवल पृष्ठभूमि का शोर (जैसे "बैठक सुबह 9 बजे शुरू हुई") होते हैं। लेकिन इनके भीतर विशिष्ट दावे (claims) छिपे होते—जैसे "सरकार ने एक पुल बनाने का वादा किया।" ये वे "सुइयां" हैं जिन्हें जांचने की आवश्यकता है।
इन सुइयों को खोजना कठिन है क्योंकि:
- वे अक्सर लंबे लेखों में दबे होते हैं।
- वे विचारों और कहानियों के साथ मिले होते हैं।
- अब तक, कंप्यूटरों के लिए यह सीखने के लिए कोई "प्रशिक्षण नियमावली" नहीं थी कि वे पुर्तगाली में उन्हें कैसे खोजें। अधिकांश प्रशिक्षण डेटा अंग्रेजी में था, जैसे किसी कुत्ते को केवल अंग्रेजी कमांड का उपयोग करके चीजें लाने के लिए सिखाना।
2. समाधान: एक "ट्रेनिंग जिम" बनाना (ClaimPT)
लेखकों ने AI के लिए एक विशाल ट्रेनिंग जिम बनाया। उन्होंने पुर्तगाली समाचार एजेंसी LUSA के साथ साझेदारी की ताकि 1,308 वास्तविक समाचार लेख प्राप्त किए जा सकें।
इस डेटासेट को एक स्पोर्ट्स कोच के लिए हाइलाइट रील के रूप में सोचें।
- खिलाड़ी: समाचार लेख।
- कोच: दो मानव विशेषज्ञ जिन्होंने हर एक वाक्य को पढ़ा।
- रेफरी: एक तीसरा विशेषज्ञ जिसने कोचों के काम की जांच की ताकि यह सुनिश्चित हो सके कि वे निष्पक्ष थे।
इन मनुष्यों ने लेखों को पढ़ा और टेक्स्ट पर "स्टिकर" लगाए। उन्होंने चिह्नित किया:
- दावा (The Claim): वह विशिष्ट वाक्य जो एक सत्यापन योग्य तथ्य बनाता है।
- स्रोत (The Source): यह किसने कहा? (जैसे, "मेयर" या "एक स्थानीय निवासी")।
- समय (The Time): उन्होंने यह कब कहा?
- विषय (The Topic): क्या यह राजनीति, स्वास्थ्य या खेल के बारे में है?
उन्होंने न केवल वाक्य को चिह्नित किया; उन्होंने यह भी चिह्नित किया कि किसने कहा और वे किस बारे में बात कर रहे थे, जिससे सत्य का एक समृद्ध, विस्तृत मानचित्र तैयार हुआ।
3. चुनौती: रोबोट को सिखाना
एक बार जब जिम बन गया, तो लेखकों ने एक रोबोट (एक AI मॉडल) को यह काम सिखाने की कोशिश की। उन्होंने दो प्रकार के रोबोटों का परीक्षण किया:
- "जेनरेटिव" (Generative) रोबोट: एक फैंसी AI जो शून्य से उत्तर लिखने की कोशिश करता है (जैसे एक छात्र जो बिना नोट्स के परीक्षा देता है)।
- "एनकोडर" (Encoder) रोबोट: एक विशेष AI जिसे पैटर्न पहचानने के लिए प्रशिक्षित किया गया है (जैसे उंगलियों के निशान खोजने वाला एक जासूस)।
परिणाम:
"जेनरेटिव" रोबोट भ्रमित हो गया। उसने अक्सर सोचा कि समाचार पत्र में दिया गया कोई भी उद्धरण एक दावा था, भले ही वह केवल एक राय हो। यह एक सुरक्षा गार्ड की तरह था जो केवल उन लोगों को नहीं रोकता जो कानून तोड़ रहे हैं, बल्कि हर उस व्यक्ति को रोकता है जो बोलता है।
"एनकोडर" रोबोट ने बहुत बेहतर प्रदर्शन किया। उसने एक कठिन तथ्य ("पुल बनाया गया था") और एक नरम राय ("मुझे लगता है कि पुल बदसूरत है") के बीच अंतर करना सीख लिया। हालांकि, सबसे अच्छा रोबोट भी थोड़ा संघर्ष करता रहा। ऐसा इसलिए है क्योंकि एक लंबी समाचार कहानी के भीतर एक विशिष्ट दावे को खोजना, बिना यह जाने कि कौन सा पन्ना देखना है, एक किताब में एक विशिष्ट शब्द खोजने जैसा है।
4. यह क्यों मायने रखता है
इस शोध पत्र से पहले, यदि आप पुर्तगाली समाचारों के लिए फैक्ट-चेकिंग ऐप बनाना चाहते थे, तो आप अंधेरे में तीर चला रहे थे। आपके पास कोई मानचित्र नहीं था।
ClaimPT वह मानचित्र है।
- शोधकर्ताओं के लिए: यह उन्हें एक मानक परीक्षण देता है कि उनके नए AI मॉडल कितने अच्छे हैं।
- जनता के लिए: यह पुर्तगाली में फर्जी खबरों को स्वचालित रूप से फ्लैग करने या राजनीतिक वादों को सत्यापित करने वाले उपकरण बनाने में मदद करता है, जिससे सूचना तंत्र स्वस्थ बनता है।
बड़ी तस्वीर
इस शोध पत्र को एक नए कारखाने के लिए ब्लूप्रिंट और ईंटों की पहली खेप के रूप में समझें। कारखाने का काम पुर्तगाली समाचारों में सत्य को कल्पना से अलग करना है। लेखकों ने अभी तक पूरा कारखाना नहीं बनाया है, लेकिन उन्होंने आवश्यक सामग्री (डेटासेट) और निर्देश (दिशानिर्देश) प्रदान किए हैं ताकि दुनिया भर के इंजीनियर इसे बनाना शुरू कर सकें।
संक्षेप में: उन्होंने पुर्तगाली समाचारों के एक अव्यवस्थित, असंगठित ढेर को लिया, सावधानीपूर्वक "सत्यपूर्ण कथनों" को लेबल किया, और उस लेबल वाले ढेर को दुनिया को सौंप दिया ताकि कंप्यूटर अंततः पुर्तगाली में फैक्ट-चेक करना सीख सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।