← नवीनतम पेपर
💬 NLP

ClaimPT: A Portuguese Dataset of Annotated Claims in News Articles

यह शोध पत्र ClaimPT को प्रस्तुत करता है, जो LUSA न्यूज़ एजेंसी के 1,308 समाचार लेखों का एक उच्च-गुणवत्ता वाला यूरोपीय पुर्तगाली डेटासेट है जिसमें 6,875 एनोटेटेड तथ्यात्मक दावे शामिल हैं, जिसे कम संसाधन वाली भाषाओं के लिए स्वचालित तथ्य-जांच (ऑटोमेटेड फैक्ट-चेकिंग) हेतु संसाधनों की कमी को दूर करने और दावा पहचान (क्लेम डिटेक्शन) के लिए आधारभूत बेंचमार्क स्थापित करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Ricardo Campos, Raquel Sequeira, Sara Nerea, Inês Cantante, Diogo Folques, Luís Filipe Cunha, João Canavilhas, António Branco, Alípio Jorge, Sérgio Nunes, Nuno Guimarães, Purificação Silvano

प्रकाशित 2026-03-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ricardo Campos, Raquel Sequeira, Sara Nerea, Inês Cantante, Diogo Folques, Luís Filipe Cunha, João Canavilhas, António Branco, Alípio Jorge, Sérgio Nunes, Nuno Guimarães, Purificação Silvano

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, अराजक बाजार है। हर दिन, लाखों लोग तथ्य, राय, अफवाहें और झूठ चिल्ला रहे हैं। फैक्ट-चेकिंग (तथ्य-जांच) उन "सत्य निरीक्षकों" का काम है जो यह सत्यापित करने के लिए इधर-उधर दौड़ रहे हैं कि लोग जो चिल्ला रहे हैं वह वास्तव में सच है या नहीं।

समस्या क्या है? चिल्लाने वाले बहुत अधिक हैं और निरीक्षक बहुत कम। जब तक कोई निरीक्षक किसी झूठ को सत्यापित करता है, तब तक वह दुनिया के तीन चक्कर लगा चुका होता है। हमें रोबोटों की मदद की जरूरत है, लेकिन रोबोट वर्तमान में इस काम में बहुत खराब हैं क्योंकि उन्हें पर्याप्त उदाहरणों पर प्रशिक्षित नहीं किया गया है, विशेष रूप से अंग्रेजी के अलावा अन्य भाषाओं में।

यह शोध पत्र ClaimPT पेश करता है, जो एक नया टूल है जिसे इन रोबोटों को पुर्तगाली समाचारों में सत्य को पहचानने के लिए सिखाने के लिए डिज़ाइन किया गया है। यहाँ एक सरल विवरण दिया गया है कि उन्होंने क्या किया:

1. समस्या: "भूसे के ढेर में सुई"

समाचारों की दुनिया में, अधिकांश वाक्य केवल पृष्ठभूमि का शोर (जैसे "बैठक सुबह 9 बजे शुरू हुई") होते हैं। लेकिन इनके भीतर विशिष्ट दावे (claims) छिपे होते—जैसे "सरकार ने एक पुल बनाने का वादा किया।" ये वे "सुइयां" हैं जिन्हें जांचने की आवश्यकता है।

इन सुइयों को खोजना कठिन है क्योंकि:

  • वे अक्सर लंबे लेखों में दबे होते हैं।
  • वे विचारों और कहानियों के साथ मिले होते हैं।
  • अब तक, कंप्यूटरों के लिए यह सीखने के लिए कोई "प्रशिक्षण नियमावली" नहीं थी कि वे पुर्तगाली में उन्हें कैसे खोजें। अधिकांश प्रशिक्षण डेटा अंग्रेजी में था, जैसे किसी कुत्ते को केवल अंग्रेजी कमांड का उपयोग करके चीजें लाने के लिए सिखाना।

2. समाधान: एक "ट्रेनिंग जिम" बनाना (ClaimPT)

लेखकों ने AI के लिए एक विशाल ट्रेनिंग जिम बनाया। उन्होंने पुर्तगाली समाचार एजेंसी LUSA के साथ साझेदारी की ताकि 1,308 वास्तविक समाचार लेख प्राप्त किए जा सकें।

इस डेटासेट को एक स्पोर्ट्स कोच के लिए हाइलाइट रील के रूप में सोचें।

  • खिलाड़ी: समाचार लेख।
  • कोच: दो मानव विशेषज्ञ जिन्होंने हर एक वाक्य को पढ़ा।
  • रेफरी: एक तीसरा विशेषज्ञ जिसने कोचों के काम की जांच की ताकि यह सुनिश्चित हो सके कि वे निष्पक्ष थे।

इन मनुष्यों ने लेखों को पढ़ा और टेक्स्ट पर "स्टिकर" लगाए। उन्होंने चिह्नित किया:

  • दावा (The Claim): वह विशिष्ट वाक्य जो एक सत्यापन योग्य तथ्य बनाता है।
  • स्रोत (The Source): यह किसने कहा? (जैसे, "मेयर" या "एक स्थानीय निवासी")।
  • समय (The Time): उन्होंने यह कब कहा?
  • विषय (The Topic): क्या यह राजनीति, स्वास्थ्य या खेल के बारे में है?

उन्होंने न केवल वाक्य को चिह्नित किया; उन्होंने यह भी चिह्नित किया कि किसने कहा और वे किस बारे में बात कर रहे थे, जिससे सत्य का एक समृद्ध, विस्तृत मानचित्र तैयार हुआ।

3. चुनौती: रोबोट को सिखाना

एक बार जब जिम बन गया, तो लेखकों ने एक रोबोट (एक AI मॉडल) को यह काम सिखाने की कोशिश की। उन्होंने दो प्रकार के रोबोटों का परीक्षण किया:

  • "जेनरेटिव" (Generative) रोबोट: एक फैंसी AI जो शून्य से उत्तर लिखने की कोशिश करता है (जैसे एक छात्र जो बिना नोट्स के परीक्षा देता है)।
  • "एनकोडर" (Encoder) रोबोट: एक विशेष AI जिसे पैटर्न पहचानने के लिए प्रशिक्षित किया गया है (जैसे उंगलियों के निशान खोजने वाला एक जासूस)।

परिणाम:
"जेनरेटिव" रोबोट भ्रमित हो गया। उसने अक्सर सोचा कि समाचार पत्र में दिया गया कोई भी उद्धरण एक दावा था, भले ही वह केवल एक राय हो। यह एक सुरक्षा गार्ड की तरह था जो केवल उन लोगों को नहीं रोकता जो कानून तोड़ रहे हैं, बल्कि हर उस व्यक्ति को रोकता है जो बोलता है।

"एनकोडर" रोबोट ने बहुत बेहतर प्रदर्शन किया। उसने एक कठिन तथ्य ("पुल बनाया गया था") और एक नरम राय ("मुझे लगता है कि पुल बदसूरत है") के बीच अंतर करना सीख लिया। हालांकि, सबसे अच्छा रोबोट भी थोड़ा संघर्ष करता रहा। ऐसा इसलिए है क्योंकि एक लंबी समाचार कहानी के भीतर एक विशिष्ट दावे को खोजना, बिना यह जाने कि कौन सा पन्ना देखना है, एक किताब में एक विशिष्ट शब्द खोजने जैसा है।

4. यह क्यों मायने रखता है

इस शोध पत्र से पहले, यदि आप पुर्तगाली समाचारों के लिए फैक्ट-चेकिंग ऐप बनाना चाहते थे, तो आप अंधेरे में तीर चला रहे थे। आपके पास कोई मानचित्र नहीं था।

ClaimPT वह मानचित्र है।

  • शोधकर्ताओं के लिए: यह उन्हें एक मानक परीक्षण देता है कि उनके नए AI मॉडल कितने अच्छे हैं।
  • जनता के लिए: यह पुर्तगाली में फर्जी खबरों को स्वचालित रूप से फ्लैग करने या राजनीतिक वादों को सत्यापित करने वाले उपकरण बनाने में मदद करता है, जिससे सूचना तंत्र स्वस्थ बनता है।

बड़ी तस्वीर

इस शोध पत्र को एक नए कारखाने के लिए ब्लूप्रिंट और ईंटों की पहली खेप के रूप में समझें। कारखाने का काम पुर्तगाली समाचारों में सत्य को कल्पना से अलग करना है। लेखकों ने अभी तक पूरा कारखाना नहीं बनाया है, लेकिन उन्होंने आवश्यक सामग्री (डेटासेट) और निर्देश (दिशानिर्देश) प्रदान किए हैं ताकि दुनिया भर के इंजीनियर इसे बनाना शुरू कर सकें।

संक्षेप में: उन्होंने पुर्तगाली समाचारों के एक अव्यवस्थित, असंगठित ढेर को लिया, सावधानीपूर्वक "सत्यपूर्ण कथनों" को लेबल किया, और उस लेबल वाले ढेर को दुनिया को सौंप दिया ताकि कंप्यूटर अंततः पुर्तगाली में फैक्ट-चेक करना सीख सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →