← नवीनतम पेपर
💬 NLP

COMMUNITYNOTES: A Dataset for Exploring the Helpfulness of Fact-Checking Explanations

यह शोधपत्र COMMUNITYNOTES प्रस्तुत करता है, जो एक बड़े पैमाने का बहुभाषी डेटासेट और एक स्वचालित प्रॉम्प्ट अनुकूलन ढांचा है जिसे समुदाय द्वारा जनरेट किए गए तथ्य-जांच स्पष्टीकरणों की उपयोगिता और उनके अंतर्निहित कारणों की भविष्यवाणी करने के लिए डिज़ाइन किया गया है, जो अंततः यह प्रदर्शित करता है कि इस तरह के अंतर्दृष्टि मौजूदा तथ्य-जांच प्रणालियों को बेहतर बना सकते हैं।

मूल लेखक: Rui Xing, Preslav Nakov, Timothy Baldwin, Jey Han Lau

प्रकाशित 2026-01-29
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Rui Xing, Preslav Nakov, Timothy Baldwin, Jey Han Lau

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक विशाल, अराजक शहर के चौक की कल्पना करें (जैसे सोशल मीडिया प्लेटफॉर्म X, जिसे पहले ट्विटर कहा जाता था) जहाँ लोग दावे चिल्ला रहे हैं। कभी-कभी ये दावे सच होते हैं, लेकिन अक्सर ये भ्रामक या फर्जी होते हैं।

अतीत में, "विशेषज्ञ पुस्तकालयाध्यक्षों" (expert librarians) का एक छोटा समूह चौक में खड़ा होता था, हर दावे को पढ़ता था, और इस बात की व्याख्या करते हुए एक नोट लिखता था कि क्या वह फर्जी था। लेकिन दावों की संख्या इतनी अधिक थी कि कुछ पुस्तकालयाध्यक्ष उन्हें संभाल नहीं पाते थे। इसलिए, शहर ने सभी को पुस्तकालयाध्यक्ष बनने की अनुमति देने का निर्णय लिया। इसे "कम्युनिटी नोट्स" (Community Notes) कहा जाता है।

हालाँकि, इस नई प्रणाली में दो बड़ी समस्याएँ हैं:

  1. धीमी कतार: किसी नोट को प्रकाशित होने के लिए पर्याप्त वोट पाने में घंटों या यहाँ तक कि दिन लग जाते हैं। अधिकांश नोट (90% से अधिक) कभी नहीं देखे जाते क्योंकि वे कतार में ही फंस जाते हैं।
  2. अस्पष्ट नियम: जब लोग इस बात पर वोट देते हैं कि कोई नोट "सहायक" (helpful) है या नहीं, तो उनके पास इस बात का कोई स्पष्ट शब्दकोश नहीं होता कि "सहायक" का वास्तव में क्या अर्थ है। क्या यह इसलिए सहायक है क्योंकि यह मज़ेदार है? क्योंकि इसमें तथ्य हैं? क्योंकि यह दयालु है? स्पष्ट नियमों के बिना, लेखकों को यह जानने में कठिनाई होती है कि क्या लिखना है और मतदाताओं को यह तय करने में कठिनाई होती है कि कैसे निर्णय लेना है।

समाधान: एक नया "नियम पुस्तिका" और एक डेटासेट

इस शोध पत्र के लेखकों ने इसे एक विशाल प्रशिक्षण नियमावली और नियमों का एक नया सेट बनाकर ठीक करने का निर्णय लिया।

1. डेटासेट (द "अभ्यास परीक्षा")
उन्होंने पोस्ट और उन नोट्स के 1,04,000 वास्तविक उदाहरण एकत्र किए जो लोगों ने उन पर लिखे थे। उन्होंने प्रत्येक को लेबल किया:

  • क्या नोट सहायक था? (हाँ/नहीं)
  • वह क्यों सहायक था (या क्यों नहीं था)? (जैसे, "इसने तथ्यों को स्पष्ट किया," "यह बहुत पक्षपाती था," या "इसमें मुख्य बिंदु गायब थे।")

इस डेटासेट को एक कंप्यूटर के लिए अभ्यास परीक्षाओं के एक विशाल ढेर के रूप में समझें, जो उसे अच्छे और बुरे नोट्स के हजारों उदाहरण दिखाता है।

2. एआई "कोच" (ऑटोमैटिक प्रॉम्प्ट ऑप्टिमाइज़ेशन)
सबसे बड़ी बाधा यह थी कि कोई नोट अच्छा या बुरा क्यों है, इसके "कारण" अस्पष्ट थे। लेखकों ने एक विशेष एआई कोच बनाया जो दो काम करता है:

  • शब्दकोश लिखना: यह उदाहरणों को देखता है और स्वचालित रूप से स्पष्ट, सरल परिभाषाएँ लिखता है कि क्या किसी नोट को "सहायक" या "असहायक" बनाता है।
  • शब्दकोश को पॉलिश करना: फिर यह एक सख्त संपादक की तरह कार्य करता है, उन परिभाषाओं का परीक्षण करता है और उन्हें तब तक फिर से लिखता है जब तक कि वे पूर्ण न हो जाएँ।

3. परिणाम: स्मार्ट कंप्यूटर
उन्होंने अपने कंप्यूटर मॉडल को इन नए, अत्यंत स्पष्ट परिभाषाओं का उपयोग करना सिखाया।

  • पहले: कंप्यूटर यह अनुमान लगाने में ठीक था कि कोई नोट सहायक है या नहीं (लगभग 88% सटीकता), लेकिन यह क्यों बताने में बहुत खराब था (65% से कम सटीकता)।
  • बाद में: इन "पॉलिश की गई परिभाषाओं" को फीड करने के बाद, यह निर्णय लगाने और उसके पीछे के कारण को समझने, दोनों में बेहतर हो गया। यह एक छात्र को केवल एक अस्पष्ट विषय सूची देने के बजाय एक स्पष्ट अध्ययन मार्गदर्शिका देने जैसा है।

यह क्यों मायने रखता है?

यह शोध पत्र दिखाता है कि यह नया सिस्टम केवल X के लिए नहीं है। उन्होंने अन्य तथ्य-जांच कार्यों (जैसे जलवायु परिवर्तन के दावों की जाँच करना) पर भी इसका परीक्षण किया और पाया कि यह जानना कि प्रमाण का हिस्सा सहायक क्यों है, कंप्यूटर को समग्र रूप से बेहतर निर्णय लेने में मदद करता है।

मुख्य निष्कर्ष

लेखक एक विशाल वास्तविक दुनिया के उदाहरणों की लाइब्रेरी और एक एआई सिस्टम बनाते हैं जो स्वचालित रूप से स्पष्ट नियम लिखता है कि तथ्य-जांच नोट "अच्छा" क्या होता है। यह कंप्यूटर को मानवीय तर्क को बेहतर ढंग से समझने में मदद करता है, जिससे अंततः ऑनलाइन गलत सूचनाओं को रोकने की प्रक्रिया तेज हो सकती है।

महत्वपूर्ण नोट: लेखक बहुत स्पष्ट हैं कि उनके उपकरण सामग्री की समीक्षा करने के लिए मानव की सहायता करने के लिए हैं, न कि उन्हें बदलने के लिए। वे चेतावनी देते हैं कि कंप्यूटर अभी भी गलतियाँ कर सकते हैं या मानवीय पूर्वाग्रहों को अपना सकते हैं, इसलिए इन उपकरणों का उपयोग अंतिम न्यायाधीश के बजाय एक "दूसरी राय" के रूप में किया जाना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →