← नवीनतम पेपर
💬 NLP

FrenchNews-7: Benchmarking Cross-Publisher French News Editorial Desk Classification

यह शोध पत्र FrenchNews-7 को प्रस्तुत करता है, जो कई प्रकाशकों के माध्यम से फ्रांसीसी समाचार लेखों को सात संपादकीय श्रेणियों में वर्गीकृत करने के लिए एक नया बेंचमार्क है, जो यह प्रदर्शित करता है कि एक फाइन-ट्यून्ड CamemBERT मॉडल ज़ीरो-शॉट लार्ज लैंग्वेज मॉडल्स से बेहतर प्रदर्शन करता है और यह प्रकट करता है कि वर्गीकरण प्रदर्शन श्रेणी के अनुसार महत्वपूर्ण रूप से भिन्न होता है, जिसमें "Economie" और "Societe" जैसे अस्पष्ट डोमेन मानव-स्तर की सहमति सीमाओं के करीब पहुँच जाते हैं।

मूल लेखक: Amr Sobhy

प्रकाशित 2026-08-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amr Sobhy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक समाचारों के विशाल और शोर भरे परिदृश्य में, प्रत्येक लेख किसी समाचार पत्र या वेबसाइट के एक विशिष्ट विभाग से संबंधित होता है। जिस तरह एक पुस्तकालय पुस्तकों को इतिहास, विज्ञान या फिक्शन जैसे अलग-अलग अनुभागों में वर्गीकृत करता है, उसी तरह समाचार संगठन कहानियों को विशिष्ट संपादकीय डेस्क में भेजते हैं: एक टीम खेल देखती है, दूसरी राजनीति को कवर करती है, और तीसरी अंतर्राष्ट्रीय मामलों का प्रबंधन करती है। उन शोधकर्ताओं के लिए जो यह अध्ययन कर रहे हैं कि विभिन्न मीडिया आउटलेट कैसे जनमत को आकार देते हैं, इन कहानियों को स्वचालित रूप से वर्गीकृत करने की क्षमता आवश्यक है। इसके बिना, दो समाचार पत्रों द्वारा एक ही घटना को कवर करने के तरीके की तुलना करना एक मैन्युअल और असंभव कार्य बन जाता है। हालाँकि, चुनौती यह है कि प्रत्येक प्रकाशक कहानियों को लेबल करने के लिए अपनी अनूठी प्रणाली का उपयोग करता है। एक साइट किसी कहानी को "समाज" कह सकती है, जबकि दूसरी उसे "घरेलू मामले" कह सकती है, भले ही सामग्री बिल्कुल समान हो। पूरे फ्रांसीसी मीडिया परिदृश्य में काम करने वाला एक उपकरण बनाने के लिए, वैज्ञानिकों को इन विभिन्न आंतरिक भाषाओं को एक एकल, साझा समझ में अनुवाद करने के तरीके की आवश्यकता थी।

एक शोधकर्ता ने अब इस कार्य के लिए एक नया मानक बनाया है, जिसे FrenchNews-7 कहा जाता है। उन्होंने 13 विभिन्न फ्रांसीसी प्रकाशकों से लगभग 88,000 समाचार लेख एकत्र किए, जिनमें प्रमुख राष्ट्रीय दैनिक पत्रों से लेकर डिजिटल-ओनली आउटलेट्स और क्षेत्रीय समाचार पत्रों तक शामिल हैं। उनका लक्ष्य कंप्यूटर को यह पहचानना सिखाना था कि कोई कहानी किस संपादकीय डेस्क से संबंधित है, चाहे वह किसी भी वेबसाइट द्वारा प्रकाशित की गई हो। ऐसा करने के लिए, उन्होंने पहले इन आउटलेट्स में उपयोग किए जाने वाले सात सबसे सामान्य श्रेणियों का मानचित्र तैयार किया: समाज, संस्कृति और अवकाश, अंतर्राष्ट्रीय समाचार, घरेलू राजनीति, खेल, अर्थव्यवस्था, और विज्ञान एवं प्रौद्योगिकी। इसके बाद उन्होंने एक हाइब्रिड लेबलिंग प्रणाली बनाई। लगभग 72 प्रतिशत लेखों के लिए, लेबल स्पष्ट था क्योंकि वेबसाइट का पता स्वयं श्रेणी के नाम को समाहित करता था, जैसे कि "/sport" या "/politics" पर समाप्त होने वाला वेब लिंक। शेष 28 प्रतिशत के लिए, जहाँ पता अस्पष्ट था या गायब था, शोधकर्ता ने शीर्षक और पूर्ण पाठ को पढ़ने और सही श्रेणी असाइन करने के लिए एक बड़े भाषा मॉडल (large language model) का उपयोग किया। इस प्रक्रिया की मानव विशेषज्ञों और कृत्रिम बुद्धिमत्ता दोनों द्वारा सावधानीपूर्वक जाँच की गई ताकि यह सुनिश्चित किया जा सके कि लेबल सटीक हैं, जिसके परिणामस्वरूप एक ऐसा डेटासेट प्राप्त हुआ जहाँ मानव रेटर्स के बीच सहमति बहुत उच्च स्तर की थी।

इस नए डेटासेट का उपयोग करके, शोधकर्ता ने इस छँटाई कार्य को करने के लिए कई कंप्यूटर मॉडल प्रशिक्षित किए। उन्होंने उन मॉडलों का परीक्षण किया जो केवल शीर्षक देखते थे बनाम उन मॉडलों का जिन्होंने पूरे लेख को पढ़ा। परिणामों ने दिखाया कि पूर्ण पाठ पढ़ने से स्पष्ट लाभ मिलता है, जिससे कंप्यूटर को केवल शीर्षक से अनुमान लगाने के बजाय कहानी के संदर्भ को समझने में मदद मिलती है। सबसे अच्छा प्रदर्शन करने वाली प्रणाली, जो विशेष रूप से फ्रांसीसी भाषा पर प्रशिक्षित एक मॉडल थी, ने उच्च स्तर की सटीकता हासिल की, जिसने उन लगभग 80 प्रतिशत कहानियों को सही ढंग से पहचाना जिन्हें उसने पहले कभी नहीं देखा था। यह प्रदर्शन तब भी बना रहा जब मॉडल का परीक्षण मूल प्रशिक्षण समूह का हिस्सा न रहे चार पूरी तरह से नए प्रकाशकों पर किया गया। अध्ययन में पाया गया कि जबकि खेल और संस्कृति की कहानियों को छाँटना आसान था, अर्थव्यवस्था और सामान्य समाज की कहानियों को लगातार वर्गीकृत करना बहुत कठिन था। वास्तव में, जब शोधकर्ता ने मानव विशेषज्ञों से इन कठिन आर्थिक कहानियों को नए प्रकाशकों से छाँटने के लिए कहा, तो मनुष्य आपस में केवल 55 प्रतिशत समय ही सहमत हुए। यह सुझाव देता है कि कठिनाई कंप्यूटर की बुद्धिमत्ता में कोई दोष नहीं थी, बल्कि यह एक वास्तविक अस्पष्टता थी कि समाचार कक्ष स्वयं इन जटिल कहानियों को कैसे वर्गीकृत करने का निर्णय लेते हैं।

शोधकर्ता ने अपने विशेष मॉडल की तुलना कई शक्तिशाली, सामान्य-उद्देश्य वाले कृत्रिम बुद्धिमत्ता प्रणालियों से भी की, जिन्हें इस विशिष्ट समाचार डेटा पर प्रशिक्षित नहीं किया गया था। सबसे उन्नत सामान्य मॉडलों के बावजूद, विशेष फ्रांसीसी मॉडल बेहतर प्रदर्शन करता है, विशेष रूप से अर्थव्यवस्था और समाज जैसी कठिन श्रेणियों में। यह इंगित करता है कि समाचार छँटाई जैसे विशिष्ट, उच्च-मात्रा वाले कार्यों के लिए, लक्षित डोमेन की वास्तविक भाषा और संरचना पर फाइन-ट्यून किया गया मॉडल एक सामान्यवादी टूल की तुलना में बेहतर प्रदर्शन करता है। शोधकर्ता ने अपना डेटासेट और अपना सर्वश्रेष्ठ प्रदर्शन करने वाला मॉडल जनता के लिए उपलब्ध कराया है, जिससे अन्य शोधकर्ता इस कार्य को आगे बढ़ा सकें। विभिन्न प्रकाशकों के माध्यम से समाचारों को छाँटने का एक विश्वसनीय तरीका प्रदान करके, यह कार्य फ्रांसीसी मीडिया द्वारा दुनिया को कवर करने के अध्ययन के लिए एक नया आधार प्रदान करता है, यह सुनिश्चित करते हुए कि भविष्य के विश्लेषण इस बात की सुसंगत और सटीक समझ पर आधारित हों कि प्रत्येक कहानी वास्तव में कहाँ की है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →