← नवीनतम पेपर
🤖 AI

PersianPunc: A Large-Scale Dataset and BERT-Based Approach for Persian Punctuation Restoration

यह शोध पत्र PersianPunc पेश करता है, जो 17 मिलियन नमूनों का एक बड़े पैमाने का डेटासेट है, और एक फाइन-ट्यून्डेड ParsBERT मॉडल जो फारसी विराम चिह्न बहाली (punctuation restoration) के लिए 91.33% मैक्रो-एवरेज्ड F1 स्कोर प्राप्त करता है, जो वास्तविक समय के अनुप्रयोगों के लिए बड़े भाषा मॉडलों (large language models) का एक अधिक कुशल और सटीक विकल्प प्रदान करता है।

मूल लेखक: Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही खराब फोन कनेक्शन पर किसी को कहानी सुनाते हुए सुन रहे हैं। वे स्पष्ट रूप से बोल रहे हैं, लेकिन लाइन इतनी शोर-शराबे वाली है कि सभी ठहराव, अल्पविराम (commas) और पूर्ण विराम (periods) गायब हो गए हैं। आपको शब्दों की एक निरंतर धारा सुनाई देती है:

"कोई दया नहीं चाहिए उसे मार डालो"

बिना विराम चिह्न के, यह भयानक लगता है। लेकिन क्या होगा अगर वक्ता का वास्तव में अर्थ यह था:
"दया की आवश्यकता नहीं है, उसे मार डालो" (रुको, यह अभी भी बुरा है)।

आइए, पेपर से एक और उदाहरण लेते हैं:
"क्षमा कोई आवश्यकता नहीं उसे मार डालो" बनाम "क्षमा, उसे मारने की कोई आवश्यकता नहीं है।"

पहले संस्करण में, यह हत्या करने का आदेश लगता है। दूसरे संस्करण में, यह जीवन के लिए एक याचना लगती है। विराम चिह्न ही एक त्रासदी और एक सुखद अंत के बीच का अंतर है।

यह पेपर विशेष रूप से फारसी भाषा के लिए इस समस्या को ठीक करने के बारे में है। यहाँ उनके समाधान की कहानी है, जिसे सरल रूप में समझाया गया है।

1. समस्या: "रनिंग सेंटेंस" (लगातार चलते रहने वाले वाक्य) का राक्षस

ऑटोमैटिक स्पीच रिकग्निशन (ASR) की दुनिया में—वह तकनीक जो आपकी आवाज़ को टेक्स्ट में बदलती है (जैसे सिरी या गूगल असिस्टेंट)—कंप्यूटर अक्सर अल्पविराम, पूर्ण विराम या प्रश्नवाचक चिह्न लगाना भूल जाता है। वह बस टेक्स्ट का एक विशाल ब्लॉक फेंक देता है।

फारसी के लिए, यह एक बहुत बड़ी सिरदर्द है। फारसी एक "रूपात्मक रूप से समृद्ध" (morphologically rich) भाषा है, जिसका अर्थ है कि शब्द बहुत अधिक रूप बदलते हैं, और अल्पविराम कहाँ रखना है इसके नियम जटिल हैं। यदि कंप्यूटर इसमें गलती करता है, तो यह केवल अव्यवस्थित ही नहीं दिखता; यह वाक्य का अर्थ पूरी तरह से बदल देता है।

2. समाधान: एक विशाल पुस्तकालय बनाना (PersianPunc)

कंप्यूटर को इसे ठीक करना सिखाने के लिए, आपको उसे "खराब" टेक्स्ट और उसके "सुधारे गए" संस्करण के लाखों उदाहरण दिखाने होंगे।

लेखकों ने केवल कुछ उदाहरण नहीं खोजे; उन्होंने "PersianPunc" नामक एक विशाल पुस्तकालय बनाया।

  • पैमाना: उन्होंने 1.7 करोड़ वाक्य एकत्र किए। यह एक विशाल राष्ट्रीय पुस्तकालय की हर किताब को पढ़ने जैसा है।
  • मिश्रण: उन्होंने केवल औपचारिक समाचार लेखों का उपयोग नहीं किया। उन्होंने मेडिकल टेक्स्ट, विकिपीडिया और यहाँ तक कि टेलीग्राम और ब्लॉग के अनौपचारिक चैट को भी मिलाया। यह सुनिश्चित करता है कि कंप्यूटर एक गंभीर डॉक्टर की रिपोर्ट और एक दोस्त के मज़ेदार टेक्स्ट मैसेज, दोनों के लिए विराम चिह्न लगाना सीख सके।
  • सफाई: उन्होंने सख्त पुस्तकालयाध्यक्षों की तरह काम किया, अव्यवस्थित डेटा को फ़िल्टर किया, डुप्लिकेट को हटाया और यह सुनिश्चित किया कि "सही" संस्करण वास्तव में सही थे।

3. मस्तिष्क: एक विशेष ट्यूटर (ParsBERT)

एक बार जब उनके पास पुस्तकालय था, तो उन्हें एक शिक्षक की आवश्यकता थी। उन्होंने ParsBERT नामक एक मॉडल का उपयोग किया।

  • उपमा: ParsBERT को एक फारसी बोलने वाले ट्यूटर के रूप में सोचें जिसने पहले से ही फारसी में लिखा गया लगभग सब कुछ पढ़ लिया है। उन्होंने इस ट्यूटर को लिया और उसे एक विशिष्ट होमवर्क दिया: "इस वाक्य को बिना विराम चिह्न के देखो, और मुझे बताओ कि अल्पविराम और पूर्ण विराम कहाँ जाने चाहिए।"
  • परिणाम: यह ट्यूटर इस काम में अविश्वसनीय रूप से कुशल हो गया, और 91.33% बार इसे सही कर पाया।

4. मुकाबला: विशेषज्ञ बनाम सामान्यज्ञ

शोधकर्ताओं ने AI की दुनिया के "दिग्गजों" का भी परीक्षण किया: लार्ज लैंग्वेज मॉडल्स (LLMs) जैसे GPT-4। ये सुपर-स्मार्ट, सामान्य-उद्देश्य वाले AI दिमाग हैं जो कविता लिख सकते हैं, कोड कर सकते हैं और सामान्य ज्ञान के उत्तर दे सकते हैं।

उन्होंने दिग्गजों से विराम चिह्न ठीक करने के लिए कहा, लेकिन उन्होंने उन्हें एक सख्त नियम दिया: "कोई भी शब्द न बदलें। केवल विराम चिह्न जोड़ें।"

यहीं पर कहानी में मोड़ आता है:

  • दिग्गज (LLM): यह स्मार्ट था, लेकिन यह बहुत अधिक स्मार्ट था। इसकी एक बुरी आदत थी—अति-सुधार (over-correcting) करना। यदि इसने कोई ऐसा शब्द देखा जिसे इसने स्लैंग या थोड़ा गलत स्पेलिंग वाला समझा, तो यह शब्द को ही "ठीक" करने की कोशिश करता, जिससे अर्थ बदल जाता। इसे करने के लिए इसे भारी मात्रा में बिजली (कंप्यूटिंग पावर) की भी आवश्यकता थी।
  • विशेषज्ञ (ParsBERT): यह हल्का, तेज़ था और नियमों का पूरी तरह से पालन करता था। इसने केवल विराम चिह्न जोड़े और शब्दों को बिल्कुल वैसा ही छोड़ दिया जैसा वे थे।

फैसला: विशेषज्ञ ट्यूटर (ParsBERT) सटीकता में दिग्गज AI से बेहतर था और इसे चलाना बहुत सस्ता था। वास्तविक समय के अनुप्रयोगों (जैसे लाइव फोन कॉल को ठीक करने) के लिए, आपको हल्के वजन वाले विशेषज्ञ की आवश्यकता होती है, न कि भारी और अति-उत्साही दिग्गज की।

5. यह क्यों महत्वपूर्ण है

यह पेपर फारसी भाषी दुनिया के लिए एक उपहार है।

  • डेवलपर्स के लिए: अब उनके पास एक बेहतर वॉयस असिस्टेंट बनाने के लिए एक मुफ्त, विशाल डेटासेट और एक वर्किंग मॉडल है।
  • सभी के लिए: इसका मतलब है कि जब आप फारसी AI से बात करेंगे, तो वह आपकी आवाज़ के टोन और अर्थ को बहुत बेहतर तरीके से समझेगा, जिससे एक भ्रमित करने वाले रन-ऑन सेंटेंस को एक स्पष्ट, पठनीय कहानी में बदला जा सकेगा।

संक्षेप में: लेखकों ने एक विशाल प्रशिक्षण मैदान बनाया, एक विशेष फारसी AI को भाषण में गायब होते ठहराव को पहचानना सिखाया, और साबित किया कि इस विशिष्ट कार्य के लिए एक केंद्रित, कुशल विशेषज्ञ, एक विचलित और अति-उपलब्ध दिग्गज से बेहतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →