← नवीनतम पेपर
🤖 machine learning

Neural Grammatical Error Correction for Romanian

यह शोध पत्र रोमानियाई भाषा के लिए पहले व्याकरणिक त्रुटि सुधार (GEC) कॉर्पस को प्रस्तुत करता है और यह प्रदर्शित करता है कि सिंथेटिक रूप से उत्पन्न डेटा पर एक बड़े ट्रांसफॉर्मर मॉडल को प्रीट्रेन करने से इस कम-संसाधन वाले परिवेश में प्रदर्शन में काफी सुधार होता है।

मूल लेखक: Teodor-Mihai Cotet, Stefan Ruseti, Mihai Dascalu

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Teodor-Mihai Cotet, Stefan Ruseti, Mihai Dascalu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बच्चे को एक ऐसी भाषा में पूरी तरह से बोलना और लिखना सिखाने की कोशिश कर रहे हैं जो कंप्यूटर की दुनिया में बहुत आम नहीं है, जैसे कि रोमानियाई।

अधिकांश "स्मार्ट" उपकरण (जैसे ऑटोकरेक्ट या स्पेलचेकर) उन शिक्षकों की तरह हैं जिन्होंने अपना पूरा जीवन अंग्रेजी बोलने वाले स्कूलों में बिताया है। वे अंग्रेजी के विशेषज्ञ हैं, लेकिन जब बात रोमानियाई की आती है, तो वे एक बुनियादी शब्दकोश वाले पर्यटकों की तरह होते हैं—वे एक साधारण वर्तनी की गलती को पकड़ सकते हैं, लेकिन वे भाषा की "आत्मा" या जटिल व्याकरण को नहीं समझते हैं।

यह शोध पत्र बताता है कि कैसे बुखारेस्ट के शोधकर्ताओं की एक टीम ने रोमानियाई व्याकरण के लिए एक "सुपर-ट्यूटर" बनाया। यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे तीन सरल चरणों में विभाजित किया गया है:

1. "गोल्ड स्टैंडर्ड" पाठ्यपुस्तक बनाना (द कॉर्पस)

किसी को सिखाने के लिए, आपको सबसे पहले एक बेहतरीन पाठ्यपुस्तक की आवश्यकता होती है। शोधकर्ताओं ने RONACC कॉर्पस बनाया।

इसे "पहले और बाद की" तस्वीरों के संग्रह के रूप में सोचें। उन्होंने रोमानियाई टीवी और रेडियो शो से वास्तविक वाक्य लिए—जहाँ लोग अक्सर स्वाभाविक रूप से बोलते हैं या गलतियाँ करते हैं—और विशेषज्ञों से उन्हें सही करवाया। इससे एक "गोल्ड कॉर्पस" तैयार हुआ: 10,000 वाक्यों के जोड़े जहाँ एक "अव्यवस्थित" संस्करण है और दूसरा "परफेक्ट" संस्करण है। यह छात्र के अध्ययन के लिए अंतिम उत्तर कुंजी (answer key) है।

2. "फेक न्यूज" प्रशिक्षण विधि (सिंथेटिक डेटा)

समस्या यह है कि 10,000 वाक्य किसी कंप्यूटर को वास्तव में "स्मार्ट" बनाने के लिए पर्याप्त नहीं हैं। यह एक पूरी भाषा सीखने के लिए केवल एक किताब पढ़ने जैसा है।

इसे ठीक करने के लिए, शोधकर्ताओं ने एक चतुर ट्रिक का उपयोग किया: उन्होंने विकिपीडिया के साथ "मैड लिब्स" (Mad Libs) खेला। उन्होंने विकिपीडिया से लाखों सही वाक्य लिए और उन्हें जानबूझकर "बिगाड़" दिया। उन्होंने शब्दों को बदला, अक्षर हटा दिए, और क्रम को बिगाड़ दिया ताकि मानवीय त्रुटियों का अनुकरण किया जा सके।

उपमा: कल्पना कीजिए कि आप एक पेशेवर एथलीट को सिखाना चाहते हैं कि ठोकर लगने पर कैसे प्रतिक्रिया देनी है। वास्तविक खेल में वास्तव में गिरने का इंतजार करने के बजाय (जो कि दुर्लभ है), आप गद्देदार बाधाओं और नकली ट्रिप्स के साथ एक प्रशिक्षण पाठ्यक्रम तैयार करते हैं। इन "नकली" गलतियों पर अभ्यास करके, एथलीट वास्तविक खेल शुरू होने पर वास्तविक गलतियों को पहचानने और उनसे उबरने में अविश्वसनीय रूप से तेज़ हो जाता है।

3. "मस्तिष्क" (द ट्रांसफार्मर मॉडल)

शोधकर्ताओं ने ट्रांसफार्मर (Transformer) नामक तकनीक का उपयोग किया। ट्रांसफार्मर को एक बहुत ही चौकस छात्र के रूप में सोचें। जब यह किसी वाक्य को देखता है, तो यह केवल एक बार में एक शब्द नहीं देखता; यह पूरे वाक्य को एक साथ देखता है, और ध्यान देता है कि कैसे हर शब्द दूसरे शब्द से संबंधित है।

उन्होंने दो प्रकार के "मस्तिष्क" का परीक्षण किया:

  • छोटा मस्तिष्क: एक छोटा, तेज़ छात्र जिसने केवल "गोल्ड टेक्स्टबुक" का अध्ययन किया।
  • बड़ा मस्तिष्क: एक बहुत बड़ा, अधिक शक्तिशाली छात्र जिसने पहले "फेक न्यूज" (टूटे हुए विकिपीडिया वाक्यों) का अध्ययन किया और फिर "गोल्ड टेक्स्टबुक" का अध्ययन किया।

परिणाम: कौन जीता?

बड़ा मस्तिष्क भारी अंतर से जीता! "नकली" गलतियों पर पहले अभ्यास करके, इसने भाषा के प्रवाह के लिए एक "अंतर्ज्ञान" (gut feeling) विकसित किया। जब इसने अंततः वास्तविक रोमानियाई पाठ्यपुस्तक का अध्ययन किया, तो यह पैटर्न पहचानने में पहले से ही विशेषज्ञ था।

यह क्यों मायने रखता है?

अधिकांश AI प्रगति अंग्रेजी में होती है क्योंकि अंग्रेजी के पास विशाल मात्रा में डेटा है। यह शोध पत्र अन्य भाषाओं के लिए एक "ब्लूप्रिंट" प्रदान करता है। यह दिखाता है कि यदि आपके पास पूर्ण डेटा का पहाड़ नहीं है, तो भी आप एक शक्तिशाली उपकरण बनाने के लिए "नकली" डेटा और स्मार्ट प्रशिक्षण युक्तियों का उपयोग कर सकते हैं जो लोगों को अपनी मातृभाषा में अधिक स्पष्ट रूप से संवाद करने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →