← नवीनतम पेपर
💬 NLP

Evaluating Large Language Models for Diacritic Restoration in Romanian Texts: A Comparative Study

यह अध्ययन रोमानियाई विशेष चिह्नों (diacritics) को पुनर्स्थापित करने में विभिन्न लार्ज लैंग्वेज मॉडल्स के प्रदर्शन का मूल्यांकन करता है, जिसमें यह पाया गया है कि GPT-4o जैसे उन्नत मॉडल्स उच्च सटीकता प्राप्त करते हैं जबकि अन्य अधिक परिवर्तनशीलता प्रदर्शित करते हैं, जिससे इस एनएलपी (NLP) कार्य पर आर्किटेक्चर, प्रशिक्षण डेटा और प्रॉम्प्ट डिज़ाइन के प्रभाव पर प्रकाश पड़ता है।

मूल लेखक: Mihai Nadas, Laura Diosan

प्रकाशित 2026-07-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mihai Nadas, Laura Diosan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास रोमानियाई टेक्स्ट मैसेज का एक ढेर है, लेकिन किसी ने गलती से उन सभी अक्षरों से विशेष "एक्सेंट" (accent) के निशान मिटा दिए हैं। रोमानियाई में, ये निशान (जैसे ă, î, ș, ț, और â) एक शब्द के अर्थ को बदलने के लिए पर्याप्त हैं—जैसे "खाने" और "सोने" के बीच का अंतर, या "एक गाँव" और "एक शहर" के बीच का अंतर। बिना इनके, टेक्स्ट एक ऐसे मानचित्र की तरह है जिसके सभी सड़क के नाम मिटा दिए गए हों—भ्रमित करने वाला और पढ़ने में कठिन।

इस अध्ययन ने एक बड़ा सवाल पूछा: क्या आज के हर जगह दिखने वाले सुपर-स्मार्ट एआई चैटबॉट्स (जिन्हें लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) इन बिखरे हुए टेक्स्ट को ठीक कर सकते हैं और सही स्थानों पर एक्सेंट वापस लगा सकते हैं?

द ग्रेट एक्सेंट रेस्टोरेशन रेस (द ग्रेट एक्सेंट बहाली की दौड़)

शोधकर्ताओं ने एक विशाल रेस ट्रैक तैयार किया। उन्होंने 2,000 रोमानियाई वाक्यों को इकट्ठा किया और उनके सभी एक्सेंट हटा दिए, जिससे वे एक "खाली स्लेट" बन गए। फिर, उन्होंने प्रसिद्ध एआई मॉडल्स की एक लाइनअप को शुरुआती रेखा पर आमंत्रित किया ताकि यह देखा जा सके कि कौन एक्सेंट को सबसे अच्छी तरह बहाल करता है।

इस लाइनअप में शामिल थे:

  • द हेवीवेट्स (दिग्गज): OpenAI के GPT-3.5, GPT-4, और नया GPT-4o।
  • द गूगल कॉन्टेंडर (गूगल का दावेदार): Gemini 1.0 Pro।
  • द ओपन-सोर्स क्रू (ओपन-सोर्स दल): Meta के Llama 2 और 3 (विभिन्न आकारों में), MistralAI का Mixtral, और कुछ अन्य।
  • द "डमी" बेसलाइन (द डमी बेसलाइन): एक सरल तकनीक जिसे "इको" (Echo) मॉडल कहा गया। इस मॉडल ने कुछ भी ठीक करने की कोशिश नहीं की; इसने बस बिखरे हुए टेक्स्ट को वैसा ही कॉपी कर दिया जैसा वह था। यह "शून्य प्रयास" वाला स्कोर था जिसे सबको पार करना था।

विजेता और पराजित

चैंपियंस:
परिणाम स्पष्ट थे: OpenAI का GPT-4o इस शो का निर्विवाद सितारा था। जब इसे एक विशिष्ट निर्देश (एक "प्रॉम्ट") दिया गया जिसमें तीन उदाहरण शामिल थे कि टेक्स्ट को कैसे ठीक किया जाए, तो इसने 0.9639 का कुल औसत स्कोर (TAS) प्राप्त किया।

इसे समझने के लिए, "इको" बेसलाइन (आलसी कॉपी करने वाला) ने केवल 0.8100 स्कोर किया। इसका मतलब है कि GPT-4o ने केवल थोड़ा बेहतर प्रदर्शन नहीं किया; इसने बेसलाइन से 19% बेहतर प्रदर्शन किया। वास्तव में, सबसे अच्छा प्रदर्शन करने वाला मॉडल (GPT-4o) बेसलाइन से 1.190 गुना बेहतर था। यह एक मास्टर शेफ की तरह था जो व्यंजन को पूरी तरह से मसालेदार बना रहा है, जबकि बेसलाइन ने केवल सादा भोजन परोसा।

चौंकाने वाले संघर्षकर्ता:
यहाँ मामला दिलचस्प हो जाता है। आप सोच सकते हैं कि बड़े या प्रसिद्ध ओपन-सोर्स मॉडल अच्छा करेंगे, लेकिन शोध पत्र कुछ और ही कहता है।

  • Meta का Llama 2 7B पूरी तरह से विफल रहा। इसने 0.002 स्कोर किया, जो बहुत कम है। यह इतना बुरा था कि यह बेसलाइन से 0.002 गुना था। हालांकि यह वास्तव में शून्य नहीं था, लेकिन यह बेसलाइन से पीछे रहने के मामले में प्रभावी रूप से बेकार था, जो एक बड़े अंतर से विफल रहा।
  • Meta का Llama 2 70B (बड़ा संस्करण) थोड़ा बेहतर था लेकिन फिर भी बेसलाइन को हराने में विफल रहा, जिसने 0.146 स्कोर किया।
  • Mixtral 8x7B और RoLlama 2 7B भी बेसलाइन से नीचे रहे, जिसका अर्थ है कि वे टेक्स्ट को ठीक करने में वास्तव में बेसलाइन से भी बदतर थे।

शोध पत्र सुझाव देता है कि आकार हमेशा सफलता की गारंटी नहीं देता। सिर्फ इसलिए कि कोई मॉडल विशाल या ओपन-सोर्स है, इसका मतलब यह नहीं है कि वह रोमानियाई एक्सेंट के जटिल नियमों को संभालने में सक्षम है।

गुप्त हथियार: "प्रॉम्ट" (The Prompt)

अध्ययन ने पाया कि आप AI से कैसे पूछते हैं, यह उतना ही मायने रखता है जितना कि स्वयं AI।

  • "3-शॉट" ट्रिक: सबसे अच्छे परिणाम तब मिले जब शोधकर्ताओं ने काम करने से ठीक पहले AI को तीन उदाहरण दिए कि "बिखरा हुआ टेक्स्ट" कैसा दिखता है और "ठीक किया हुआ टेक्स्ट" कैसा दिखता है। इसे "3-शॉट" प्रॉम्ट कहा जाता है।
  • परिणाम: इस पद्धति का उपयोग करने पर, GPT-4o का स्कोर बढ़ गया। शोध पत्र का सुझाव है कि AI को कुछ उदाहरण देने से (जैसे किसी छात्र को परीक्षा से पहले कुछ हल किए गए गणित के सवाल दिखाना) उसे केवल एक साधारण कमांड देने की तुलना में नियमों को बेहतर ढंग से समझने में मदद मिलती है।

वे कहाँ गलत हुए? (त्रुटि विश्लेषण)

विजेताओं ने भी गलतियाँ कीं, और शोधकर्ताओं ने बारीकी से देखा कि समस्या कहाँ हुई:

  1. â बनाम î का भ्रम: सबसे आम त्रुटि â और î अक्षरों को आपस में मिलाना था। रोमानियाई में, â का उपयोग शब्दों के बीच में किया जाता है, और î का उपयोग शुरुआत या अंत में किया जाता है। AI कभी-कभी बीच में î रख देता था (जैसे romîn लिखना, român के बजाय)। सभी त्रुटियों में से लगभग 21.3% इसी विशिष्ट मिश्रण से आए थे।
  2. कैपिटल लेटर्स (बड़े अक्षर): AI को उन शब्दों के साथ अधिक संघर्ष करना पड़ा जो वाक्य की शुरुआत में थे और कैपिटलाइज्ड थे। उदाहरण के लिए, AI ने लोअरकेस ș पर 98.7% बार एक्सेंट सही लगाया, लेकिन जब यह कैपिटल Ș था, तो केवल 94.6% बार ही सही था।
  3. अत्यधिक उत्साह (Over-Enthusiasm): कुछ मॉडल्स, जैसे Mixtral, बहुत उत्साहित हो गए। उन्होंने वहां भी एक्सेंट जोड़ दिए जहाँ उनकी आवश्यकता नहीं थी। शोध पत्र नोट करता है कि Mixtral ने प्रति 10-शब्दों के वाक्य में औसतन 16.35 अतिरिक्त एक्सेंट जोड़े, जिससे "हैलुसिनेशन" (नकली एक्सेंट) पैदा हुए जिन्होंने टेक्स्ट को और खराब कर दिया।

यह पेपर क्या खारिज करता है

यह पेपर बहुत स्पष्ट है कि क्या काम नहीं करता है:

  • यह इस विचार को खारिज करता है कि "कोई भी" LLM इसके लिए अच्छा है। अध्ययन स्पष्ट रूप से दिखाता है कि कई लोकप्रिय मॉडल (जैसे Llama 2 7B) वास्तव में कुछ न करने से भी बदतर हैं।
  • यह इस विचार को खारिज करता है कि "बड़ा हमेशा बेहतर होता है।" 70-बिलियन-पैरामीटर वाला Llama 2 मॉडल बहुत खराब प्रदर्शन कर गया, जबकि छोटे लेकिन अच्छी तरह से ट्यून किए गए GPT-4o ने शानदार प्रदर्शन किया।
  • यह इस विचार को खारिज करता है कि साधारण कॉपी करना एक वैध समाधान है। "इको" बेसलाइन का उपयोग विशेष रूप से यह दिखाने के लिए किया गया था कि बिना कुछ ठीक किए केवल टेक्स्ट को कॉपी करना एक निम्न स्तर है जिसे कई मॉडल पार करने में विफल रहे, जिससे यह सिद्ध हुआ कि कॉपी करना बहाली के लिए एक प्रभावी रणनीति नहीं है।

हम कितने निश्चित हैं?

लेखक अपने निष्कर्षों के बारे में मापे गए और विशिष्ट हैं। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने अपने मॉडल्स को दो अलग-अलग स्रोतों (एक डिक्शनरी प्रोजेक्ट से और एक वेब क्रॉलर्स से) के 1,000 कथनों के डेटासेट के विरुद्ध चलाया।

  • वे सुझाव देते हैं कि सबसे अच्छे मॉडल्स (GPT-4o) और सबसे खराब (Llama 2 7B) के बीच का अंतर वास्तविक और महत्वपूर्ण है।
  • वे सुझाव देते हैं कि "3-शॉट" प्रॉम्ट रणनीति सफलता का एक प्रमुख कारक है।
  • वे नोट करते हैं कि उनके परिणाम डेटा के एक विशिष्ट उपसमूह (पोस्ट-1993 रोमानियाई नियम) पर आधारित हैं और उन्होंने ऐतिहासिक ग्रंथों या अन्य भाषाओं का परीक्षण नहीं किया है।

निचोड़ (The Bottom Line)

यदि आप रोमानियाई टेक्स्ट के एक्सेंट को ठीक करना चाहते हैं, तो किसी भी AI को न उठाएं। शोध पत्र सुझाव देता है कि OpenAI का GPT-4o, जब इसे पालन करने के लिए कुछ उदाहरण दिए जाते हैं, तो वर्तमान में इस काम के लिए सबसे अच्छा उपकरण है। हालाँकि, कई अन्य लोकप्रिय मॉडल्स अभी भी सीख रहे हैं और वे वास्तव में टेक्स्ट को पहले से अधिक अस्त-व्यस्त बना सकते हैं।

अध्ययन निष्कर्ष निकालता है कि हालांकि AI शक्तिशाली है, फिर भी इसे (अच्छे निर्देशों और उदाहरणों जैसे) थोड़े सहयोग की आवश्यकता होती है ताकि वह रोमानियाई भाषा के सूक्ष्म और सुंदर विवरणों में महारत हासिल कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →