← नवीनतम पेपर
💬 NLP

Large Language Models as Annotators for Machine Translation Quality Estimation

यह शोध पत्र एक विशेष प्रॉम्प्ट (PPbMQM) के माध्यम से सरलीकृत MQM-शैली के एनोटेशन उत्पन्न करने के लिए GPT-4o का उपयोग करने का प्रस्ताव करता है ताकि एक COMET मॉडल को प्रशिक्षित किया जा सके, जिससे बड़े भाषा मॉडलों (LLMs) को सीधे लागू करने की उच्च अनुमान लागतों को कम करते हुए प्रतिस्पर्धी मशीन अनुवाद गुणवत्ता अनुमान प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Sidi Wang, Sophie Arnoult, Amir Kamran

प्रकाशित 2026-03-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sidi Wang, Sophie Arnoult, Amir Kamran

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल अनुवाद फैक्ट्री चला रहे हैं। आपके पास हर दिन चीनी से अंग्रेजी (या अंग्रेजी से जर्मन) में अनुवाद किए जाने वाले हजारों वाक्य हैं। लेकिन आप यह कैसे जानेंगे कि अनुवाद अच्छे हैं या नहीं, बिना विशेषज्ञों की एक सेना को हर एक वाक्य पढ़ने के लिए नियुक्त किए? यहीं पर मशीन ट्रांसलेशन क्वालिटी एस्टीमेशन (QE) काम आता है। यह एक क्वालिटी कंट्रोल रोबोट की तरह है जो हर अनुवाद को तुरंत एक स्कोर देता है।

लंबे समय तक, इन रोबोटों को इंसानों द्वारा ग्रेड किए गए डेटा पर प्रशिक्षित करने की आवश्यकता थी। लेकिन इंसान महंगे और धीमे होते हैं। हाल ही में, हमने लार्ज लैंग्वेज मॉडल्स (LLMs) की खोज की है—GPT-4 जैसे सुपर-स्मार्ट AI—जो इतने कुशल हैं कि वे स्वयं अनुवादों को ग्रेड कर सकते हैं।

समस्या:
इन सुपर-स्मार्ट AI का उपयोग हर अनुवाद को ग्रेड करने के लिए करना वैसा ही है जैसे एक कैफेटेरिया में हर एक सैंडविच को चखने के लिए एक नोबेल पुरस्कार विजेता शेफ को काम पर रखना। यह बहुत महंगा और धीमा है। इसके अलावा, यदि आप शेफ से केवल एक स्कोर देने के लिए कहते हैं (जैसे "10 में से 7"), तो वे असंगत या बहुत अधिक सख्त हो सकते हैं।

समाधान:
यह पेपर एक चतुर वर्कअराउंड प्रस्तावित करता है: एक "शिक्षक" के रूप में सुपर-स्मार्ट AI का उपयोग करके एक "छात्र" रोबोट को प्रशिक्षित करें।

यहाँ उनकी कहानी दी गई है कि उन्होंने इसे कैसे किया, कुछ मजेदार उपमाओं का उपयोग करते हुए:

1. "अति-आलोचनात्मक शेफ" (LLM की समस्या)

शोधकर्ताओं ने सबसे पहले AI (GPT-4) को एक अनुवादक के रूप में कार्य करने और गलतियाँ खोजने के लिए कहा। उन्होंने पाया कि AI बहुत अधिक आलोचनात्मक था।

  • उपमा: कल्पना कीजिए कि एक मानव संपादक कहता है, "यह वाक्य ठीक है।" हालाँकि, AI कहता है, "यह वाक्य ठीक है, लेकिन कॉमा थोड़ा गलत है, लहजा थोड़ा सख्त है, और शब्द 'the' बेहतर हो सकता था।"
  • AI "भूतिया त्रुटियाँ" (ghost errors) ढूंढ रहा था—छोटी, विवादास्पद गलतियाँ जिन्हें इंसान शायद नोटिस भी न करें। इसने स्कोर को बहुत कठोर बना दिया और यह मानवीय राय से मेल नहीं खा रहा था।

2. "सरलीकृत रूब्रिक" (सुधार)

इस अति-आलोचनात्मक AI को ठीक करने के लिए, शोधकर्ताओं ने केवल स्कोर नहीं मांगा। उन्होंने AI को MQM (मल्टीडायमेंशनल क्वालिटी मेट्रिक्स) नामक प्रणाली पर आधारित एक सरलीकृत चेकलिस्ट दी।

  • पुराना तरीका: AI से हर सूक्ष्म बारीकी पर 10 पन्नों का निबंध लिखने के लिए कहना।
  • नया तरीका (PPbMQM): AI को केवल शीर्ष श्रेणियों के साथ एक सरलीकृत मेनू देना: सटीकता (Accuracy), प्रवाह (Fluency), शैली (Style), शब्दावली (Terminology), और चूक (Omission) (छूटे हुए शब्द)।
  • गंभीरता का पैमाना (The Severity Scale): केवल "प्रमुख" या "मामूली" त्रुटि कहने के बजाय, उन्होंने AI से त्रुटियों को 1 से 5 के पैमाने पर रेट करने के लिए कहा।
    • 1-3: "यह थोड़ा अजीब है, लेकिन मैं इसे जाने देता हूँ।" (मामूली)
    • 4-5: "यह एक आपदा है, यह अर्थ बदल देता है।" (प्रमुख)

इसने AI को मजबूर किया कि वह केवल त्रुटि को पहचानने के बजाय इस बारे में गहराई से सोचे कि एक त्रुटि वास्तव में कितनी बुरी थी।

3. "शिक्षक-छात्र" गतिशीलता

एक बार जब उन्होंने AI के "शिक्षक" प्रॉम्प्ट (जिसे PPbMQM कहा जाता है) को ट्यून कर लिया, तो उन्होंने इसका उपयोग हजारों अभ्यास समस्याओं को उत्पन्न करने के लिए किया।

  • शिक्षक (GPT-4): एक अनुवाद पढ़ता है, नए चेकलिस्ट का उपयोग करके वास्तविक गलतियाँ ढूंढता है, और एक विस्तृत रिपोर्ट लिखता है।
  • छात्र (COMET): एक छोटा, तेज़ और सस्ता AI मॉडल। यह शिक्षक की रिपोर्ट पढ़ता है और सीखता है: "ओह, तो जब AI सटीकता की त्रुटि पर 'सेवेरिटी 5' कहता है, तो इसका मतलब है कि अनुवाद खराब है। जब यह 'सेवेरिटी 2' कहता है, तो यह वास्तव में ठीक है।"

4. परिणाम: एक सुपर-कुशल क्वालिटी कंट्रोल रोबोट

"छात्र" मॉडल (COMET) को "शिक्षक" के सिंथेटिक डेटा पर प्रशिक्षित किया गया था।

  • परिणाम: छात्र मॉडल अनुवाद की गुणवत्ता का अनुमान लगाने में अविश्वसनीय रूप से कुशल हो गया।
  • जादू: इसने उन मॉडलों के समान प्रदर्शन किया जिन्हें महंगे मानवीय डेटा पर प्रशिक्षित किया गया था, लेकिन इसे AI द्वारा उत्पन्न डेटा पर प्रशिक्षित किया गया था।
  • बोनस: छात्र मॉडल वास्तव में मानव-प्रशिक्षित मॉडलों की तुलना में बहुत खराब अनुवादों (निम्न गुणवत्ता वाले खंडों) को पहचानने में बेहतर था। यह स्वचालित पोस्ट-एडिटिंग के लिए बहुत बड़ा है, जहाँ आपको तुरंत पता होना चाहिए कि किन वाक्यों को सुधारने के लिए मानव की आवश्यकता है।

एक वाक्य में सारांश

शोधकर्ताओं ने एक सुपर-स्मार्ट, महंगे AI को एक सख्त लेकिन निष्पक्ष शिक्षक बनने के लिए सिखाया, उसके होमवर्क का उपयोग करके एक तेज़, सस्ते छात्र रोबोट को प्रशिक्षित किया, और अब वह छात्र रोबोट एक मानव विशेषज्ञ की तरह ही लगभग उतना ही अच्छा अनुवाद ग्रेड कर सकता है, जिससे समय और पैसे की बचत होती है।

यह क्यों मायने रखता है?
इसका मतलब है कि हम उन भाषाओं के लिए बेहतर अनुवाद उपकरण बना सकते हैं जहाँ हमारे पास डेटा को ग्रेड करने के लिए पर्याप्त मानव विशेषज्ञ नहीं हैं। हम AI को AI को सिखाने के लिए उपयोग कर सकते हैं, जिससे गुणवत्ता सुधार का एक स्व-संचालित चक्र बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →