← नवीनतम पेपर
💬 NLP

The Translation Tax Is Not a Scalar: A Counterfactual Audit of English-Source Cue Inheritance in Chinese Multilingual Benchmarks

यह शोध पत्र यह प्रदर्शित करके अंग्रेजी-से-चीनी बेंचमार्क में एक समान "अनुवाद कर" (Translation Tax) की धारणा को चुनौती देता है कि स्कोर मुद्रास्फीति एक स्केलर प्रभाव नहीं है बल्कि विशिष्ट वैधता जोखिमों और मॉडल-परिवार अंतःक्रियाओं द्वारा संचालित एक जटिल, मद-निर्भर घटना है, और अंततः इन सूक्ष्म मुद्दों को संबोधित करने के लिए एक नया स्वाभाविककरण प्रोटोकॉल और रिपोर्टिंग चेकलिस्ट प्रस्तावित करता है।

मूल लेखक: Zezheng Lin, Fengming Liu, Handi Li

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zezheng Lin, Fengming Liu, Handi Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी भाषा में परीक्षा दे रहे हैं जिसमें आप पूरी तरह कुशल नहीं हैं। परीक्षा के प्रश्न मूल रूप से अंग्रेजी में लिखे गए थे, लेकिन किसी ने उन्हें आपकी भाषा (चीनी) में अनुवादित कर दिया है।

AI अनुसंधान की दुनिया में एक सामान्य डर है जिसे "ट्रांसलेशन टैक्स" (Translation Tax) कहा जाता है। विचार यह है कि जब आप किसी चीज़ का अनुवाद करते हैं, तो अनुवाद एकदम सटीक नहीं होता। इसमें मूल अंग्रेजी के कुछ छोटे "भूत" या "सुराग" पीछे छूट जाते हैं। डर यह है कि AI मॉडल वास्तव में चीनी भाषा को समझ नहीं रहे हैं; इसके बजाय, वे इन अंग्रेजी "भूतों" को पकड़ रहे हैं और सही उत्तर पाने के लिए उन्हें 'चीट कोड' की तरह इस्तेमाल कर रहे हैं, जिससे उनके स्कोर कृत्रिम रूप से बढ़ जाते हैं।

यह शोध पत्र एक सरल प्रश्न पूछता है: क्या यह "ट्रांसलेशन टैक्स" एक एकल, निश्चित संख्या है जिसे हम सभी के स्कोर से घटा सकते हैं? या यह एक जटिल और उलझी हुई स्थिति है जो विशिष्ट प्रश्न और विशिष्ट AI पर निर्भर करती है?

यहाँ बताया गया है कि लेखकों ने क्या पाया, जिसे कुछ रोजमर्रा के उदाहरणों के माध्यम से समझाया गया है:

1. "भूत" की खोज (बैक-ट्रांसलेशन टेस्ट)

शोधकर्ताओं ने AI को नकल करते हुए पकड़ने की कोशिश की। उन्होंने चीनी प्रश्नों को लिया, उन्हें वापस अंग्रेजी में अनुवादित किया, और AI से वही प्रश्न फिर से पूछे।

  • उदाहरण: कल्पना कीजिए कि आपने अंग्रेजी से फ्रेंच में एक रेसिपी का अनुवाद किया, और फिर वापस अंग्रेजी में। यदि सामग्री की सूची थोड़ी बदल जाती है (जैसे, "मक्खन" बदलकर "मार्जरीन" हो जाता है), तो आप जानते हैं कि अनुवाद में कुछ जानकारी खो गई है।
  • निष्कर्ष: "भूत" मौजूद थे, लेकिन वे बहुत मामूली थे। जब AI ने "बैक-ट्रांसलेटेड" संस्करण देखा, तो उसके स्कोर में केवल थोड़ी ही गिरावट आई। यह एक चीनी प्लेट पर छोड़े गए अंग्रेजी के कुछ टुकड़ों को खोजने जैसा है, लेकिन यह साबित करने के लिए पर्याप्त नहीं है कि AI बड़े पैमाने पर नकल कर रहा है।

2. "नेटिव बनाम फॉरेन" तुलना

उन्होंने इन अनुवादित परीक्षणों पर AI के स्कोर की तुलना उन परीक्षणों के स्कोर से की जो मूल रूप से चीनी में लिखे गए थे (अनुवादित नहीं)।

  • उदाहरण: कल्पना कीजिए कि आप एक छात्र के अनुवादित इतिहास टेस्ट के स्कोर की तुलना एक स्थानीय शिक्षक द्वारा लिखे गए टेस्ट से कर रहे हैं।
  • निष्कर्ष: यह कोई सरल कहानी नहीं थी। चीनी भाषा के लिए डिज़ाइन किए गए कुछ AI मॉडल वास्तव में मूल (नेटिव) परीक्षणों की तुलना में अनुवादित परीक्षणों पर बुरे प्रदर्शन करते थे। इससे पता चलता है कि "ट्रांसलेशन टैक्स" कोई सार्वभौमिक बोनस नहीं है; कभी-कभी, अनुवाद वास्तव में कुछ मॉडलों के लिए चीजों को कठिन या भ्रमित करने वाला बना देता है।

3. "मैजिक रीराइट" (द स्ट्रेस टेस्ट)

यह सबसे चतुर हिस्सा था। शोधकर्ताओं ने विशिष्ट चीनी प्रश्नों को लिया और एक AI से उन्हें अधिक स्वाभाविक बनाने के लिए "पुनर्लेखन" (रीराइट) करने को कहा, बिना अर्थ, उत्तर, या विकल्पों को बदले।

  • उदाहरण: कल्पना कीजिए कि एक छात्र एक ऐसे टेस्ट दे रहा है जहाँ प्रश्न एक सख्त, रोबोटिक शैली में लिखे गए हैं। आप एक मित्र से उन प्रश्नों को एक सामान्य मानवीय बातचीत की तरह लिखने के लिए कहते हैं, लेकिन आप उत्तरों को बिल्कुल वैसा ही रखते हैं। यदि पुनर्लेखन के बाद छात्र अचानक सही उत्तर देने लगता है, तो इसका मतलब है कि वह अनुवाद की शैली से भ्रमित था, न कि विषय-वस्तु से।
  • निष्कर्ष:
    • "साफ" (Clean) प्रश्नों के लिए: यदि अनुवाद पहले से ही अच्छा था, तो पुनर्लेखन ने AI के स्कोर को नहीं बदला।
    • "गंदे" (Dirty) प्रश्नों के लिए: यदि अनुवाद में वे "अंग्रेजी भूत" (उच्च अवशेष) थे, तो पुनर्लेखन के बाद AI का स्कोर बढ़ गया।
    • मोड़: शोधकर्ताओं ने अपने स्वयं के कंप्यूटर कोड में एक बग (फॉर्मेटिंग त्रुटि) पाया, जिससे ऐसा लगा कि अलग-अलग AI परिवार बहुत अलग व्यवहार कर रहे हैं। एक बार जब उन्होंने इस बग को ठीक कर दिया, तो "पारिवारिक अंतर" गायब हो गए। केवल एक ही चीज़ बची रही: खराब अनुवाद प्रदर्शन को नुकसान पहुँचाते हैं, और उन्हें ठीक करने से मदद मिलती है।

मुख्य निष्कर्ष

यह शोध पत्र तर्क देता है कि "ट्रांसलेशन टैक्स" एक एकल संख्या नहीं है (जैसे, "सभी के स्कोर से 5% घटा दें")।

इसके बजाय, इसे सड़क पर गड्ढों की तरह समझें:

  • कुछ सड़कें (कुछ AI मॉडल) ठीक हैं।
  • कुछ कारें (कुछ AI मॉडल) गड्ढों को संभालने में दूसरों की तुलना में बेहतर होती हैं।
  • कुछ गड्ढे (खराब अनुवादित प्रश्न) गहरे हैं और दुर्घटना का कारण बनते हैं।
  • कुछ गड्ढे केवल एक मामूली उभार मात्र हैं।

आप पूरे रास्ते पर केवल एक "टैक्स" का बोर्ड नहीं लगा सकते। आपको यह देखने के लिए कि क्या हो रहा है, प्रत्येक विशिष्ट गड्ढे (प्रत्येक प्रश्न) और प्रत्येक विशिष्ट कार (प्रत्येक AI मॉडल) को देखना होगा।

संक्षेप में: अनुवादित परीक्षण पूर्ण नहीं हैं, और उनमें मूल अंग्रेजी के सुराग होते हैं, लेकिन इसका प्रभाव छोटा, असंगत है, और पूरी तरह से इस बात पर निर्भर करता है कि आप किस प्रश्न और किस AI का परीक्षण कर रहे हैं। इसे ठीक करने के लिए कोई एक "जादुई संख्या" नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →