← नवीनतम पेपर
💬 NLP

Data Contamination in Neural Hieroglyphic Translation: A Reproducibility Study

यह अध्ययन प्रकट करता है कि चित्रलिपि-से-जर्मन अनुवाद के लिए पूर्व में रिपोर्ट किया गया 61.5 BLEU स्कोर 2% परीक्षण डेटा संदूषण (contamination) द्वारा कृत्रिम रूप से बढ़ा दिया गया था, और कठोर विसंदूषण (decontamination) के माध्यम से, इस लुप्तप्राय लेखन प्रणाली के लिए 30.9–39.2 BLEU का एक यथार्थवादी आधारभूत प्रदर्शन सीमा स्थापित करता है।

मूल लेखक: Ammar Toutou, Abdelrahman Harb, Christine Basta

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ammar Toutou, Abdelrahman Harb, Christine Basta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके शोध पत्र (paper) की व्याख्या दी गई है।

बड़ी तस्वीर: प्राचीन भाषा अनुवाद में एक "चीट कोड"

कल्पना कीजिए कि आप प्राचीन मिस्र (Ancient Egyptian) की कक्षा की एक अंतिम परीक्षा दे रहे हैं। आपने कड़ी मेहनत की है, लेकिन जब आपको टेस्ट मिलता है, तो आपको एहसास होता है कि शिक्षक ने गलती से आपको वही प्रश्न और उत्तर दे दिए हैं जो आपकी स्टडी गाइड में थे। आप एक बेहतरीन स्कोर प्राप्त करते हैं, इसलिए नहीं कि आपने विषय सीखा है, बल्कि इसलिए क्योंकि आपने उत्तरों को रट लिया था।

हाल ही में प्राचीन मिस्र के चित्रलिपि (hieroglyphs) को जर्मन में अनुवाद करने के बारे में किए गए एक अध्ययन में बिल्कुल यही हुआ। एक पिछली टीम ने दावा किया था कि उनका AI इन प्राचीन ग्रंथों को लगभग सटीक रूपता (61.5 का स्कोर) से अनुवाद कर सकता है। हालाँकि, इस नए पेपर के लेखकों ने उस काम की दोबारा जाँच करने का निर्णय लिया, और उन्हें सिस्टम में एक बड़ा "लीक" (leak) मिला।

जाँच: "लीक" की खोज करना

शोधकर्ताओं ने एक छिपे हुए चीट कोड की तलाश करने वाले जासूसों की तरह काम किया। उन्होंने AI मॉडल और जिस डेटा पर उसे प्रशिक्षित (train) किया गया था, उसे लिया और उनकी तुलना टेस्ट के प्रश्नों से की।

खोज:
उन्होंने पाया कि 32% टेस्ट प्रश्न (50 में से 16) ऐसे थे जिनके उत्तर ट्रेनिंग डेटा में बिल्कुल समान रूप से मौजूद थे।

  • ऐसा क्यों हुआ? प्राचीन मिस्र के ग्रंथ दोहराव वाले वाक्यांशों से भरे होते हैं, जैसे चिकित्सा निर्देश ("इसे बारीक पीसें") या शाही उपाधियाँ। क्योंकि डेटा को बेतरतीब ढंग से विभाजित किया गया था, वही वाक्यांश "स्टडी गाइड" (ट्रेनिंग) और "परीक्षा" (टेस्टिंग) दोनों में पहुँच गया।
  • परिणाम: AI वास्तव में अनुवाद नहीं कर रहा था; वह केवल उन उत्तरों को याद कर रहा था और कॉपी कर रहा था जिन्हें उसने पहले ही देख लिया था।

प्रमाण: "पहले और बाद का" अंतर

यह साबित करने के लिए, शोधकर्ताओं ने AI को वाक्यों के दो अलग-अलग समूहों पर चलाया:

  1. "चीट किया गया" समूह (The "Cheated" Group): वे वाक्य जिन्हें AI पहले देख चुका था।
  2. "साफ" समूह (The "Clean" Group): वे वाक्य जिन्हें AI ने पहले कभी नहीं देखा था।

स्कोर का अंतर:

  • "चीट किए गए" समूह पर: AI ने अविश्वसनीय रूप से उच्च स्कोर (83.8 तक) प्राप्त किया।
  • "साफ" समूह पर: AI का स्कोर नाटकीय रूप से गिरकर एक वास्तविक स्तर (30.9 – 39.2) पर आ गया।

यह एक ऐसे छात्र की तरह है जो उस अभ्यास टेस्ट में A+ पाता है जिसे उसने रटा था, लेकिन नए प्रश्नों वाले वास्तविक टेस्ट में केवल C ग्रेड पाता है। पिछले अध्ययन का 61.5 का स्कोर इन दोनों समूहों का मिश्रण था, जिससे AI वास्तव में जितना बुद्धिमान था, उससे कहीं अधिक स्मार्ट दिखने लगा।

"डेटा को साफ करना" उम्मीद से अधिक कठिन क्यों था?

शोधकर्ताओं ने ट्रेनिंग डेटा से "चीट किए गए" वाक्यों को हटाकर इस समस्या को ठीक करने की कोशिश की। उन्हें लगा कि इससे AI का चीटिंग करना बंद हो जाएगा।

मोड़ (The Twist):
उन विशिष्ट दस्तावेजों को हटाने के बाद भी जिनमें टेस्ट के उत्तर थे, AI अभी भी "चीट किए गए" प्रश्नों पर उच्च स्कोर बना रहा था।

  • कारण: प्राचीन ग्रंथ एक पुस्तकालय की तरह हैं जहाँ एक ही वाक्य कई अलग-अलग पुस्तकों में दिखाई देता है। भले ही आप एक पुस्तक हटा दें, वह वाक्य उस दूसरी पुस्तक में हो सकता है जिसे AI पढ़ रहा है।
  • सबक: आपको केवल पूरा दस्तावेज़ नहीं हटाना चाहिए; चीटिंग रोकने के लिए आपको पूरे डेटासेट से विशिष्ट वाक्य (लक्ष्य उत्तर) को हटाना होगा।

भविष्य के लिए इसका क्या अर्थ है

पेपर यह निष्कर्ष निकालता है कि प्राचीन भाषाओं के लिए, हमें AI का परीक्षण करने के तरीके के बारे में बहुत सावधान रहने की आवश्यकता है।

  1. वास्तविक स्कोर: AI वास्तव में अनुवाद करने में ठीक-ठाक है (30-39 का स्कोर), लेकिन यह कोई चमत्कार करने वाला नहीं है। यह सामान्य विचार को पकड़ लेता है लेकिन विशिष्ट गलतियाँ करता है, जैसे देवताओं के नामों में भ्रमित होना या संख्याओं को गलत लिखना।
  2. चेतावनी: यदि आप किसी प्राचीन भाषा के अनुवाद के लिए उच्च स्कोर देखते हैं, तो जाँच लें कि क्या टेस्ट डेटा ट्रेनिंग डेटा से "दूषित" (contaminated/leaked) हुआ था।
  3. समाधान: लेखकों ने एक नया, "साफ" टेस्ट सेट जारी किया है जिसमें 34 प्रश्न हैं जिन्हें AI ने पहले नहीं देखा है, ताकि भविष्य के शोधकर्ता वास्तविक माप प्राप्त कर सकें कि उनके AI मॉडल वास्तव में कितने बेहतर काम करते हैं।

संक्षेप में: AI टूटा नहीं है, बल्कि टेस्ट गलती से हेरफेर (rigged) किया गया था। एक बार जब हमने टेस्ट को ठीक किया, तो AI का प्रदर्शन एक वास्तविक स्तर पर आ गया, जिससे हमें पता चला कि उसे वास्तव में कहाँ मदद की ज़रूरत है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →