← नवीनतम पेपर
💬 NLP

Obscuring Data Contamination Through Translation: Evidence from Arabic Corpora

यह शोध पत्र प्रकट करता है कि अंग्रेजी बेंचमार्क का अरबी में अनुवाद करना पारंपरिक पहचान संकेतों को दबाकर लार्ज लैंग्वेज मॉडल्स (LLMs) में डेटा संदूषण (data contamination) को छिपा सकता है, जिससे लेखक एक नई "अनुवाद-जागरूक संदूषण पहचान" (Translation-Aware Contamination Detection) विधि प्रस्तावित करते हैं जो कई अनुवादित बेंचमार्क वेरिएंट्स के बीच प्रदर्शन की तुलना करके रटने (memorization) की विश्वसनीय रूप से पहचान करती है।

मूल लेखक: Chaymaa Abbas, Nour Shamaa, Mariette Awad

प्रकाशित 2026-01-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chaymaa Abbas, Nour Shamaa, Mariette Awad

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो एक छात्र के वास्तविक ज्ञान का परीक्षण करने की कोशिश कर रहे हैं। आप उन्हें एक बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) देते हैं। यदि छात्र ने पहले से ही उत्तर कुंजी (answer key) को गुप्त रूप से याद कर लिया है, तो वह एक आदर्श स्कोर प्राप्त करेगा, लेकिन आपको पता नहीं चलेगा कि छात्र ने वास्तव में सामग्री सीखी है या केवल नकल की है। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इस तरह की नकल को डेटा कंटामिनेशन (data contamination) कहा जाता है।

यह शोध पत्र एक नए और चालाक तरीके की जांच करता है जिससे AI मॉडल शायद "नकल" कर सकते हैं जिसे शोधकर्ताओं ने पहले पूरी तरह से नहीं देखा था: अनुवाद (translation)

यहाँ शोधकर्ताओं ने जो पाया है, उसकी कहानी सरल भाषा में दी गई है:

1. समस्या: "नकल करने वाला" छात्र

AI मॉडल इंटरनेट से बड़ी मात्रा में टेक्स्ट पर प्रशिक्षित होते हैं। कभी-कभी, इन मॉडलों को ग्रेड देने के लिए उपयोग किए जाने वाले परीक्षण प्रश्न गलती से उनके प्रशिक्षण डेटा (training data) में शामिल हो जाते हैं।

  • पुराना तरीका: यदि कोई AI प्रशिक्षण के दौरान अंग्रेजी में एक प्रश्न देखता है, तो वह उसे याद कर लेता है। जब बाद में अंग्रेजी में उसका परीक्षण किया जाता है, तो वह बस उत्तर बता देता है। शोधकर्ताओं के पास इसे पकड़ने के लिए उपकरण हैं, जैसे यह जांचना कि क्या AI बहुत अधिक आत्मविश्वासी है या क्या उसे उत्तरों के सटीक क्रम की याद है।
  • नई चाल: शोधकर्ताओं ने पूछा, "क्या होगा यदि हम AI को दिखाने से पहले प्रश्न का अरबी में अनुवाद कर दें?" उन्हें संदेह था कि यह एक भेष (disguise) की तरह काम कर सकता है। यदि AI प्रशिक्षण के दौरान अरबी में प्रश्न देखता है, लेकिन बाद में अंग्रेजी में परीक्षण किया जाता है, तो क्या यह "नकल" को छिपा सकता है?

2. प्रयोग: "भेष"

शोधकर्ताओं ने चार अलग-अलग AI मॉडलों को लिया और उन्हें एक विशेष प्रशिक्षण आहार दिया:

  • आहार: उन्होंने मॉडलों को अंग्रेजी प्रश्नों और उन्हीं प्रश्नों के अरबी अनुवादों का मिश्रण खिलाया।
  • परीक्षण: इसके बाद उन्होंने मॉडलों का मूल अंग्रेजी प्रश्नों पर परीक्षण किया।

आश्चर्य:
भले ही मॉडलों का परीक्षण अंग्रेजी में किया गया था, लेकिन उन्होंने अंग्रेजी टेस्ट में बेहतर प्रदर्शन किया क्योंकि उन्होंने अधिक अरबी प्रशिक्षण डेटा देखा था।

  • उपमा (Analogy): कल्पना कीजिए कि एक छात्र ने फ्रांसीसी भाषा में लिखे गए गणित के सवाल को याद कर लिया है। जब वह अंग्रेजी में परीक्षा देता है, तो वह केवल अनुमान नहीं लगाता; वह किसी तरह तर्क या उत्तर के पैटर्न को "याद" कर लेता है, भले ही शब्द अलग हों। अनुवाद ने नकल को रोका नहीं; इसने केवल इसे पहचानना कठिन बना दिया।

3. पुराने डिटेक्टर क्यों विफल रहे

शोधकर्ताओं ने अपने सामान्य "झूठ पकड़ने वाले यंत्रों" (यानी वे तरीके जो याद रखने/memorization की जांच करते हैं) का उपयोग किया, लेकिन वे विफल रहे।

  • उपमा: यह एक चोर को पकड़ने के लिए विशिष्ट लाल टोपी देखने जैसा है। चोर (AI) ने अपनी टोपी बदलकर नीली (अरबी अनुवाद) कर ली। डिटेक्टर ने लाल टोपी की तलाश की, उसे नहीं देखा, और कहा, "यहाँ कोई नकल नहीं हुई!" लेकिन चोर अभी भी अपने कपड़ों के नीचे वही पुराना लिबास पहने हुए था।
  • अनुवाद ने डेटा के "सतह" (शब्दों) को बदल दिया, लेकिन AI ने अभी भी डेटा की "आत्मा" (उत्तर पैटर्न) को याद रखा।

4. नया समाधान: "अनुवाद-जागरूक" जासूस

इस चालाक नकल को पकड़ने के लिए, शोधकर्ताओं ने एक नई विधि विकसित की जिसे ट्रांसलेशन-अवेयर कंटामिनेशन डिटेक्शन (TACD) कहा जाता है।

केवल अंग्रेजी टेस्ट को देखने के बजाय, TACD एक "त्रिकोणीयकरण" (triangulation) जांच करता है:

  1. टेस्ट का अनुवाद करें: यह उसी प्रश्न को लेकर उसे अरबी और फ्रेंच में अनुवादित करता है।
  2. उत्तरों को मिला दें (Shuffle): यह बहुविकल्पीय उत्तरों के क्रम (A, B, C, D) को उलट-पुलट देता है ताकि AI केवल स्थिति के आधार पर "उत्तर C" का अनुमान न लगा सके।
  3. परिणामों की तुलना करें: यह AI से वही प्रश्न अंग्रेजी, अरबी और फ्रेंच में पूछता है।

यह नकल को कैसे पकड़ता है:

  • ईमानदार छात्र: यदि AI वास्तव में सोच रहा है, तो नए संदर्भ के कारण भाषा या बदले हुए क्रम के आधार पर उसका उत्तर थोड़ा बदल सकता है।
  • नकल करने वाला छात्र: यदि AI याद रखने (memorization) पर निर्भर है, तो वह अंग्रेजी, अरबी या फ्रेंच में प्रश्न पूछने पर, या उत्तरों के क्रम को बदलने पर भी बिल्कुल एक जैसा उत्तर देगा। यह एक रोबोट की तरह है जो एक ही लूप में फंसा हुआ है।

5. उन्होंने क्या पाया

  • "अंध बिंदु" (Blind Spot): अनुवाद पारंपरिक डिटेक्टरों के लिए एक आंखों पर पट्टी बांधने जैसा है। आप अनुवाद करके कंटामिनेशन को छिपा सकते हैं, लेकिन AI इससे लाभ उठाता है।
  • "धूम्रपान का सबूत" (Smoking Gun): नई TACD विधि ने सफलतापूर्वक नकल को पकड़ लिया। इसने गौर किया कि जब AI ने अरबी अनुवाद देखे थे, तो वह सभी भाषाओं में और बदले हुए प्रारूपों में भी अजीब तरह से सुसंगत (consistent) हो गया था। यह निरंतरता (consistency) तर्क (reasoning) का नहीं, बल्कि याद रखने (memorization) का संकेत थी।

मुख्य निष्कर्ष

शोध पत्र का निष्कर्ष है कि अनुवाद, नकल के लिए इलाज नहीं है। सिर्फ इसलिए कि एक AI का परीक्षण अंग्रेजी में किया जा रहा है, इसका मतलब यह नहीं है कि उसने दूसरी भाषा में उत्तर याद नहीं किए हैं।

यह सुनिश्चित करने के लिए कि AI वास्तव में बुद्धिमान है और केवल एक "नकल करने वाला छात्र" नहीं है, हमें केवल अंग्रेजी परीक्षणों को देखना बंद करना होगा। हमें यह जांचने की आवश्यकता है कि क्या AI विभिन्न भाषाओं और बदले हुए प्रारूपों में सुसंगत (या असंगत) व्यवहार करता है, ताकि यह देखा जा सके कि वह वास्तव में सामग्री को समझ रहा है या केवल एक रटे हुए स्क्रिप्ट को दोहरा रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →