← नवीनतम पेपर
💬 NLP

destroR: A Benchmark and Adversarial-Training Defense for Bangla Transfer Models under Meaning-Preserving Attacks

यह शोध पत्र "destroR" को प्रस्तुत करता है, जो एक एकीकृत पाइपलाइन है जो अर्थ-संरक्षण हमलों (meaning-preserving attacks) के विरुद्ध बांग्ला ट्रांसफर मॉडल्स के लिए पहला व्यापक बेंचमार्क स्थापित करता है और यह प्रदर्शित करता है कि एडवरसैरियल ट्रेनिंग इन मॉडल्स को प्रभावी ढंग से सुदृढ़ करती है, जिससे यह पता चलता है कि MuRIL जैसे बहुभाषी बैकबोन बांग्ला-समर्पित बैकबोन की तुलना में रोबस्टनेस में बेहतर प्रदर्शन करते हैं।

मूल लेखक: Saadat Rafid Ahmed, Rubayet Shareen, Radoan Sharkar, Nazia Hossain, Mansur Mahi, Farig Yousuf Sadeque

प्रकाशित 2026-07-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Saadat Rafid Ahmed, Rubayet Shareen, Radoan Sharkar, Nazia Hossain, Mansur Mahi, Farig Yousuf Sadeque

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट बनाया है जो बांग्ला टेक्स्ट पढ़ता है और अनुमान लगाता है कि कोई व्यक्ति खुश है, दुखी है या तटस्थ (neutral) है। आपको लगता है कि यह एकदम सटीक है क्योंकि यह आपके टेस्ट रूम में लगभग हर बार सही उत्तर देता है। लेकिन क्या होगा अगर कोई चुपके से आपके रोबोट के कान में वाक्य का थोड़ा अलग संस्करण फुसफुसा दे? अर्थ एक इंसान के कान के लिए बिल्कुल वही रहता है, लेकिन रोबोट अचानक घबरा जाता है और गलत भावना का अनुमान लगाने लगता है।

यही वह समस्या है जिसे destroR हल करता है। BRAC यूनिवर्सिटी के शोधकर्ताओं ने यह देखना चाहा कि ये बांग्ला AI मॉडल वास्तव में कितने "भंगुर" (brittle) हैं और क्या उन्हें मजबूत बनाया जा सकता है। उन्होंने केवल कमियां ही नहीं निकालीं; उन्होंने रोबोटों को प्रशिक्षण देने के लिए एक पूरा जिम बनाया।

रोबोट को चकमा देने के तीन तरीके

टीम ने AI को भ्रमित करने के लिए तीन विशेष "प्रैंक" (मजाक) का आविष्कार किया, बिना वास्तविक कहानी बदले। इन्हें वाक्य को फिर से लिखने के विभिन्न तरीकों के रूप में सोचें ताकि एक इंसान वही अर्थ पढ़े, लेकिन रोबोट को चक्कर आ जाए:

  1. पैराफ्रेज़ प्रैंक (The Paraphrase Prank): उन्होंने वाक्य को अलग शब्दों और संरचनाओं का उपयोग करके फिर से लिखने के लिए एक टूल का उपयोग किया, जैसे "I loved the film" के बजाय "The movie was great" कहना। अर्थ समान है, लेकिन रोबंगी एक बिल्कुल नया पैटर्न देखता है।
  2. बैक-ट्रांसलेशन लूप (The Back-Translation Loop): उन्होंने बांग्ला वाक्य लिया, उसे अंग्रेजी में अनुवाद किया, और फिर उसे वापस बांग्ला में अनुवाद किया। क्योंकि अनुवाद उपकरण (translation tools) पूर्ण नहीं होते, वाक्य एक थोड़े अलग स्वाद या संरचना के साथ वापस आता है, जैसे "टेलीफोन" का खेल जहाँ व्याकरण अनजाने में बदल जाता है लेकिन भाव (vibe) वही रहता है।
  3. वर्ड-स्वैप स्वैप (The Word-Swap Swap): यह थोड़ा अधिक चालाकी भरा है। उन्होंने उन विशिष्ट शब्दों की पहचान की जिन पर रोबोट जुनूनी था (biased tokens) और उन्हें अन्य शब्दों से बदल दिया जो संदर्भ में फिट बैठते हैं लेकिन रोबोट का संतुलन बिगाड़ सकते हैं।

बड़ा आश्चर्य: बड़ा होना हमेशा बेहतर नहीं होता

यहाँ वह मोड़ आया जिसने शोधकर्ताओं को चौंका दिया। आप सोच सकते हैं कि विशेष रूप से बांग्ला के लिए बनाया गया रोबोट सबसे मजबूत होगा। लेकिन डेटा ने इसके विपरीत दिखाया।

MuRIL मॉडल—एक बहुभाषी रोबोट जिसे कई भारतीय भाषाओं पर प्रशिक्षित किया गया है—सबसे मजबूत खिलाड़ी साबित हुआ। इसने बांग्ला के लिए बनाए गए मॉडलों (जैसे BanglaBERT) की तुलना में खुद को बेहतर तरीके से संभाला। यह एक विशिष्ट पेचकश (screwdriver) की तुलना में स्विस आर्मी नाइफ के अधिक टिकाऊ होने जैसा है। शोधकर्ताओं का सुझाव है कि ऐसा इसलिए है क्योंकि MuRel के पास एक बड़ा और अधिक विविध शब्दकोश है जो हमलावरों के लिए उन कमजोर, पक्षपाती शब्दों को खोजने और उनका फायदा उठाने को कठिन बनाता है।

"जिम" रक्षा: एडवरसेरियल ट्रेनिंग (Adversarial Training)

तो, आसानी से भ्रमित होने वाले रोबोट को कैसे ठीक करें? आप केवल पैच नहीं लगाते; आप उसे प्रशिक्षित करते हैं।

एक बॉक्सर की कल्पना करें। यदि वे केवल एक प्रकार के पंच के खिलाफ प्रशिक्षण लेते हैं, तो वे दूसरे प्रकार के पंच से ढेर हो जाएंगे। लेकिन यदि आप अभ्यास के दौरान उन पर हर तरह के पंच चलाते हैं, तो वे किसी भी चीज़ से बचने के लिए सीख जाते हैं। शोधकर्ताओं ने मॉडलों को हजारों ऐसे "धोखेबाज" वाक्यों के साथ प्रशिक्षित किया।

परिणाम? यह काम कर गया। जब उन्होंने मॉडलों को सभी अलग-अलग प्रकार के हमलों के मिश्रण (union of all attack families) पर प्रशिक्षित किया, तो रोबोट को बेवकूफ बनाना बहुत कठिन हो गया। सभी के लिए हमलों की सफलता दर काफी कम हो गई।

आंकड़े झूठ नहीं बोलते (लेकिन कुछ हमले अधिक शक्तिशाली हैं)

शोधकर्ताओं ने पाँच अलग-अलग मॉडलों और चार अलग-अलग डेटासेट पर ये परीक्षण किए। प्रशिक्षण के बाद स्कोरबोर्ड ऐसा दिखता था:

  • द हैवी हिटर्स (The Heavy Hitters): प्रशिक्षण के बाद भी, अंग्रेजी जगत के सबसे मजबूत हमले (जिन्हें TextFooler और BAE कहा जाता है) अभी भी बहुत प्रभावशाली थे। BAE ने मॉडलों को 54.2% बार चकमा दिया, और TextFooler ने 32.1% बार। ये हमले उन मास्टर चोरों की तरह हैं जो जानते हैं कि किस ताले को कैसे खोलना है।
  • द बांग्ला रेसिपीज़ (The Bangla Recipes): टीम के अपने बांग्ला-विशिष्ट प्रैंक थोड़े हल्के थे। Back-Translation हमला 21.5% बार सफल रहा, और Paraphrase हमला 15.3% बार सफल रहा।
  • द वन-हॉट ग्लिच (The One-Hot Glitch): वर्ड-स्वैप हमले (पहले बताया गया तीसरा तरीका) लगभग विफल रहा, जिसकी सफलता दर केवल 0.2% थी। शोधकर्ता स्वीकार करते हैं कि बांग्ला के लिए यह रेसिपी "कमजोर" थी क्योंकि उनके द्वारा उपयोग किए गए शब्द बदलने वाले टूल (जो कई भाषाओं पर प्रशिक्षित था) ने बांग्ला में अच्छे प्रतिस्थापन नहीं खोजे। यह एक विशिष्ट बांग्ला शब्द को एक सामान्य अंग्रेजी समानार्थी शब्द से बदलने की कोशिश करने जैसा है जो बस फिट नहीं बैठता।

इसका क्या अर्थ है

यह पेपर यह दावा नहीं करता कि उन्होंने AI सुरक्षा की समस्या को "हल" कर दिया है। इसके बजाय, उन्होंने एक बेंचमार्क (मानक परीक्षण) और एक रक्षा बनाई है जो वास्तव में काम करती है। उन्होंने दिखाया कि:

  1. वर्तमान में बांग्ला मॉडल चतुर हमलों के प्रति काफी नाजुक हैं।
  2. हमलों के मिश्रण पर प्रशिक्षण उन्हें बहुत अधिक मजबूत बनाता है।
  3. कभी-कभी, एक बहुभाषी मॉडल (MuRIL) एक भाषा-विशिष्ट मॉडल की तुलना में अधिक मजबूत होता है।

उन्होंने अपना सारा कोड, डेटा और मॉडल जारी कर दिया है ताकि कोई भी उन्हें तोड़ने या बेहतर बचाव बनाने की कोशिश कर सके। यह समुदाय के लिए एक खुला निमंत्रण है कि वे रोबोट को तेज बनाए रखें, क्योंकि AI की दुनिया में, केवल "स्मार्ट" होना ही काफी नहीं है—आपको "मजबूत" भी होना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →