← नवीनतम पेपर
💬 NLP

Continual Learning with Multilingual Foundation Model

यह शोध पत्र एक पुनरुत्पादक, बहु-चरणीय ढांचे को प्रस्तुत करता है जो डेटा की कमी और क्रॉस-लिंग्विस्टिक भिन्नता जैसी चुनौतियों का समाधान करते हुए, अंग्रेजी, स्पेनिश और इतालवी सोशल मीडिया पर पुनः प्राप्त (reclaimed) LGBTQ+ अपशब्दों का प्रभावी ढंग से पता लगाने के लिए XLM-RoBERTa फाउंडेशन मॉडल और डेटा संवर्धन (data augmentation) के लिए GPT-4o-mini बैक-ट्रांसलेशन और भाषा-विशिष्ट थ्रेशोल्ड ऑप्टिमाइज़ेशन का लाभ उठाता है।

मूल लेखक: Barathi Ganesh HB, Michal Ptaszynski, Rene Melendez, Juuso Eronen

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Barathi Ganesh HB, Michal Ptaszynski, Rene Melendez, Juuso Eronen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "संदर्भ का जासूस" (The Context Detective)

कल्पना कीजिए कि आप एक वैश्विक चैट रूम के मॉडरेटर हैं जहाँ लोग अंग्रेजी, स्पेनिश और इतालवी बोलते हैं। कोई एक शब्द टाइप करता है जो पहले एक बहुत बुरा अपमान (गाली) हुआ करता था। अतीत में, आपका काम आसान था: बुरे शब्द = बैन।

लेकिन आज, चीजें जटिल हैं। LGBTQ+ समुदाय ने कुछ शब्दों को "पुनः प्राप्त" (reclaimed) कर लिया है। वे इनका उपयोग गर्व, एकजुटता और प्रेम दिखाने के लिए करते हैं। इसलिए, वही शब्द हेट स्पीच (जब किसी बाहरी व्यक्ति द्वारा चोट पहुँचाने के लिए उपयोग किया जाए) या रिक्लैमेशन (जब समुदाय के सदस्य द्वारा सशक्त बनाने के लिए उपयोग किया जाए) हो सकता है।

समस्या क्या है? कंप्यूटर प्रोग्राम मानवीय बारीकियों (nuance) को समझने में खराब होते हैं। वे अक्सर निर्दोष पोस्ट को बैन कर देते हैं या वास्तविक हेट स्पीच को मिस कर देते हैं। यह पेपर इस पहेली को सुलझाने के लिए बनाई गई एक नई प्रणाली का वर्णन करता है जो तीन भाषाओं के लिए काम करती है।

तीन बड़ी बाधाएं

शोधकर्ताओं को तीन मुख्य बाधाओं का सामना करना पड़ा, जैसे कि टूटे हुए ओवन, बिना आटे और एक ऐसी रेसिपी के साथ केक बनाने की कोशिश करना जो देश के आधार पर बदल जाती है:

  1. डेटा की कमी: "रिकलेमड" शब्दों के उदाहरण "हेट" शब्दों की तुलना में बहुत कम हैं। यह एक दुर्लभ पक्षी को पहचानने के सीखने जैसा है जब आपके पास केवल उसकी तीन तस्वीरें हों, लेकिन कबूतरों की हजारों तस्वीरें हों।
  2. असंतुलन: क्योंकि "रिकलेमड" उदाहरण इतने दुर्लभ हैं, कंप्यूटर आलसी हो जाता है। वह हर बार केवल "Hate" का अनुमान लगाना सीख जाता है क्योंकि यही सबसे आम उत्तर है।
  3. सांस्कृतिक अंतर: अंग्रेजी में किया गया एक मजाक इटालियन में एक धमकी जैसा लग सकता है। स्पेन में जो शब्द गर्व का संकेत देता है, वह इटली में कुछ बिल्कुल अलग मतलब रख सकता है। एक नियम सब पर लागू नहीं होता।

समाधान: एक चार-चरणीय कुकिंग रेसिपी

टीम ने एक "बहु-चरणीय ढांचे" (multistage framework) का निर्माण किया। इसे चार अलग-अलग चरणों में स्वाद लेने और सुधार करने की प्रक्रिया के रूप में सोचें।

चरण 1: सही शेफ चुनना (मॉडल चयन)

सबसे पहले, उन्होंने आठ अलग-अलग "AI शेफ" (प्री-ट्रेंड लैंग्वेज मॉडल्स) का परीक्षण किया ताकि यह देखा जा सके कि सामग्री (ट्वीट्स) को समझने में कौन सबसे अच्छा है। उन्होंने केवल सबसे प्रसिद्ध को नहीं चुना; उन्होंने एक कठोर टेस्ट (क्रॉस-वैलिडेशन) चलाया।

  • विजेता: XLM-RoBERTa। इसे इसलिए चुना गया क्योंकि यह सबसे सुसंगत शेफ था, जो बिना भ्रमित हुए तीनों भाषाओं को अच्छी तरह से संभाल सकता था।

चरण 2: आटा फैलाना (डेटा ऑग्मेंटेशन)

चूंकि उनके पास पर्याप्त "रिकलेमड" उदाहरण नहीं थे, उन्हें और अधिक की आवश्यकता थी। उन्होंने एक स्मार्ट AI अनुवादक (GPT-4o-mini) का उपयोग किया ताकि हर अंग्रेजी ट्वीट को स्पेनिश और इतालवी में अनुवादित किया जा सके, और फिर वापस भी किया जा सके।

  • जादू: इसने केवल कॉपी-पेस्ट नहीं किया; इसने नए, अद्वितीय वाक्य बनाए जिनका अर्थ वही था। इसने उनके प्रशिक्षण डेटा को तीन गुना कर दिया।
  • सुरक्षा जाल: उन्हें अनुपात को बिगाड़ने से सावधान रहना था। उन्होंने एक "डायनेमिक अंडरसैंपलिंग" तकनीक का उपयोग किया। कल्पना कीजिए कि एक शिक्षक टेस्ट ग्रेड कर रहा है: छात्र द्वारा देखे जाने वाले प्रत्येक एक "रिकलेमड" उदाहरण के लिए, शिक्षक उसे तीन "हेट" उदाहरण दिखाता है। यह छात्र को बहुमत से अभिभूत होने से रोकता है और उसे दुर्लभ, महत्वपूर्ण मामलों पर ध्यान देने के लिए मजबूर करता है।

चरण 3: विशेष प्रशिक्षण (डोमेन नॉलेज)

इस दौर में, उन्होंने AI को अंतिम काम करने से पहले विशेष रूप से LGBTQ+ सोशल मीडिया भाषा का "क्रैश कोर्स" दिया। उन्होंने मास्क्ड लैंग्वेज मॉडलिंग (MLM) नामक तकनीक का उपयोग किया।

  • उपमा: कल्पना कीजिए कि एक छात्र है जो सामान्य अंग्रेजी जानता है। परीक्षा से पहले, आप प्राइड परेड के बारे में एक वाक्य में शब्दों को छिपा देते हैं और उनसे गायब शब्दों का अनुमान लगाने के लिए कहते हैं। यह AI को केवल सामान्य व्याकरण नहीं, बल्कि समुदाय के विशिष्ट "वाइब" और स्लैंग को सीखने के लिए मजबूर करता है।

चरण 4: भाषा-विशिष्ट नियम (थ्रेशोल्ड ट्यूनिंग)

यह सबसे आश्चर्यजनक खोज थी। आमतौर पर, AI एक ही "कट-ऑफ लाइन" (जैसे 50%) का उपयोग करता है यह तय करने के लिए कि कुछ हेट स्पीच है या नहीं। यदि कंप्यूटर 51% सुनिश्चित है, तो वह इसे बैन कर देता है।

  • खोज: शोधकर्ताओं ने पाया कि एक नियम सभी भाषाओं के लिए फिट नहीं बैठता।
    • अंग्रेजी: जब AI ने रिकलेमड अंग्रेजी देखी, तो वह बहुत आश्वस्त था। निर्दोष पोस्ट को गलती से बैन करने से बचने के लिए, उन्हें बार बढ़ाना पड़ा (AI को 58% सुनिश्चित होना पड़ा) इससे पहले कि वह इसे फ्लैग करे।
    • इतालवी: रिकलेमड इतालवी शब्दों के साथ AI कम आश्वस्त था क्योंकि सांस्कृतिक संकेत अधिक सूक्ष्म हैं। वास्तविक रिक्लैमेशन को मिस करने से बचने के लिए, उन्हें बार कम करना पड़ा (AI को 42% सुनिश्चित होना पड़ा)।
    • स्पेनिश: यह बिल्कुल बीच में था।
  • परिणाम: प्रत्येक भाषा के लिए "अलार्म की संवेदनशीलता" को समायोजित करके, उन्होंने पूरे मॉडल को फिर से प्रशिक्षित किए बिना अपनी सटीकता में 2-5% का सुधार किया।

उन्होंने क्या पाया (टेस्ट के परिणाम)

इन चार संस्करणों (रन 1 से रन 4) को चलाने के बाद, यहाँ बताया गया है कि क्या हुआ:

  • सिस्टम ने काम किया: अंतिम सिस्टम मानक उपकरणों की तुलना में 'हेट' और 'प्राइड' के बीच अंतर करने में बहुत बेहतर था।
  • "यूनिवर्सल" मिथक: उन्होंने साबित किया कि आप सभी भाषाओं के लिए एक ही "निर्णय सीमा" (decision boundary) का उपयोग नहीं कर सकते। जो अंग्रेजी के लिए काम करता है वह इतालवी के लिए विफल हो जाता है।
  • बचे हुए ग्लिच (कमियां): सिस्टम अभी भी व्यंग्य (विशेष रूप से अंग्रेजी में) और सूक्ष्म सांस्कृतिक आत्मीयता (विशेष रूप से इतालवी में) के साथ संघर्ष करता है।
    • उदाहरण: यदि कोई मजाक में कहता है, "क्या मैं तुम्हें गाली दे सकता हूँ?", तो AI कभी-कभी सोचता है कि वे वास्तव में इसे रिक्लैम कर रहे हैं।
    • उदाहरण: इतालवी में, दोस्त करीबी होने के दिखाने के लिए गालियों का उपयोग कर सकते हैं। AI कभी-कभी इसे मिस कर देता है क्योंकि वह उन स्पष्ट "प्राइड" शब्दों की तलाश कर रहा होता है जो वहां मौजूद नहीं हैं।

निष्कर्ष

यह पेपर दिखाता है कि कंप्यूटर को विभिन्न संस्कृतियों में मानवीय भावनाओं और रिकलेमड शब्दों को समझाने के लिए, आप केवल उस पर डेटा नहीं फेंक सकते। आपको चाहिए:

  1. सही बेस मॉडल चुनें।
  2. संतुलन बिगाड़े बिना अपने डेटा को धीरे से विस्तारित करें।
  3. इसे समुदाय की विशिष्ट "बोली" सिखाएं।
  4. सबसे महत्वपूर्ण: अलग-अलग भाषाओं के लिए अलग-अलग नियम दें।

लेखकों का निष्कर्ष है कि हालांकि उनकी प्रणाली एक बड़ा कदम है, फिर भी कंप्यूटर को इन बातचीत को पूरी तरह से मॉडरेट करने के लिए मानवीय संदर्भ, व्यंग्य और दोस्ती के अनकहे नियमों के बारे में और अधिक सीखने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →