← नवीनतम पेपर
💬 NLP

inversedMixup: Data Augmentation via Inverting Mixed Embeddings

यह शोध पत्र inversedMixup का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो टास्क-विशिष्ट और LLM एम्बेडिंग स्पेस को संरेखित करके लेटेंट एम्बेडिंग इंटरपोलेशन और डिस्क्रीट टोकन जनरेशन के बीच के अंतर को पाटता है ताकि मैनिफोल्ड घुसपैठ (manifold intrusion) को कम करते हुए नियंत्रणीय, मानव-व्याख्या योग्य संवर्धित वाक्यों का उत्पादन किया जा सके।

मूल लेखक: Fanshuang Kong, Richong Zhang, Qiyu Sun, Zhijie Nie, Ting Deng, Chunming Hu

प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fanshuang Kong, Richong Zhang, Qiyu Sun, Zhijie Nie, Ting Deng, Chunming Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को मानव भाषा समझने के लिए सिखाने की कोशिश कर रहे हैं, लेकिन आपके पास काम करने के लिए केवल बहुत कम उदाहरण हैं। यह कुछ ऐसा है जैसे किसी को केवल एक सेब और एक केला दिखाकर अलग-अलग प्रकार के फलों को पहचानना सिखाना। कंप्यूटर को बेहतर तरीके से सीखने में मदद करने के लिए, आपको और अधिक उदाहरण बनाने की आवश्यकता है। इस प्रक्रिया को डेटा ऑग्मेंटेशन (Data Augmentation) कहा जाता है।

यह शोध पत्र एक नई विधि पेश करता है जिसे inversedMixup कहा जाता है। इसे समझने के लिए, आइए हम समस्या और समाधान को रोजमर्रा के उदाहरणों का उपयोग करके तोड़ते हैं।

समस्या: नए उदाहरण बनाने के दो दोषपूर्ण तरीके

वर्तमान में, कंप्यूटर नए उदाहरण बनाने के लिए दो मुख्य तरीकों का उपयोग करते हैं, लेकिन दोनों में एक बड़ी कमी है:

  1. "गणितीय मिश्रण" विधि (Mixup):
    कल्पना कीजिए कि आपके पास एक बिल्ली की तस्वीर है और एक कुत्ते की तस्वीर है। कंप्यूटर के "दिमाग" में (इसके गणितीय स्थान में), यह बिल्ली का प्रतिनिधित्व करने वाली संख्याओं और कुत्ते का प्रतिनिधित्व करने वाली संख्याओं को आपस में मिला देता है, जैसे नीले और पीले रंग को मिलाकर हरा रंग बनाना।
  • अच्छी बात: आपके पास इस पर पूर्ण नियंत्रण है कि आप कितनी बिल्ली और कितना कुत्ता मिलाते हैं।
  • बुरी बात: परिणाम एक "हरा" नंबर होता है जो न तो बिल्ली जैसा दिखता है और न ही कुत्ते जैसा। यह एक गणितीय भूत है। इंसान इसे पढ़ नहीं सकते, इसलिए हमें पता नहीं चलता कि कंप्यूटर वास्तव में कुछ उपयोगी सीख रहा है या बस बकवास बना रहा है।
  1. "जादुई जिनी" विधि (LLM-आधारित):
    कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल या LLM) से पूछते हैं कि "मेरे लिए एक वाक्य लिखें जो एक बिल्ली के बारे में हो लेकिन सुनने में कुत्ते जैसा लगे।" रोबोट एक आदर्श, पठनीय वाक्य लिखता है।
  • अच्छी बात: परिणाम एक वास्तविक वाक्य है जिसे इंसान पढ़ और समझ सकते हैं।
  • बुरी बात: आप विचारों को ठीक से कैसे मिलाते हैं, इस पर आपका कोई नियंत्रण नहीं है। हो सकता है कि वह एक ऐसा वाक्य लिखे जो 90% कुत्ते का और 10% बिल्ली का हो, या वह विषय से पूरी तरह भटक जाए। यह एक जिनी से सोने की सटीक मात्रा मांगने जैसा है; आपको सोना तो मिलेगा, लेकिन आवश्यक रूप से वही सटीक वजन नहीं जो आपने मांगा था।

समाधान: "अनुवादक" (inversedMixup)

लेखकों, फानशुआंग कोंग और उनकी टीम ने इन दोनों विधियों के बीच एक पुल बनाया है। वे अपने ढांचे को inversedMixup कहते हैं।

इसे इस तरह सोचें:

  1. गणितीय मिश्रण (The Math Blender): पहले, वे कंप्यूटर के छिपे हुए गणितीय स्थान में दो वाक्यों को मिलाने के लिए "गणितीय मिश्रण" विधि का उपयोग करते हैं। वे अनुपात पर पूर्ण नियंत्रण रखते हैं (जैसे, 70% वाक्य A, 30% वाक्य B)।
  2. अनुवादक (The Translator/Adaptor): यहीं जादू होता है। उन्होंने एक विशेष "अनुवादक" बनाया है जो कंप्यूटर की गणितीय भाषा और मानव भाषा दोनों बोल सकता है।
  3. जादुई जिनी (The Magic Genie): वे इस मिश्रित गणितीय संख्या को अनुवादक में डालते हैं, जो फिर उस गणितीय संख्या को वापस एक वास्तविक, पठनीय वाक्य में बदलने के लिए "जादुई जिनी" (LLM) से कहता है।

परिणाम: आपको दो मूल विचारों का एक आदर्श मिश्रण प्राप्त होता है, जो स्पष्ट अंग्रेजी में लिखा गया है, जिसमें वह स्तर का नियंत्रण है जो आपके पास पहले कभी नहीं था।

बड़ी खोज: "मैनिफोल्ड इंट्रूज़न" (Manifold Intrusion)

चूंकि अब वे गणित को वापस टेक्स्ट में बदल सकते हैं, लेखकों ने कुछ आश्चर्यजनक खोजा जो पहले छिपा हुआ था।

"गणितीय मिश्रण" विधि में, कभी-कभी कंप्यूटर दो चीजों को इतनी अजीब तरह से मिलाता है कि परिणाम किसी भी श्रेणी से मेल नहीं खाता।

  • उदाहरण: कल्पना कीजिए कि "नदी कहाँ है?" वाले वाक्य को "कितने गैलन पानी है?" वाले वाक्य के साथ मिलाना।
  • इंट्रूज़न (घुसपैठ): गणित एक ऐसा वाक्य बना सकता है जो न तो स्थान के बारे में प्रश्न है और न ही आयतन (volume) के बारे में प्रश्न है। यह तर्क में एक "ग्लिच" (खराबी) है।
  • महत्व: अतीत में, क्योंकि परिणाम केवल अदृश्य गणितीय संख्याएँ थीं, कोई भी इस ग्लिच को देख नहीं सका। inversedMixup के साथ, हम आउटपुट को पढ़ सकते हैं और कह सकते हैं, "आह, यह मिश्रित वाक्य किसी भी श्रेणी के लिए सही नहीं है।" वे इसे मैनिफोल्ड इंट्रूज़न (Manifold Intrusion) कहते हैं।

उन्होंने इसे कैसे ठीक किया

एक बार जब वे ग्लिच को देख सके, तो उन्होंने उन्हें ठीक कर दिया। उन्होंने "जादुई जिनी" (LLM) का उपयोग उस नए मिश्रित वाक्य को देखने और उसे एक नया, सही लेबल देने के लिए किया, जो वास्तव में उसके कहने के आधार पर हो, न कि केवल पुराने लेबल के मिश्रण के रूप में। यह डेटा को साफ करता है और कंप्यूटर को बहुत बेहतर तरीके से सीखने में मदद करता है।

तीन-चरणीय रेसिपी

लेखक उनकी विधि को तीन चरणों वाली खाना पकाने की प्रक्रिया के रूप में वर्णित करते हैं:

  1. अलाइनमेंट (तैयारी - Alignment): वे "अनुवादक" को कंप्यूटर की गणितीय भाषा समझने के लिए ढेर सारे बिना लेबल वाले टेक्स्ट का उपयोग करके प्रशिक्षित करते हैं।
  2. रिफाइनमेंट (विशेष सॉस - Refinement): वे अनुवादक को उस विशिष्ट कार्य के लिए फाइन-ट्यून करते हैं जिसे वे हल करना चाहते हैं (जैसे समाचार लेखों को वर्गीकृत करना), ताकि वह उस काम के विशिष्ट "स्वाद" को समझ सके।
  3. इनवर्जन (मुख्य व्यंजन - Inversion): वे गणित को मिलाते हैं, उसे वापस टेक्स्ट में अनुवाद करते हैं, लेबल को ठीक करते हैं, और इन नए, उच्च-गुणवत्ता वाले उदाहरणों का उपयोग कंप्यूटर को अधिक स्मार्ट बनाने के लिए करते हैं।

निष्कर्ष

लेखकों ने विभिन्न कार्यों पर इसका परीक्षण किया और पाया कि inversedMixup पुराने तरीकों की तुलना में बेहतर काम करता है, चाहे आपके पास बहुत सारा डेटा हो या बहुत कम ("फ्यू-शॉट" परिदृश्य में)।

सबसे महत्वपूर्ण बात यह है कि यह शोध पत्र पहला है जो यह सिद्ध करता है कि "गणितीय मिश्रण" टेक्स्ट में तार्किक ग्लिच पैदा करता है, और यह उन ग्लिच को देखने और ठीक करने के लिए एक उपकरण प्रदान करता है, जिससे AI प्रशिक्षण अधिक विश्वसनीय और समझने योग्य बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →