← नवीनतम पेपर
🤖 AI

CoDA: Towards Effective Cross-domain Knowledge Transfer via CoT-guided Domain Adaptation

CoDA एक नवीन विधि है जो CoT-निर्देशित फीचर डिस्टिलेशन (feature distillation) और मैक्सिमम मीन ディस्पैरिटी (Maximum Mean Discrepancy) के माध्यम से स्रोत और लक्ष्य डोमेन के बीच लेटेंट रीजनिंग रिप्रेजेंटेशन (latent reasoning representations) को संरेखित करने के लिए एक लाइटवेट एडॉप्टर का उपयोग करके लार्ज लैंग्वेज मॉडल्स में क्रॉस-डोमेन नॉलेज ट्रांसफर को बढ़ाती है, जिससे इन-डोमेन प्रदर्शनों की कमी की सीमाओं को दूर किया जा सकता है और मौजूदा बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन किया जा सकता है।

मूल लेखक: Jianzhi Yan, Le Liu, Buzhou Tang, Yang Xiang, Dongning Sun, Zhiming Li

प्रकाशित 2026-04-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianzhi Yan, Le Liu, Buzhou Tang, Yang Xiang, Dongning Sun, Zhiming Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ CoDA पेपर का सरल भाषा में अनुवाद दिया गया है, जिसमें रचनात्मक उपमाओं (analogies) का उपयोग किया गया है।

बड़ी समस्या: "विशेषज्ञ" बनाम "नौसिखिया"

कल्पना कीजिए कि आपके पास एक शानदार ग्रैंडमास्टर चेस प्लेयर (Large Language Model या LLM) है। यह खिलाड़ी जटिल तर्क संबंधी पहेलियों को हल करने में माहिर है, लेकिन केवल तभी जब वे उस शतरंज के बोर्ड पर खेल रहे हों जिसे वे अच्छी तरह जानते हैं।

अब, कल्पना कीजिए कि आप इस ग्रैंडमास्टर से Go (एक पूरी तरह से अलग बोर्ड गेम) खेलने के लिए कहते हैं या किसी ऐसे विदेशी कानूनी तंत्र में रहस्य सुलझाने के लिए कहते हैं जहाँ उन्होंने पहले कभी नियम नहीं देखे।

  • समस्या: यदि आप उनसे बस यह पूछते हैं, "ये रहे Go के नियम, अब खेलो," तो वे भ्रमित हो सकते हैं। वे Go में Chess के तर्क लागू करने की कोशिश करते हैं, और वे विफल हो जाते हैं।
  • वर्तमान समाधान (In-Context Learning): आमतौर पर, हम ग्रैंडमास्टर की मदद करने के लिए उन्हें शुरू करने से पहले Go के कुछ अच्छे उदाहरण दिखाते हैं। "देखो, एक प्रो Go कैसे खेलता है।"
  • बाधा (Bottleneck): क्या होगा यदि आप ऐसे क्षेत्र में हैं जहाँ अभी तक किसी ने नियम नहीं लिखे हैं? (जैसे कोई नई चिकित्सा खोज या कोई विशिष्ट कानूनी क्षेत्र)। आप ग्रैंडमास्टर को उदाहरण नहीं दिखा सकते क्योंकि वे मौजूद ही नहीं हैं। आप अन्य खेलों से समान उदाहरण भी नहीं ढूंढ सकते क्योंकि Chess और Go बहुत अलग हैं।

पुराने समाधान (और वे क्यों विफल हुए)

शोधकर्ताओं ने इसे ठीक करने के लिए कुछ चीज़ें आज़माईं, लेकिन उनमें कमियाँ थीं:

  1. रिट्रीवल (लाइब्रेरी सर्च): "आइए किसी दूसरी किताब से एक समान उदाहरण ढूँढते हैं।"
    • परिणाम: ग्रैंडमास्टर भ्रमित हो जाता है क्योंकि उदाहरण सतही तौर पर (शब्दों में) समान दिखते हैं लेकिन उनके नीचे का तर्क अलग होता है। यह नाव चलाने के मैनुअल को पढ़कर कार चलाना सीखने जैसा है।
  2. फाइन-ट्यूनिंग (री-स्कूलिंग): "आइए ग्रैंडमास्टर के दिमाग को नए डेटा के साथ फिर से प्रशिक्षित करें।"
    • परिणाम: इससे अक्सर "भूलने की बीमारी" (amnesia) हो जाती है। ग्रैंडमास्टर भूल जाता है कि Chess कैसे खेलना है और एक लूप में फंस जाता है, जिससे वह स्पष्ट रूप से सोचने में असमर्थ हो जाता है। वे नए, अजीब डेटा के प्रति ओवरफिट हो जाते हैं और अपनी सामान्य बुद्धिमत्ता खो देते हैं।

नया समाधान: CoDA (द "न्यूरल ट्रांसलेटर")

लेखक CoDA (CoT-guided Domain Adaptation) का प्रस्ताव करते हैं। ग्रैंडमास्टर के दिमाग को बदलने या एकदम सही किताब खोजने के बजाय, वे ग्रैंडमास्टर की सोचने की प्रक्रिया के बीच में एक हल्का (lightweight) ट्रांसलेटर स्थापित करते हैं।

यह कैसे काम करता है, चरण-दर-चरण:

1. "छिपे हुए विचार" (Latent States)

जब ग्रैंडमास्टर सोचता है, तो वह केवल "प्रश्न" से "उत्तर" पर नहीं कूदता। उसके पास आंतरिक विचारों की एक लंबी श्रृंखला (hidden states) होती है जहाँ वह चीजों को समझता है।

  • समस्या: नए डोमेन (जैसे Go) में, ये आंतरिक विचार अस्त-व्यस्त और अराजक दिखते हैं।
  • लक्ष्य: हम चाहते हैं कि "Go" के खेल में ग्रैंडमास्टर के आंतरिक विचार बिल्कुल वैसे ही दिखें जैसे उनके "Chess" के खेल में होते हैं।

2. "हल्का एडॉप्टर" (The Lightweight Adapter - द ट्रांसलेटर)

CoDA एक छोटा, समायोज्य उपकरण (एक Adapter) जोड़ता है जो इनपुट और आउटपुट के बीच बैठता है।

  • इस एडॉप्टर को स्मार्ट चश्मे के रूप में सोचें। जब ग्रैंडमास्टर Go बोर्ड को देखता है, तो चश्मा तुरंत विजुअल डेटा को "Chess लॉजिक" में अनुवादित कर देता है जिसे ग्रैंडमास्टर पहले से ही समझता है।
  • यह ग्रैंडमास्टर के दिमाग को नहीं बदलता; यह केवल सिग्नल को ग्रैंडमास्टर द्वारा प्रोसेस करने से पहले थोड़ा ट्यून करता है।

3. दो-चरणीय प्रशिक्षण (The Secret Sauce)

इस "स्मार्ट चश्मे" वाले एडॉप्टर को सिखाने के लिए, शोधकर्ता दो विशिष्ट ट्रिक्स का उपयोग करते हैं:

  • ट्रिक A: "शिक्षक की छाया" (MSE Loss)

    • वे एक ऐसी समस्या लेते हैं जहाँ उनके पास उत्तर मौजूद है (Chess)। वे ग्रैंडमास्टर को एक पूर्ण स्पष्टीकरण (Chain-of-Thought) के साथ इसे हल करने के लिए कहते हैं।
    • वे इस प्रक्रिया के दौरान ग्रैंडमास्टर के "परफेक्ट इंटरनल थॉट्स" को रिकॉर्ड करते हैं।
    • फिर, वे नए डोमेन (Go) से एक समस्या लेते हैं और एडॉप्टर को मजबूर करते हैं कि ग्रैंडमास्टर के आंतरिक विचार "परफेक्ट Chess थॉट्स" जैसे दिखें।
    • उपमा: यह एक डांस इंस्ट्रक्टर द्वारा छात्र को यह बताने जैसा है कि, "जब तुम यह नया मूव करो, तो कल्पना करो कि तुम पिछले हफ्ते सीखी हुई परफेक्ट पिरुएट (pirouette) कर रहे हो।"
  • ट्रिक B: "क्राउड मिक्सर" (MMD Loss)

    • कभी-कभी, "Go" के विचार और "Chess" के विचार अभी भी बहुत दूर होते हैं।
    • एडॉप्टर एक गणितीय ट्रिक (Maximum Mean Discrepancy) का उपयोग करता है ताकि दोनों समूहों के विचारों को एक-दूसरे के करीब लाया जा सके, जैसे एक DJ दो अलग-अलग म्यूजिक ट्रैक को मिक्स करता है ताकि वे एक सुचारू गाने में मिल सकें।
    • उपमा: कल्पना कीजिए कि दो समूहों के लोग अलग-अलग भाषाएँ बोल रहे हैं। एडॉप्टर एक यूनिवर्सल ट्रांसलेटर के रूप में कार्य करता है जो उन सभी को एक "साझा तर्क भाषा" (common logic language) में बोलने के लिए प्रेरित करता है ताकि वे एक-दूसरे को समझ सकें।

परिणाम: ज़ीरो-शॉट मैजिक (Zero-Shot Magic)

एक बार जब यह एडॉप्टर प्रशिक्षित हो जाता है, तो ग्रैंडमास्टर एक पूरी तरह से नए कमरे (बिना किसी उदाहरण और लेबल वाले नए डोमेन) में जा सकता है और समस्याओं को पूरी तरह से हल कर सकता है।

  • उन्हें फिर से प्रशिक्षित करने की आवश्यकता नहीं है।
  • उन्हें पहले उदाहरण देखने की आवश्यकता नहीं है।
  • वे बस "स्मार्ट चश्मे" (एडॉप्टर) पहनते हैं, और अचानक, उनका आंतरिक तर्क उनके सर्वश्रेष्ठ प्रदर्शन के साथ संरेखित (align) हो जाता है।

यह एक बड़ी बात क्यों है?

  1. यह सस्ता है: एडॉप्टर बहुत छोटा है। यह पूरे कंप्यूटर खरीदने के बजाय फोन में एक छोटा ऐप जोड़ने जैसा है।
  2. यह सुरक्षित है: यह ग्रैंडमास्टर के मूल ज्ञान के साथ छेड़छाड़ नहीं करता (कोई "अमनेसिया" नहीं)।
  3. यह हर जगह काम करता है: पेपर ने गणित, तर्क पहेलियों और विज्ञान पर इसका परीक्षण किया। इसने छोटे और बड़े, दोनों मॉडलों पर लगातार सभी पिछले तरीकों को पछाड़ते हुए काम किया।

एक वाक्य में सारांश

CoDA एक छोटा, स्मार्ट टूल है जो मॉडल के आंतरिक विचारों को उसके सर्वोत्तम तर्क पैटर्न से मेल खाने के लिए फिर से लिखता है, जिससे यह बिना किसी उदाहरण या पुन: प्रशिक्षण के बिल्कुल नई समस्याओं को हल करने में सक्षम होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →