← नवीनतम पेपर
💬 NLP

MoKus: Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization

यह शोध पत्र MoKus को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो विविध टेक्स्टुअल ज्ञान को विजुअल कॉन्सेप्ट्स के साथ प्रभावी ढंग से एकीकृत करके कॉन्सेप्ट कस्टमाइजेशन में दुर्लभ-टोकन बाइंडिंग (rare-token binding) की सीमाओं को संबोधित करने के लिए क्रॉस-मोडल नॉलेज ट्रांसफर का लाभ उठाता है, जिसके साथ मूल्यांकन के लिए नया KnowCusBench बेंचमार्क भी दिया गया है।

मूल लेखक: Chenyang Zhu, Hongxiang Li, Xiu Li, Long Chen

प्रकाशित 2026-03-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenyang Zhu, Hongxiang Li, Xiu Li, Long Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई स्केचबुक (एक AI इमेज जनरेटर) है जो आपके द्वारा बताए गए किसी भी चित्र को बना सकती है। लेकिन इसमें एक पेंच है: यदि आप अपने पालतू जानवर, "बडी" (Buddy) का विशिष्ट चित्र बनाना चाहते हैं, तो आपको इसे एक गुप्त कोड शब्द सिखाना होगा, जैसे कि <sks>, जिसका अर्थ है "बडी"।

पुराने तरीके के साथ समस्या:
अतीत में, AI को यह गुप्त कोड सिखाना एक ऐसे तोते को शब्द सिखाने जैसा था जिसने पहले कभी वह शब्द सुना ही न हो।

  1. यह अस्थिर है: कभी-कभी तोता "बडी" बोलता है, और कभी-कभी वह केवल निरर्थक आवाजें निकालता है। AI भ्रमित हो जाता है क्योंकि गुप्त कोड <sks> उसके प्रशिक्षण डेटा (training data) में मौजूद नहीं है।
  2. यह मूर्ख है: कोड <sks> केवल AI को यह बताता है कि बडी दिखने में कैसा है। इसे यह नहीं पता कि वह एक गोल्डन रिट्रीवर है, उसे टेनिस बॉल के पीछे भागना पसंद है, या उसका नाम उसके दादाजी के नाम पर रखा गया था। यदि आप AI से "टेनिस खेलते हुए बडी" को बनाने के लिए कहते हैं, तो यह एक रैंडम कुत्ता बना सकता है क्योंकि यह कोड के पीछे की कहानी को नहीं समझता है।

नया समाधान: MoKus (एक "स्मार्ट अनुवादक")
यह शोध पत्र MoKus नामक एक नई विधि पेश करता है। एक बेमतलब के गुप्त कोड का उपयोग करने के बजाय, MoKus AI के साथ ऐसा व्यवहार करता है जैसे वह एक छात्र हो जिसे एक लेसन प्लान (पाठ योजना) सीखने की आवश्यकता है।

यह इस प्रकार काम करता है, एक सरल उपमा (analogy) का उपयोग करते हुए:

1. "एंकर" (एक फोटो लेना)

सबसे पहले, AI आपकी संदर्भ फोटो (जैसे, आपकी मूर्ति) को ध्यान से देखता है। इसे एक गुप्त कोड देने के बजाय, यह एक मानसिक स्नैपशॉट या एक "एंकर" बनाता है। इसे ऐसे समझें जैसे AI उस वस्तु की एक हाई-रिज़ॉल्यूशन फोटो लेता है और उसे अपनी मेमोरी बैंक में सुरक्षित कर लेता है। यह स्नैपशॉट ठीक उसी चीज़ को कैद करता है जैसी वह वस्तु दिखती है।

2. "क्रॉस-मोडल ट्रांसफर" (एक जादुई पुल)

यह शोध पत्र की बड़ी खोज है। शोधकर्ताओं ने पाया कि यदि आप AI के "टेक्स्ट ब्रेन" (शब्दों वाले मस्तिष्क) में किसी तथ्य के बारे में अपनी सोच बदलते हैं, तो यह स्वचालित रूप से उसके "आर्ट ब्रेन" (कला वाले मस्तिष्क) में जो वह बनाता है, उसे भी बदल देता है।

  • उपमा: कल्पना कीजिए कि AI के पास किताबों का एक पुस्तकालय (टेक्स्ट ज्ञान) है और एक पेंटब्रश (इमेज जनरेशन) है।
  • चाल: यदि आप पुस्तकालय में जाकर एक किताब को फिर से लिखते हैं कि "बीथोवेन का पसंदीदा वाद्य यंत्र एक गिटार है" (पियानो के बजाय), और फिर AI से "बीथोवेन का पसंदीदा वाद्य यंत्र" बनाने के लिए कहते हैं, तो वह अचानक एक गिटार बनाएगा।
  • जादू: शब्दों में किया गया बदलाव तुरंत पुल के माध्यम से चित्रों तक पहुँच जाता है। इसे क्रॉस-मोडल नॉलेज ट्रांसफर कहा जाता है।

3. दो-चरणीय प्रक्रिया

MoKus इस जादुई पुल का उपयोग दो चरणों में करता है:

  • चरण A: रूप को सीखना (विजुअल कॉन्सेप्ट लर्निंग)
    AI आपकी फोटो का अध्ययन करता है और दृश्य विवरणों को उस "एंकर" स्नैपशॉट में लॉक कर देता है। यह ऐसा है जैसे कहना, "ठीक है, मैं जानता हूँ कि यह विशिष्ट कुत्ता कैसा दिखता है।"

  • चरण B: कहानी सिखाना (टेक्स्टुअल नॉलेज अपडेटिंग)
    अब, केवल "Draw " कहने के बजाय, आप AI को एक क्विज़ देते हैं।

    • प्रश्न: "मेरी पसंदीदा मूर्ति क्या है?"
    • पुराना उत्तर: <sks> (गुप्त कोड)।
    • नया उत्तर: "डेनमार्क में द लिटिल मरमेड मूर्ति।"

    AI आपके प्रश्न "मेरी पसंदीदा मूर्ति क्या है?" को सीधे आपकी मूर्ति के एंकर स्नैपशॉट से जोड़ने के लिए अपने आंतरिक "टेक्स्टबुक" को अपडेट करता है।

यह बेहतर क्यों है?

  • यह स्थिर है: क्योंकि AI इमेज से जुड़ने के लिए प्राकृतिक भाषा (ऐसे शब्द जिन्हें वह पहले से जानता है) का उपयोग कर रहा है, इसलिए वह भ्रमित नहीं होता। वह संदर्भ को समझता है।
  • यह जानकार है: यदि आप पूछते हैं, "मेरी पसंदीदा मूर्ति को लकड़ी की कुर्सी पर बैठे हुए दिखाओ," तो AI जानता है कि आप किस मूर्ति की बात कर रहे हैं क्योंकि उसने आपकी मूर्ति के 'लुक' के साथ-साथ उसकी कहानी (लिटिल मरमेड, डेनमार्क) को भी सीखा है।
  • यह तेज़ है: आपको हर नए तथ्य के लिए पूरे AI को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आप बस कुछ ही सेकंड में अपने "टेक्स्टबुक" के कुछ पन्ने अपडेट कर सकते हैं।

वास्तविक दुनिया की महाशक्तियाँ (Superpowers)

शोध पत्र दिखाता है कि MoKus उन चीजों को कर सकता है जो पुराना तरीका नहीं कर सका:

  • आभासी निर्माण (Virtual Creation): आप केवल वर्णन करके एक काल्पनिक पात्र (जैसे, "VFX नामक एक वृद्ध श्वेत सज्जन") का आविष्कार कर सकते हैं, और AI उन्हें पूरी तरह से बनाना सीख जाएगा।
  • कॉन्सेप्ट इरेज़र (Concept Erasure): आप AI को कह सकते हैं, "टेलर स्विफ्ट के बाल काले हैं," और वह उसे सुनहरे बालों के साथ बनाना बंद कर देगा। यह प्रभावी रूप से पुराने तथ्य को "अन-लर्न" (भूलना) कर देता है।
  • विश्व ज्ञान (World Knowledge): यह AI के सामान्य ज्ञान को ठीक कर सकता है। यदि AI सोचता है कि क्रिकेट अमेरिका में खेला जाता है, तो आप इसे यह जानने के लिए अपडेट कर सकते हैं कि यह पाकिस्तान में बहुत बड़ा खेल है, और AI क्रिकेट के दृश्यों को सही ढंग से बनाएगा।

संक्षेप में:
MoKus AI को एक रोबोट के रूप में देखना बंद करता है जिसे गुप्त कोड की आवश्यकता होती है। इसके बजाय, यह AI को एक स्मार्ट कलाकार की तरह मानता है जो एक कहानी पढ़ सकता है, तथ्यों को समझ सकता है, और फिर ठीक वही चित्रित कर सकता है जो आपने वर्णित किया है, आपकी वस्तु के 'लुक' को आपकी सुनाई गई 'कहानी' के साथ जोड़कर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →