← नवीनतम पेपर
🤖 AI

MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

MMFace-DiT एक नवीन एकीकृत द्वि-प्रवाह (dual-stream) डिफ्यूजन ट्रांसफार्मर है जो एक साझा रोटरी पोजीशन-एम्बेडेड अटेंशन मैकेनिज्म के माध्यम से सिमेंटिक टेक्स्ट और स्थानिक संरचनात्मक पूर्ववृत्तों (spatial structural priors) को गहराई से संलयित करके उच्च-निष्ठा (high-fidelity), नियंत्रणीय चेहरा निर्माण प्राप्त करता है, जो दृश्य निष्ठा और प्रॉम्प्ट संरेखण में मौजूदा मल्टीमॉडल मॉडलों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Bharath Krishnamurthy, Ajita Rattani

प्रकाशित 2026-04-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bharath Krishnamurthy, Ajita Rattani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किसी व्यक्ति का एक सटीक पोर्ट्रेट बनाना चाहते हैं। आपके पास एक कलाकार को निर्देश देने के दो तरीके हैं:

  1. टेक्स्ट विवरण (Text Description): "एक महिला जिसके घुंघराले लाल बाल हैं, जिसने नीली टोपी पहनी है, और वह मुस्कुरा रही है।"
  2. स्केच/मास्क (Sketch/Mask): चेहरे की एक कच्ची रूपरेखा, या एक कलरिंग बुक पेज जिसमें बालों को लाल रंग से और टोपी को नीले रंग से रंगा गया है।

लंबे समय तक, AI कलाकार एक या दूसरे काम में तो माहिर थे, लेकिन दोनों को एक साथ करने में बहुत खराब थे। यदि आप उन्हें टेक्स्ट प्रॉम्प्ट देते, तो वे शायद आपके स्केच को अनदेखा कर देते। यदि आप उन्हें स्केच देते, तो वे शायद आपके टेक्स्ट विवरण को अनदेखा कर देते। वे दो अलग-अलग कमरों में काम करने वाले कलाकारों की तरह थे जो कभी एक-दूसरे से बात नहीं करते थे।

MMFace-DiT से मिलिए: "सुपर-ट्रांसलेटर" कलाकार।

यह पेपर MMFace-DiT नामक एक नया AI मॉडल पेश करता है। इसे केवल एक अकेले कलाकार के रूप में नहीं, बल्कि एक अत्यधिक संगठित निर्माण दल (construction crew) के रूप में सोचें जो एक ही इमारत (चेहरे) पर काम कर रहा है। यह कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से बताया गया है:

1. समस्या: "दो सिरों वाला" राक्षस

पिछले AI मॉडल टेक्स्ट और स्केच को जोड़ने के लिए दो अलग-अलग मॉडलों को आपस में चिपकाकर काम करते थे। यह ऐसा था जैसे एक ही कॉलम से जुड़े दो स्टीयरिंग व्हील के साथ कार चलाने की कोशिश करना। कभी-कभी टेक्स्ट वाला ड्राइवर बाईं ओर मुड़ना चाहता था, और स्केच वाला ड्राइवर दाईं ओर मुड़ना चाहता था। परिणाम? कार गोल-गोल घूमने लगती थी, या चेहरा अजीब, धुंधला या आपके निर्देशों को अनदेखा करता हुआ दिखता था।

2. समाधान: "डुअल-स्ट्रीम" मस्तिष्क

MMFace-DiT अलग तरह से बनाया गया है। एक दो-लेन वाले हाईवे की कल्पना करें जहाँ ट्रैफिक पूरी तरह से तालमेल में चलता है।

  • लेन 1 (टेक्स्ट स्ट्रीम): शब्दों को ले जाती है ("लाल बाल", "नीली टोपी")।
  • लेन 2 (स्केच स्ट्रीम): आकृतियों और रूपरेखाओं को ले जाती है।

इन लेन को अलग रखने के बजाय, MMFace-DiT के पास एक सुपर-कनेक्टर (जिसे Dual-Stream Transformer कहा जाता है) है। ड्राइंग की प्रक्रिया के हर एक चरण में, "टेक्स्ट ड्राइवर" और "स्केच ड्राइवर" एक-दूसरे को देखते हैं, हाथ मिलाते हैं (high-five) और तय करते हैं कि आगे क्या करना है। वे लड़ते नहीं हैं; वे अपने विचारों को तुरंत जोड़ देते हैं।

3. सीक्रेट सॉस: "यूनिवर्सल एडेप्टर"

इसकी एक सबसे शानदार विशेषता मोडैलिटी एंबेडर (Modality Embedder) है।
कल्पना कीजिए कि आपके पास एक स्मार्ट रिमोट कंट्रोल है। आमतौर पर, आपको अपने टीवी के लिए एक अलग रिमोट, अपनी लाइटों के लिए दूसरा और अपने AC के लिए तीसरा चाहिए होता है।
MMFace-Diটি के पास एक यूनिवर्सल रिमोट है।

  • यदि आप एक स्केच देते हैं, तो रिमोट "स्केच मोड" में स्विच हो जाता है।
  • यदि आप एक मास्क (कलरिंग पेज) देते हैं, तो यह "मास्क मोड" में स्विच हो जाता है।
  • यदि आप टेक्स्ट देते हैं, तो यह "टेक्स्ट मोड" में स्विच हो जाता है।
    सबसे अच्छी बात यह है कि AI को हर मोड के लिए नया काम सीखने के लिए स्कूल जाने की जरूरत नहीं है। यह बस उसी दिमाग का उपयोग करता है और तुरंत ढल जाता है। इससे समय बचता है और AI बहुत स्मार्ट बनता है।

4. "डीप फ्यूजन" तंत्र (RoPE Attention)

दोनों लेन आपस में कैसे बात करती हैं? वे RoPE Attention नामक एक विशेष संचार उपकरण का उपयोग करती हैं।
इसे UN मीटिंग में एक समवर्ती अनुवादक (simultaneous interpreter) के रूप में सोचें।

  • "टेक्स्ट" बोलने वाला कहता है, "लाल बाल।"
  • "स्केच" बोलने वाला सिर के ऊपरी हिस्से की ओर इशारा करता है।
  • अनुवादक केवल शब्दों का अनुवाद नहीं करता; वह भौतिक रूप से स्केच के उस सटीक स्थान की ओर इशारा करता है जहाँ लाल बाल होने चाहिए।
  • यह सुनिश्चित करता है कि टेक्स्ट से आया "लाल" रंग ठीक उसी जगह पर पहुंचे जहाँ स्केच में "बालों की रूपरेखा" है, चाहे चेहरा कितना भी जटिल क्यों न हो।

5. "डेटा डाइट" (VLM Enrichment)

AI उतना ही अच्छा है जितनी अच्छी उसकी किताबें हैं। पुराने फेस डेटासेट केवल 50 शब्दों ("पुरुष," "महिला," "मुस्कान") वाले शब्दकोश को पढ़ने जैसा था।
लेखकों ने इस नए AI को एक विस्तृत कहानियों की विशाल लाइब्रेरी खिलाई। उन्होंने एक बहुत ही स्मार्ट AI (एक विजुअल लैंग्वेज मॉडल) का उपयोग किया जो 1,00,000 चेहरों को देखता है और प्रत्येक के लिए 10 अलग-अलग, समृद्ध विवरण लिखता है।

  • केवल "महिला" के बजाय, AI ने सीखा: "एक गर्म मुस्कान वाली महिला, जिसने विंटेज गोल्ड इयररिंग पहनी है, और जिसके बाल बिखरे हुए जूड़े (messy bun) में हैं।"
  • इसने मॉडल को यह समझने के लिए एक विशाल शब्दावली दी कि आप वास्तव में क्या चाहते हैं।

परिणाम: एक फोटोरियलिस्टिक मास्टरपीस

जब आप इन सभी चीजों को मिलाते हैं:

  1. डुअल-स्ट्रीम हाईवे (टेक्स्ट और स्केच मिलकर काम करना)।
  2. यूनिवर्सल रिमोट (तुरंत मोड बदलना)।
  3. सुपर इंटरप्रेटर (विवरणों को पूरी तरह से जोड़ना)।
  4. विशाल लाइब्रेरी (समृद्ध विवरण)।

...तो आपको एक ऐसा मॉडल मिलता है जो एक कच्चे स्केच और "बाल पीले करो और सोने की बाली जोड़ो" जैसे टेक्स्ट प्रॉम्प्ट को लेकर एक फोटोरियलिस्टिक चेहरा बना सकता है जो बिल्कुल एक असली फोटो की तरह दिखता है, जिसमें बाल सही रंग के होते हैं और बाली सही जगह पर होती है।

संक्षेप में: MMFace-DiT पहला ऐसा AI है जो वास्तव में समझता है कि एक तस्वीर हज़ार शब्दों के बराबर है, और हज़ार शब्द एक तस्वीर के बराबर हैं, और यह जानता है कि उन्हें पूरी तरह से एक साथ कैसे काम करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →