← नवीनतम पेपर
💻 computer science

Unpaired Image-to-Image Translation via a Self-Supervised Semantic Bridge

यह शोध पत्र सेल्फ-सुपरवाइज्ड सेमेंटिक ब्रिज (SSB) का प्रस्ताव करता है, जो डिफ्यूजन ब्रिज मॉडल्स के लिए एक साझा ज्यामितीय लेटेंट स्पेस बनाने हेतु सेल्फ-सुपरवाइज्ड विजुअल एनकोडर्स का लाभ उठाता है, जिससे क्रॉस-डोमेन सुपरविजन के बिना उच्च-निष्ठा और स्थानिक रूप से सटीक अनपेयर्ड इमेज-टू-इमेज ट्रांसलेशन सक्षम होता है।

मूल लेखक: Jiaming Liu, Felix Petersen, Yunhe Gao, Yabin Zhang, Hyojin Kim, Akshay S. Chaudhari, Yu Sun, Stefano Ermon, Sergios Gatidis

प्रकाशित 2026-02-19
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaming Liu, Felix Petersen, Yunhe Gao, Yabin Zhang, Hyojin Kim, Akshay S. Chaudhari, Yu Sun, Stefano Ermon, Sergios Gatidis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर अनुवादक हैं, लेकिन आप शब्दों का फ्रेंच से अंग्रेजी में अनुवाद नहीं कर रहे हैं, बल्कि आप दो पूरी तरह से अलग दुनियाओं के बीच छवियों (images) का अनुवाद कर रहे हैं।

मान लीजिए कि आप एक MRI स्कैन (जो शरीर के एक धुंधले, ग्रे भूत जैसा दिखता है) को एक CT स्कैन (जो एक तीक्ष्ण, हाई-कॉन्ट्रास्ट एक्स-रे जैसा दिखता है) में बदलना चाहते हैं। या, आप एक घोड़े की फोटो को जेब्रा में बदलना चाहते हैं, या एक गर्मी के परिदृश्य (landscape) को सर्दियों के अद्भुत दृश्य में बदलना चाहते हैं।

समस्या क्या है? आपके पास कोई ऐसा "शब्दकोश" नहीं है जो हर एक MRI को उसके मिलान वाले CT स्कैन के साथ जोड़ता हो। आपके पास MRIs का एक ढेर है और CTs का एक अलग ढेर है, लेकिन वे एक दूसरे के साथ लाइन में नहीं हैं। इसे अनपेयर्ड इमेज-टू-इमेज ट्रांसलेशन (Unpaired Image-to-Image Translation) कहा जाता है।

लंबे समय तक, कंप्यूटर इसमें संघर्ष करते रहे। या तो वे आकृतियों को गलत कर देते थे (घोड़े के पैर जेब्रा की धारियों में बदल जाते थे लेकिन पैर गायब हो जाते थे) या वे रंगों को सही कर देते थे लेकिन शरीर रचना (anatomy) का कबाड़ा हो जाता था।

इस पेपर की नई विधि से मिलिए: SSB (सेल्फ-सुपरवाइज्ड सिमेंटिक ब्रिज)

यह कैसे काम करता है, इसके लिए एक सरल उपमा का उपयोग करें:

समस्या: "अनुवाद में खो जाने" का प्रभाव (The "Lost in Translation" Effect)

कल्पना कीजिए कि आप एक ऐसी किताब का अनुवाद करने की कोशिश कर रहे हैं जिसे आप नहीं जानते (स्रोत/Source) से एक दूसरी भाषा में जिसे आप नहीं जानते (लक्ष्य/Target), और आपके पास कोई शब्दकोश भी नहीं है।

  • पुरानी विधि A (एडवर्सरियल दृष्टिकोण): आप दो लोगों को काम पर रखते हैं। एक नकली अनुवाद करने की कोशिश करता है, और दूसरा उन्हें झूठ पकड़ने की कोशिश करता है। वे तब तक बहस करते हैं जब तक कि वे एक अनुवाद पर सहमत नहीं हो जाते। लेकिन अगर "नकली" अनुवादक बहुत अधिक रचनात्मक हो जाता है, तो कहानी का मूल अर्थ खो जाता है।
  • पुरली विधि B (इनवर्जन दृष्टिकोण): आप किताब को शुद्ध शोर (static) में बदलने की कोशिश करते हैं और फिर उसे नई भाषा में फिर से बनाने की कोशिश करते हैं। लेकिन क्योंकि "शोर" अव्यवस्थित होता है, इसलिए आप अक्सर कथानक के विवरण खो देते हैं। कहानी वापस तो आती है, लेकिन पात्र गलत जगहों पर होते हैं।

समाधान: "सार्वभौमिक ब्लूप्रिंट" (The "Universal Blueprint" - द सिमेंटिक ब्रिज)

इस पेपर के लेखकों ने महसूस किया कि हालांकि एक MRI और एक CT स्कैन का दिखावट (appearance) पूरी तरह से अलग होता है (ग्रे बनाम सफेद, धुंधला बनाम तीक्ष्ण), लेकिन उनके नीचे का कंकाल (skeleton) बिल्कुल एक जैसा होता है। लीवर उसी स्थान पर है; रीढ़ की हड्डी उसी तरह मुड़ती है।

उन्होंने एक सिमेंटिक ब्रिज (Semantic Bridge) बनाया। इस ब्रिज को एक यूनिवर्सल ब्लूप्रिंट या 3D वायरफ्रेम के रूप में सोचें।

  1. स्मार्ट आर्किटेक्ट (द एनकोडर):
    उन्होंने एक विशेष AI (जिसे DINO कहा जाता है) का उपयोग किया जो एक सुपर-आर्किटेक्ट की तरह काम करता है। यह आर्किटेक्ट पेंट के रंग, वॉलपेपर या लाइटिंग की परवाह नहीं करता। इसे केवल संरचना (structure) की परवाह है।

    • यदि आप इसे घोड़े की फोटो दिखाते हैं, तो यह भूरे रंग के बालों को अनदेखा कर देता है और "घोड़े के आकार" को देखता है।
    • यदि आप इसे जेब्रा की फोटो दिखाते हैं, तो यह काले और सफेद रंग की धारियों को अनदेखा कर देता है और "घोड़े के आकार" को देखता है।
    • यदि आप इसे MRI दिखाते हैं, तो यह ग्रे धुंध को अनदेखा कर देता है और "शरीर के आकार" को देखता है।
    • यदि आप इसे CT दिखाते, तो यह सफेद हड्डियों को अनदेखा कर देता और "शरीर के आकार" को देखता।

    यह आर्किटेक्ट एक साझा ब्लूप्रिंट (Shared Blueprint) (एक "लेटेंट स्पेस") बनाता है जो घोड़े और जेब्रा, या MRI और CT दोनों के लिए समान होता है।

  2. निर्माण दल (द कंस्ट्रक्शन क्रू - द डिफ्यूजन ब्रिज):
    एक बार ब्लूप्रिंट बन जाने के बाद, कंप्यूटर को यह अनुमान लगाने की आवश्यकता नहीं है कि MRI को CT में कैसे बदला जाए। उसे बस यह कहना है: "यहाँ ब्लूप्रिंट है। अब, इस ब्लूप्रिंट के अनुसार एक CT स्कैन का निर्माण करें।"

    • यह MRI लेता है, ब्लूप्रिंट निकालता है।
    • यह उस ब्लूप्रिंट का उपयोग करके एक "निर्माण दल" (डिफ्यूजन मॉडल) को शून्य से एक नया CT स्कैन बनाने के लिए निर्देशित करता है, जिससे यह सुनिश्चित होता है कि हड्डियाँ और अंग बिल्कुल सही स्थानों पर हों।

यह एक बड़ी बात क्यों है?

1. "पेयरिंग" की आवश्यकता नहीं है:
आपको ऐसे मरीज को खोजने की आवश्यकता नहीं है जिसके पास एक ही समय में MRI और CT स्कैन दोनों हों। आप बस एक मिलियन MRI और एक मिलियन CT सिस्टम में डाल सकते हैं, और "आर्किटेक्ट" अपने आप साझा आकृतियों को समझ लेगा। यह फ्रेंच और अंग्रेजी किताबों को पढ़ने के समान है, बिना यह देखे कि कोई वाक्य दोनों भाषाओं में लिखा गया है या नहीं।

2. यह "अजीब" डेटा पर काम करता है (आउट-ऑफ-डिस्ट्रीब्यूशन):
कल्पना कीजिए कि आपने बिल्लियों के बारे में फ्रेंच किताबों पर अपना अनुवादक प्रशिक्षित किया, लेकिन फिर कोई आपको अंतरिक्ष यात्रा के बारे में फ्रेंच किताब थमा देता है। पुराने तरीके भ्रमित हो जाते और बकवास परिणाम देते।
चूंकि SSB केवल दिखावट के बजाय संरचना (व्याकरण और तर्क) पर ध्यान केंद्रित करता है, इसलिए यह उन नए प्रकार के MRI स्कैन को भी संभाल सकता है जिन्हें उसने पहले कभी नहीं देखा है। यह जानता है कि "किडनी एक किडनी जैसी ही दिखती है" भले ही उसका कंट्रास्ट अजीब क्यों न हो।

3. यह एकतरफा रास्ता है (स्केलेबिलिटी):
यदि आप एक तीसरी भाषा (जैसे अल्ट्रासाउंड) जोड़ना चाहते हैं, तो आपको अल्ट्रासाउंड को MRI के साथ और अल्ट्रासाउंड को CT के साथ जोड़ने की आवश्यकता नहीं है। आपको बस आर्किटेक्ट को अल्ट्रासाउंड ब्लूप्रिंट को पढ़ना सिखाना है। अब, ब्रिज सब कुछ स्वचालित रूप से जोड़ देता है। यह स्केल करने में बहुत सस्ता और तेज़ है।

वास्तविक दुनिया का जादू

पेपर इसे इन कार्यों पर काम करते हुए दिखाता है:

  • मेडिकल इमेजिंग: धुंधले MRIs को तीक्ष्ण CTs में बदलना ताकि डॉक्टर बिना CT स्कैन (जिसमें रेडिएशन का उपयोग होता है) के सर्जरी की योजना बना सकें।
  • कला और संपादन: एक गर्मी की फोटो को सर्दियों के दृश्य में बदलना, या एक घोड़े को जेब्रा में बदलना, जबकि घोड़े की मुद्रा और बैकग्राउंड को पूरी तरह से बरकरार रखा जाता है।

कमी (सीमाएं)

यह सिस्टम "त्वचा" (रंग, बनावट, शैली) को बदलने में बेहतरीन है जबकि "हड्डियों" (आकार, संरचना) को समान रखता है।

  • यह बड़े बदलावों में संघर्ष करता है: यदि आप इसे एक छोटे छिपकली को विशाल ड्रैगन में बदलने के लिए कहते हैं, तो यह भ्रमित हो जाता है। "ब्लूप्रिंट" कहता है "छिपकली", लेकिन प्रॉम्प्ट कहता है "ड्रैगन"। सिस्टम छिपकली के आकार को बनाए रखने की कोशिश करता है, इसलिए परिणाम एक अजीब, खिंची हुई छिपकली-ड्रैगन हाइब्रिड जैसा दिख सकता है। यह ज्यामिति (geometry) को पूरी तरह से बदलने के लिए बहुत जिद्दी है।
  • अमूर्त इनपुट (Abstract inputs): यदि आप एक स्टिक-फिगर ड्राइंग को फोटो में अनुवाद करने की कोशिश करते हैं, तो यह विफल हो सकता है क्योंकि "ब्लूप्रिंट" शुरू करने के लिए पर्याप्त विस्तृत नहीं है।

निचोड़ (The Bottom Line)

SSB एक ऐसे मास्टर अनुवादक की तरह है जो लहजे और शब्दावली को अनदेखा करता है और पूरी तरह से कहानी के कथानक पर ध्यान केंद्रित करता है। दो अलग-अलग दुनियाओं के बीच एक साझा "संरचनात्मक ब्लूप्रिंट" बनाकर, यह कंप्यूटर को अविश्वसनीय सटीकता के साथ छवियों का अनुवाद करने की अनुमति देता है, भले ही उन्होंने पहले कभी उन छवियों को एक साथ न देखा हो। यह मेडिकल इमेजिंग और क्रिएटिव AI एडिटिंग के लिए एक बहुत बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →