← नवीनतम पेपर
💻 computer science

Editing Everything Everywhere All at Once

यह शोध पत्र MICE को प्रस्तुत करता है, जो मल्टीमॉडल डिफ्यूजन ट्रांसफॉर्मर्स के लिए एक प्रशिक्षण-मुक्त रणनीति है, जो अटेंशन मैकेनिज्म को नियंत्रित करके सिमेंटिक इंटरफेरेंस और एट्रिब्यूट लीकेज को रोकने के माध्यम से एकल फॉरवर्ड पास में स्केलेबल, उच्च-निष्ठा वाले मल्टी-इंस्टेंस इमेज एडिटिंग को सक्षम बनाता है।

मूल लेखक: Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक व्यस्त कमरे की डिजिटल फोटो है, और आप एक साथ इसमें लगभग सब कुछ बदलना चाहते हैं: कॉफी कप को पानी की बोतल में बदलना, छत की टाइलों को लकड़ी के बीमों से बदलना, व्हाइटबोर्ड को ब्लैकबोर्ड से बदलना, और खिड़की के बाहर के दृश्य को बर्फीले पहाड़ों में बदलना।

यह काम एक समय में एक चीज़ करके करना (पहले कप बदलना, फिर छत, फिर बोर्ड) धीमा होता है और अक्सर एक ऐसा अव्यवẩn परिणाम देता है जहाँ बदलाव आपस में ठीक से मेल नहीं खाते। लेकिन इसे एक ही "झटके" में करना वर्तमान AI के लिए अविश्वसनीय रूप से कठिन है। यदि आप AI को एक साथ सब कुछ करने के लिए कहते हैं, तो वह अक्सर भ्रमित हो जाता है। वह गलती से कॉफी कप पर बर्फीले पहाड़ पेंट कर सकता है, या लकड़ी के बीमों को ब्लैकबोर्ड जैसा दिखा सकता है। इसे "एट्रीब्यूट लीकेज" (attribute leakage) कहा जाता है—जहाँ निर्देश एक-दूसरे में मिल जाते हैं।

समस्या: "भीड़भाड़ वाला कमरा" प्रभाव
AI के दिमाग को एक भीड़भाड़ वाले कमरे के रूप में सोचें जहाँ हर कोई निर्देश चिल्ला रहा है। यदि आप कमरे से एक ही समय में कहते हैं, "कप बदलो" और "छत बदलो", तो AI अभिभूत हो जाता है। वह सबकी बात सुनने की कोशिश करता है, लेकिन आवाजें आपस में मिल जाती हैं। "कप" का निर्देश गलती से "छत" के निर्देश को पकड़ सकता है, जिससे एक ऐसा कप बन सकता है जो छत जैसा दिखता है। जैसे-जैसे आप बदलाव जोड़ते हैं, भ्रम और भी बढ़ जाता है, और अंतिम छवि अराजक दिखाई देती है।

समाधान: MICE (मल्टी-इंस्टेंस कंकरेंट एडिटिंग)
इस शोध पत्र के लेखकों ने एक नई विधि बनाई है जिसे MICE कहा जाता है। MICE को AI के दिमाग के लिए एक सुपर-कुशल ट्रैफिक कंट्रोलर के रूपas सोचें। सभी को एक-दूसरे पर चिल्लाने देने के बजाय, MICE प्रत्येक निर्देश को अपना एक "लेन" (lane) देता है, जबकि वे अभी भी बड़ी तस्वीर को देख सकते हैं।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

  1. सेगमेंटेशन मास्क (स्टेंसिल):
    सबसे पहले, उपयोगकर्ता (या एक सहायक टूल) उन चीजों के चारों ओर रूपरेखा खींचता है जिन्हें वे बदलना चाहते हैं। कल्पना कीजिए कि ये कागज पर स्टेंसिल या कट-आउट आकृतियों की तरह हैं। MICE इन स्टेंसिल का उपयोग यह जानने के लिए करता है कि छवि का कौन सा हिस्सा किस निर्देश से संबंधित है।

  2. "सॉफ्ट" दीवार (गौसियन ब्लर):
    पुराने तरीके इन स्टेंसिल के बीच सख्त, कंक्रीट की दीवारें बनाने की कोशिश करते थे। यदि आप कप और छत के बीच कंक्रीट की दीवार रखते हैं, तो परिणाम टेढ़ा-मेढ़ा और नकली दिखता है, जैसे कोई बुरा कोलाज हो।
    MICE एक सॉफ्ट, धुंधली दीवार का उपयोग करता है। यह एक कोमल ग्रेडिएंट बनाता है। AI जानता है, "ठीक है, यह हिस्सा निश्चित रूप से कप है, और वह हिस्सा निश्चित रूप से छत है।" लेकिन जहाँ वे मिलते हैं, वहाँ की दीवार धुंधली हो जाती है। इससे कप मेज के साथ स्वाभाविक रूप से मिल पाता है, और छत दीवार के साथ घुलमिल जाती है, बिना इस डर के कि कप के निर्देश छत पर हावी हो जाएंगे।

  3. "नो-गो" ज़ोन (प्रवेश निषेध क्षेत्र):
    MICE अदृश्य "प्रवेश निषेध" संकेत भी लगाता है। यह AI को बताता है: "कप के निर्देश को कप से बात करने की अनुमति है, और वह पास की मेज से भी बात कर सकता है ताकि वे मेल खा सकें। लेकिन उसे बर्फीले पहाड़ों के निर्देश से बात करने की सख्त मनाही है।" यह "पहाड़" की बनावट को गलती से "कप" पर लीक होने से रोकता है।

  4. एक पास, एक बार में:
    MICE का जादू यह है कि यह यह सब एक सिंगल फॉरवर्ड पास में करता है। कल्पना कीजिए कि एक चित्रकार जो आमतौर पर कप को पेंट करता है, फिर सूखने का इंतजार करता है, फिर छत को पेंट करता है, फिर से इंतजार करता है, फिर बोर्ड को पेंट करता है। MICE एक ऐसे चित्रकार की तरह है जो एक ही बार में, एक ही सहज ब्रशस्ट्रोक में कप, छत, खिड़की और कालीन को पेंट कर सकता है, जिसमें हर हिस्सा एकदम सही और जुड़ा हुआ दिखता है।

यह क्यों महत्वपूर्ण है
शोधकर्ताओं ने इसका परीक्षण MICE-Bench नामक एक नई, बहुत कठिन चुनौती पर किया। जबकि अन्य परीक्षण केवल एक बार में 3 चीजें बदलने के लिए कहते थे, MICE-Bench ने एक ही छवि में औसतन 8.5 चीजें बदलने के लिए कहा (कुछ मामलों में 40 बदलाव तक थे!)।

परिणामों ने दिखाया कि MICE इन कार्यों में बहुत बेहतर है:

  • सुनना: यह वास्तव में सही वस्तु को सही चीज़ में बदलता है (उदाहरण के लिए, कप एक बोतल बन जाता है, न कि कुत्ता)।
  • संरक्षण: जिन हिस्सों को आपने बदलने के लिए नहीं कहा था, उन्हें यह बिल्कुल वैसा ही छोड़ देता है जैसा वे थे।
  • मिश्रण: नए ऑब्जेक्ट्स फोटो में स्वाभाविक रूप से फिट बैठते हैं, जिनमें सही रोशनी और छाया होती है।

सारांश में
MICE एक "ट्रेनिंग-फ्री" टूल है (इसे पेंट करना सीखने के लिए फिर से सिखाने की आवश्यकता नहीं है; यह बस इस बात को बदल देता है कि AI कैसे ध्यान केंद्रित करता है)। यह एक स्मार्ट ऑर्गनाइज़र के रूप में कार्य करता है जो विभिन्न संपादन निर्देशों को अलग रखते हुए भी सामंजस्यपूर्ण बनाए रखता है, जिससे आप एक जटिल छवि को एक ही बार में कई बदलावों के साथ संपादित कर सकते हैं, बिना AI के भ्रमित हुए या विवरणों के आपस में मिले बिना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →