← नवीनतम पेपर
💻 computer science

Vision-Language Binding in In-Context Image Generation

यह शोध पत्र प्रकट करता है कि FLUX.2 जैसे यूनिफाइड-अटेंशन इन-कॉन्टेक्स्ट इमेज जनरेशन मॉडल्स में, टेक्स्ट टोकन्स एक संरचित चैनल के रूप में कार्य करते हैं जो संदर्भ छवियों से सामान्य दृश्य गुणों (जैसे शैली और रंग) को अवशोषित और प्रसारित करते हैं, जबकि विशिष्ट इंस्टेंस पहचानें (specific instance identities) टेक्स्ट टोकन्स को बायपास करके इमेज-टू-इमेज अटेंशन के माध्यम से सीधे आउटपुट तक प्रवाहित होती हैं।

मूल लेखक: Chris Ge, Rohit Gandikota, Antonio Torralba, Tamar Rott Shaham

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chris Ge, Rohit Gandikota, Antonio Torralba, Tamar Rott Shaham

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट कलाकार है जिसका नाम FLUX.2 है। यह रोबोट एक लिखित निर्देश (जैसे "एक टोपी जोड़ें") और एक संदर्भ फोटो (जैसे एक लाल गेंद की तस्वीर) को लेकर एक नई छवि बना सकता है।

लंबे समय तक, हमें पता नहीं था कि यह रोबोट वास्तव में शब्दों और चित्र के बीच के संबंध को कैसे समझता है। क्या यह पहले चित्र को देखता था और फिर शब्दों को अलग से देखता था? क्या इसने दोनों को एक बड़े सूप की तरह मिला दिया था?

यह शोध पत्र एक जासूस की तरह है, जो रोबोट के काम करने के दौरान उसके मस्तिष्क के भीतर झाँकने के लिए विशेष उपकरणों का उपयोग करता है। उन्होंने पाया कि रोबोट के पास जानकारी को संभालने का एक बहुत ही विशिष्ट, व्यवस्थित तरीका है, जो लगभग एक दो-लेन वाले राजमार्ग (two-lane highway) की तरह है जहाँ विभिन्न प्रकार की जानकारी अलग-अलग सड़कों पर चलती है।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. दो सड़कें: "अनुवादक" बनाम "सीधी रेखा"

शोधकर्ताओं ने पाया कि रोबोट सभी जानकारी के साथ एक जैसा व्यवहार नहीं करता है। यह काम को दो अलग-अलग लेन में विभाजित करता है:

  • लेन A: "अनुवादक" (टेक्स्ट टोकन - Text Tokens)

    • यहाँ क्या यात्रा करता है: सामान्य वाइब (vibes), रंग, शैलियाँ और दृश्य का "मूड"।
    • उपमा: टेक्स्ट टोकन को एक अनुवादक या नोट लेने वाले (note-taker) के रूप में सोचें। जब रोबोट एक "धूप वाले, कार्टून-शैली के पार्क" की संदर्भ फोटो देखता है, तो टेक्स्ट टोकन उस विवरण को आत्मसात कर लेते हैं। वे दृश्य "धूप वाला कार्टून पार्क" को एक मानसिक नोट में बदल देते हैं कि "इसे धूप वाले कार्टून जैसा दिखाओ।"
    • परिणाम: रोबोट इन नोट्स को टेक्स्ट टोकन में लिखता है, और टेक्स्ट टोकन उन्हें अंतिम छवि तक ले जाते हैं। यदि आप टेक्स्ट टोकन को फोटो देखने से रोक देते हैं, तो रोबोट "धूप वाले कार्टून" वाली वाइब को पूरी तरह से भूल जाता है।
  • लेन B: "सीधी रेखा" (इमेज-टू-इमेज अटेंशन - Image-to-Image Attention)

    • यहाँ क्या यात्रा करता है: सटीक विवरण, जैसे किसी व्यक्ति का विशिष्ट चेहरा, एक अनोखा निशान, या किसी विशिष्ट इमारत का सटीक आकार।
    • उपमा: इसे एक निजी तार (private wire) या सीधी फोन कॉल के रूप में सोचें। यदि रोबोट को संदर्भ फोटो से किसी विशिष्ट चेहरे की नकल करनी है, तो वह नोट लेने वाले (टेक्स्ट) से पूछने का झंझट नहीं करता। वह बस संदर्भ फोटो से नई छवि तक एक सीधी रेखा खींच देता है।
    • परिणाम: टेक्स्ट टोकन को पूरी तरह से बायपास कर दिया जाता है। भले ही आप टेक्स्ट को फोटो देखने से रोक दें, रोबोट अभी भी सटीक चेहरे की नकल कर सकता है क्योंकि उसके पास इमेज डेटा के लिए एक सीधी रेखा है।

2. तीन जासूसी उपकरण

यह पता लगाने के लिए, शोधकर्ताओं ने तीन चतुर प्रयोग (interventions) किए:

  • उपकरण 1: "एक्स-रे चश्मा" (T2I लेंस - T2I Lens)

    • उन्होंने रोबोट की प्रक्रिया के बीच में उसे रोका, टेक्स्ट टोकन द्वारा लिखे गए "नोट्स" को लिया, और रोबोगी से केवल उन नोट्स के आधार पर एक चित्र बनाने को कहा (मूल फोटो को अनदेखा करते हुए)।
    • उन्होंने क्या देखा: नोट्स ने सफलतापूर्वक "वाइब" (जैसे, "एक पार्क में लाल गेंद") का वर्णन किया, लेकिन वे किसी विशिष्ट व्यक्ति के सटीक चेहरे का वर्णन करने में विफल रहे। इससे यह साबित हुआ कि टेक्स्ट टोकन सामान्य जानकारी रखते हैं, लेकिन सटीक विवरण नहीं।
  • उपकरण 2: "कैंची" (अटेंशन नॉकआउट - Attention Knockout)

    • उन्होंने रोबोट के हिस्सों के बीच के कनेक्शन को काटने के लिए डिजिटल कैंची का उपयोग किया।
    • उन्होंने क्या देखा: जब उन्होंने फोटो और टेक्स्ट नोट्स के बीच का संबंध काटा, तो रोबोट रंग और शैली को भूल गया। लेकिन जब उन्होंने फोटो और अंतिम छवि के बीच का संबंध काटा, तो रोबोट विशिष्ट चेहरों को भूल गया। इसने दो अलग-अलग लेन की पुष्टि की।
  • उपकरण 3: "मेमोरी स्वैप" (I2I-से-I2I पैचिंग - I2I-to-I2I Patching)

    • उन्होंने एक काम (जैसे, एक लाल गेंद) के "नोट्स" लिए और उन्हें दूसरे काम (जैसे, एक नीली कार) में पेस्ट कर दिया।
    • उन्होंने क्या देखा: नई कार अचानक लाल हो गई! लेकिन यदि उन्होंने किसी व्यक्ति के चेहरे को बदलने के लिए "नोट्स" को बदलने की कोशिश की, तो कुछ नहीं हुआ। यह साबित करता है कि नोट्स रंग/शैली ले जाते हैं, लेकिन पहचान (identity) नहीं।

3. गुप्त स्थान: "पैडिंग" (The Padding)

सबसे रोमांचक खोजों में से एक यह थी कि रोबोट इन नोट्स को टेक्स्ट में कहाँ लिखता है।

  • टेक्स्ट में आमतौर पर "कंटेंट" (वास्तविक शब्द जो आपने टाइप किए हैं) और "पैडिंग" (मानक लंबाई बनाने के लिए जोड़ा गया खाली स्थान) होता है।
  • शोधकर्ताओं ने पाया कि रोबोट फोटो की वाइब को स्टोर करने के लिए वास्तविक शब्दों को अनदेखा करता है। इसके बजाय, वह सभी दृश्य विवरणों (रंग, शैलियाँ) को खाली पैडिंग स्पेस में लिखता है।
  • उपमा: यह एक छात्र की तरह है जो मुख्य पृष्ठ पर वास्तविक होमवर्क के उत्तर लिखता है, लेकिन पेज के नीचे खाली मार्जिन स्थान का उपयोग शिक्षक की पोशाक के बारे में गुप्त नोट्स लिखने के लिए करता है। रोबोट दृश्य स्मृति को रखने के लिए टेक्स्ट के "खाली स्थान" का उपयोग करता है।

सारांश

शोध पत्र निष्कर्ष निकालता है कि भले ही रोबोट सब कुछ संसाधित करने के लिए एक बड़े मस्तिष्क (एक एकीकृत अटेंशन स्ट्रीम) का उपयोग करता है, फिर भी यह स्वाभाविक रूप से खुद को व्यवस्थित करता है:

  1. टेक्स्ट टोकन (विशेष रूप से खाली पैडिंग) सामान्य विवरणों (रंग, शैलियाँ, दृश्य) के लिए एक वाहक (carrier) के रूप में कार्य करते हैं।
  2. प्रत्यक्ष इमेज कनेक्शन सटीक विवरणों (चेहरे, विशिष्ट वस्तुएं) के लिए एक हाई-स्पीड लाइन के रूप में कार्य करते हैं।

रोबोट केवल शब्दों और चित्रों को अंधाधुंध नहीं मिला रहा है; इसके पास यह तय करने के लिए एक अंतर्निहित, कुशल प्रणाली है कि क्या कहाँ जाए, जिससे यह सुनिश्चित होता है कि सामान्य वाइब्स को शब्दों में अनुवादित किया जाए, जबकि सटीक विवरण सीधे कॉपी किए जाएं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →