← नवीनतम पेपर
💻 computer science

MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models

यह शोध पत्र MICON-Bench प्रस्तुत करता है, जो एकीकृत मल्टीमॉडल मॉडलों में मल्टी-इमेज कॉन्टेक्स्ट जनरेशन के मूल्यांकन के लिए एक व्यापक बेंचमार्क है, साथ ही क्रॉस-इमेज सुसंगतता को बढ़ाने और मतिभ्रम (hallucinations) को कम करने के लिए एक प्रशिक्षण-मुक्त डायनेमिक अटेंशन रीबैलेंसिंग (DAR) तंत्र और एक MLLM-संचालित मूल्यांकन ढांचा भी प्रदान करता है।

मूल लेखक: Mingrui Wu, Hang Liu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingrui Wu, Hang Liu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त स्टूडियो में एक आर्ट डायरेक्टर हैं। आपके पास बेहद प्रतिभाशाली AI कलाकारों (जिन्हें यूनिफाइड मल्टीमॉडल मॉडल्स कहा जाता है) की एक टीम है। ये कलाकार एक साधारण विवरण के आधार पर चित्र बनाने में माहिर हैं, जैसे "मैट पर एक बिल्ली।"

लेकिन अब, आप चाहते हैं कि वे कुछ बहुत कठिन करें: तीन अलग-अलग तस्वीरों को मिलाकर एक नया, उत्तम दृश्य बनाना।

आप उन्हें देते हैं:

  1. एक भेड़िये की फोटो।
  2. एक टेडी बियर की फोटो।
  3. एक आदमी की फोटो।

आप पूछते हैं: "भेड़िये, भालू और आदमी को एक म्यूजियम में एक साथ रखो।"

यहाँ समस्या यह है: AI कलाकार अक्सर भ्रमित हो जाते हैं। वे शायद भालू को भूल जाएं, भेड़िये को कुत्ता बना दें, या आदमी को हवा में तैरता हुआ दिखा दें। वे एक साथ कई तस्वीरों के विवरणों को "याद रखने" में संघर्ष करते हैं।

यह पेपर इस गड़बड़ी को ठीक करने के लिए दो चीजें पेश करता है: एक टेस्ट यह देखने के लिए कि कौन अच्छा है, और एक नया तरीका उन्हें बेहतर बनाने में मदद करने के लिए।


भाग 1: टेस्ट (MICON-Bench)

उपमा: "छह-स्टेशन वाला बाधा दौड़ (Obstacle Course)"

पहले, हम केवल सरल कार्यों पर AI का परीक्षण करते थे, जैसे "एक बिल्ली बनाओ।" लेकिन यह देखने के लिए कि क्या वे जटिल काम संभाल सकते हैं, लेखकों ने MICON-Bench बनाया है। इसे एक कठिन बाधा दौड़ के रूप में समझें जिसमें छह विशिष्ट स्टेशन हैं। पास होने के लिए, AI को यह साबित करना होगा कि वह क्या कर सकता है:

  1. ऑब्जेक्ट कंपोजिशन (वस्तु संयोजन): "इन तीन रैंडम चीजों को एक कमरे में एक साथ रखो।" (क्या वे उन सभी को फिट कर सकते हैं?)
  2. स्पेशियल कंपोजिशन (स्थानिक संयोजन): "भेड़िये को बाईं ओर, भालू को बीच में और आदमी को दाईं ओर रखो।" (क्या वे चीजों के कहाँ जाने के निर्देशों का पालन कर सकते हैं?)
  3. एट्रीब्यूट डिसेंटैंगलमेंट (विशेषता पृथक्करण): "फोटो A से गाय को लो, उसे फोटो B की शैली में पेंट करो, और उसे फोटो C के बैकग्राउंड में रखो।" (क्या वे भ्रमित हुए बिना विशेषताओं को मिला और बदल सकते हैं?)
  4. कंपोनेंट ट्रांसफर (घटक स्थानांतरण): "फोटो A में लड़की के हेलमेट को लो और उसे फोटो B के लड़के पर लगा दो।" (क्या वे विशिष्ट हिस्सों को बदल सकते हैं?)
  5. FG/BG कंपोजिशन (अग्रभूमि/पृष्ठभूमि संयोजन): "फोटो A से व्यक्ति को काटें और उन्हें फोटो B के बैकग्राउंड में पेस्ट करें।" (क्या वे किनारों को सुचारू रूप से मिला सकते हैं?)
  6. स्टोरी जनरेशन (कहानी निर्माण): "यहाँ एक कहानी के अब तक के तीन फोटो हैं। चौथी फोटो में दिखाओ कि आगे क्या होता है।" (क्या वे कारण और प्रभाव को समझ सकते हैं?)

वे ग्रेडिंग कैसे करते हैं:
हर तस्वीर को इंसान द्वारा देखने के बजाय (जिसमें बहुत समय लगता है), वे एक सुपर-स्मार्ट AI जज (MLLM) का उपयोग करते हैं जो रेफरी के रूप में कार्य करता है। यह जज हर इमेज के लिए एक "चेकलिस्ट" (Checkpoints) की जांच करता है:

  • क्या इसमें भेड़िया शामिल था? (हाँ/नहीं)
  • क्या भेड़िया वास्तव में एक भेड़िया है या सिर्फ एक कुत्ता? (हाँ/नहीं)
  • क्या लाइटिंग सुसंगत है? (हाँ/नहीं)

यदि AI किसी "हार्ड कंस्ट्रेंट" (जैसे भेड़िये को पूरी तरह भूल जाना) में विफल रहता है, तो उसे उस हिस्से के लिए शून्य मिलता है। यह एक निष्पक्ष, स्वचालित स्कोर बनाता है।


भाग 2: समाधान (डायनेमिक अटेंशन रीबैलेंसिंग - DAR)

उपमा: "स्पॉटलाइट मैनेजर"

लेखकों ने देखा कि जब ये AI कलाकार एक साथ तीन फोटो देखने की कोशिश करते हैं, तो उनका "अटेंशन" (ध्यान) बिखर जाता है।

  • समस्या: कल्पना कीजिए कि AI एक साथ तीन लोगों को बात करते हुए सुनने की कोशिश कर रहा है। शब्दों पर ध्यान केंद्रित करने के बजाय, वह बैकग्राउंड के शोर, दीवारों के रंग, या व्यक्ति के जूतों से विचलित हो जाता है। वह "हैलुसिनेट" (चीजें बनाना) करने लगता है क्योंकि वह रेफरेंस फोटो के गलत हिस्सों को देख रहा होता है।

  • समाधान (DAR): लेखकों ने एक "स्पॉटलाइट मैनेजर" बनाया है जिसे डायनेमिक अटेंशन रीबैलेंसिंग (DAR) कहा जाता है।

    • यह कैसे काम करता है: AI पेंटिंग शुरू करने से पहले, DAR देखता है कि AI वर्तमान में कहाँ "देख" रहा है (इसका अटेंशन मैप)।
    • समायोजन: यदि AI भेड़िये की फोटो के बैकग्राउंड (अप्रासंगिक) को बहुत अधिक देख रहा है, तो DAR उस स्पॉटलाइट को धीमा कर देता है। यदि AI भेड़िये के चेहरे (प्रासंगिक) को अनदेखा कर रहा है, तो DAR उस स्पॉटलाइट की चमक को अधिकतम तक बढ़ा देता है।
    • परिणाम: AI को मजबूर किया जाता है कि वह केवल महत्वपूर्ण विवरणों (भेड़िये का चेहरा, आदमी की शर्ट) पर ध्यान केंद्रित करे और शोर को अनदेखा करे।

सबसे अच्छी बात? आपको AI को फिर से ट्रेन करने या उसे नए सबक सिखाने की आवश्यकता नहीं है। यह एक "प्लग-एंड-प्ले" टूल है। आप इसे जनरेशन प्रक्रिया के दौरान बस चालू कर देते हैं, और यह तुरंत AI को स्मार्ट बना देता है।


बड़ी तस्वीर (The Big Picture)

उन्होंने क्या पाया?

  • टेस्ट: आज के सबसे उन्नत AI मॉडल भी इन मल्टी-इमेज कार्यों में संघर्ष करते हैं। वे अक्सर पहचान (identity) को मिला देते हैं या स्थानिक व्यवस्था (spatial arrangement) को गलत कर देते हैं।
  • समाधान: जब लेखकों ने अपने "स्पॉटलाइट मैनेजर" (DAR) को इन मॉडल्स में जोड़ा, तो परिणाम नाटकीय रूप से सुधर गए। AI पात्रों की निरंतरता बनाए रखने, वस्तुओं को सही स्थानों पर रखने और छवियों को सहजता से मिलाने में बहुत बेहतर हो गया।

संक्षेप में:
पेपर कहता है, "हे, वर्तमान AI कई फोटो को मिलाने में बुरा है। हमने इसे साबित करने के लिए एक कठिन टेस्ट (MICON-Bench) बनाया है, और हमने एक सरल, मुफ्त ट्रिक (DAR) खोजा है जो एक स्पॉटलाइट की तरह काम करता है, जो AI को सही चीजों पर ध्यान केंद्रित करने के लिए मजबूर करता है ताकि वह अंततः काम को सही ढंग से कर सके।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →