← नवीनतम पेपर
💻 computer science

CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions

यह शोध पत्र CREval, एक स्वचालित और व्याख्यात्मक QA-आधारित मूल्यांकन पाइपलाइन, और CREval-Bench, 800 से अधिक नमूनों के साथ एक व्यापक बेंचमार्क, को प्रस्तुत करता है, जो जटिल और रचनात्मक हेरफेर कार्यों को संभालने में अत्याधुनिक इमेज एडिटिंग मॉडलों की वर्तमान सीमाओं का व्यवस्थित रूप से आकलन करने और उन्हें उजागर करने के लिए है।

मूल लेखक: Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li, Wangmeng Zuo, Hongxun Yao

प्रकाशित 2026-03-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li, Wangmeng Zuo, Hongxun Yao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई आर्ट स्टूडियो है जहाँ आप कंप्यूटर को कह सकते हैं, "मेरे कुत्ते की इस फोटो को बादलों से बनी केप पहने एक सुपरहीरो में बदल दो," और वह बिल्कुल वैसा ही करने की कोशिश करता है। इन्स्ट्रक्शन-बेस्ड इमेज एडिटिंग (Instruction-Based Image Editing) इसी के बारे में है।

लेकिन यहाँ समस्या यह है: आपको कैसे पता चलेगा कि कंप्यूटर ने वास्तव में अच्छा काम किया है या नहीं? क्या उसने आपके निर्देशों का पालन किया? क्या उसने आपके कुत्ते को आपके कुत्ते जैसा ही रखा? क्या तस्वीर धुंधली या अजीब है?

वर्तमान में, इन परिणामों की जाँच करना किसी छात्र के निबंध को केवल अंतिम स्कोर देखकर ग्रेड देने जैसा है बिना शिक्षक के नोट्स पढ़े। यह अस्पष्ट है, और कभी-कभी "शिक्षक" (AI इवैल्यूएटर) पक्षपाती होता है या यह नहीं बताता कि उसने खराब ग्रेड क्यों दिया।

यह पेपर CREval पेश करता है, जो AI आर्ट प्रोजेक्ट्स को ग्रेड देने का एक नया, सुपर-स्मार्ट तरीका है। इसे एक जज के बजाय एक डिटेक्टिव (जासूस) को काम पर रखने की तरह समझें।

समस्या: "ब्लैक बॉक्स" जज

इस पेपर से पहले, शोधकर्ता एक एडिट की गई इमेज को देखने के लिए बड़े AI मॉडल्स का उपयोग करते थे और बस कहते थे, "स्कोर: 7/10।"

  • समस्या: हमें नहीं पता था कि यह 7 क्यों था। क्या AI ने केप (cape) को मिस कर दिया? क्या कुत्ता बिल्ली जैसा दिख रहा था? स्कोर एक "ब्लैक बॉक्स" था—एक रहस्य।
  • अंतराल (Gap): मौजूदा परीक्षण ज्यादातर सरल कार्यों के लिए थे जैसे "व्यक्ति को हटा दें" या "आसमान को नीला कर दें।" वे रचनात्मक, जंगली विचारों जैसे कि "योद्धा को उष्णकटिबंधीय मछली के सॉफ्ट टॉय (plushie) में बदल दें" या "काउबॉय घोड़े के बारे में एक कॉमिक स्ट्रिप बनाएं" के लिए नहीं बने थे।

समाधान: CREval (डिटेक्टिव)

लेखकों ने CREval बनाया, जिसका अर्थ है Creative Review Evaluation। AI से यह पूछने के बजाय कि "यह कितना अच्छा है?", CREval AI से विशिष्ट हाँ/नहीं वाले प्रश्न (एक क्विज़ की तरह) पूछता है।

कल्पना कीजिए कि आप एक छात्र के चित्र को ग्रेड दे रहे हैं। केवल ग्रेड देने के बजाय, आप पूछते हैं:

  1. "क्या छात्र ने टोपी बनाई है?" (हाँ/नहीं)
  2. "क्या टोपी नीली है, जैसा कि अनुरोध किया गया था?" (हाँ/नहीं)
  3. "क्या उन्होंने मूल चेहरा बरकरार रखा है?" (हाँ/नहीं)
  4. "क्या रेखाएं डगमगाती और बिखरी हुई हैं?" (हाँ/नहीं)

CREval बिल्कुल यही करता है, लेकिन AI छवियों के लिए। यह मूल्यांकन को तीन मुख्य श्रेणियों में विभाजित करता है:

  1. इंस्ट्रक्शन फॉलोइंग (Instruction Following - IF): क्या AI ने वास्तव में वही किया जो आपने कहा था? (जैसे, "क्या इसने रोबोट को केक में बदल दिया?")
  2. विजुअल कंसिस्टेंसी (Visual Consistency - VC): क्या AI ने मूल फोटो के महत्वपूर्ण हिस्सों को बरकरार रखा? (जैसे, "क्या यह अभी भी वही रोबोट है, बस एक केक-रोबोट है, या यह पूरी तरह से एक अलग पात्र बन गया है?")
  3. विजुअल क्वालिटी (Visual Quality - VQ): क्या तस्वीर अच्छी दिखती है? (जैसे, "क्या हाथ अजीब हैं? क्या बनावट धुंधली है?")

प्लेग्राउंड: CREval-Bench

इस नए डिटेक्टिव सिस्टम को टेस्ट करने के लिए, लेखकों ने CREval-Bench नामक एक विशाल प्लेग्राउंड बनाया।

  • इसमें 800 से अधिक जटिल, रचनात्मक चुनौतियाँ शामिल हैं।
  • ये सरल कार्य नहीं हैं। ये ऐसी चीजें हैं जैसे: "इस शादी की फोटो को पारंपरिक चीनी कार्टून में बदलें," या "इस पहाड़ को जमीन से उठते हुए एक विशाल पत्थर के टाइटन की तरह दिखाएं।"
  • यह AI आर्ट मॉडल्स के लिए एक "फाइनल एग्जाम" की तरह है, जिसे पिछले परीक्षणों की तुलना में बहुत कठिन बनाया गया है।

उन्होंने क्या पाया? (रिपोर्ट कार्ड)

उन्होंने शीर्ष AI मॉडल्स (दोनों फ्री/ओपन-सोर्स और पेड/क्लोज्ड-सोर्स) को इस नए टेस्ट से गुजारा। यहाँ निर्णय है:

  • अच्छी खबर: पेड, "क्लोज्ड-सोर्स" मॉडल्स (जैसे Seedream 4.0 और Gemini 2.5) इन जंगली निर्देशों का पालन करने में वर्तमान में सबसे अच्छे हैं। वे उन टॉप आर्ट स्टूडेंट्स की तरह हैं जो जटिल प्रॉम्प्ट्स को संभाल सकते हैं।
  • बुरी खबर: बेहतरीन मॉडल्स भी संघर्ष करते हैं। वे अक्सर मूल पात्र की पहचान (Visual Consistency) बनाए रखने में विफल रहते हैं। उदाहरण के लिए, वे किसी व्यक्ति को केक में बदल सकते हैं, लेकिन केक उस व्यक्ति जैसा बिल्कुल नहीं दिखता।
  • ओपन-सोर्स की उम्मीद: फ्री मॉडल्स तेजी से बराबरी कर रहे हैं! Qwen-Image-Edit जैसे मॉडल्स आश्चर्यजनक रूप से अच्छा प्रदर्शन कर रहे हैं, जो दिखाते हैं कि फ्री और पेड टूल्स के बीच का अंतर कम हो रहा है।

यह क्यों मायने रखता है?

CREval को मानव रचनात्मकता और AI क्षमता के बीच एक यूनिवर्सल ट्रांसलेटर के रूप में समझें।

  • डेवलपर्स के लिए: यह उन्हें बताता है कि उनका AI कहाँ विफल हो रहा है (जैसे, "आप निर्देश मानने में महान हैं, लेकिन आप चेहरे बिगाड़ देते हैं")।
  • उपयोगकर्ताओं के लिए: यह हमें यह जानने का एक विश्वसनीय तरीका देता है कि कौन सा AI टूल वास्तव में हमारे रचनात्मक, अजीब और अद्भुत विचारों को संभालने में अच्छा है।

संक्षेप में, CREval हमें यह अनुमान लगाने से रोकता है कि AI आर्ट अच्छा है या नहीं। यह हमें एक स्पष्ट, चरण-दर-चरण रिपोर्ट कार्ड देता है जो विस्तार से बताता है कि AI ने क्या सही किया और उसने कहाँ गलती की, जिससे हमें रचनात्मक अभिव्यक्ति के लिए बेहतर उपकरण बनाने में मदद मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →