← नवीनतम पेपर
💬 NLP

CROC: Evaluating and Training T2I Metrics with Pseudo- and Human-Labeled Contrastive Robustness Checks

यह शोध पत्र CROC को प्रस्तुत करता है, जो स्वचालित कंट्रास्टिव रोबस्टनेस चेक के लिए एक स्केलेबल फ्रेमवर्क है जो एक बड़ा छद्म-लेबल वाला (pseudo-labeled) डेटासेट और एक मानव-पर्यवेक्षित बेंचमार्क उत्पन्न करता है ताकि टेक्स्ट-टू-इमेज मेट्रिक्स का व्यवस्थित रूप से मूल्यांकन किया जा सके, मौजूदा विधियों में महत्वपूर्ण रोबस्टनेस खामियों को उजागर किया जा सके और अत्याधुनिक ओपन-सोर्स मेट्रिक, CROCScore के प्रशिक्षण को सक्षम बनाया जा सके।

मूल लेखक: Christoph Leiter, Yuki M. Asano, Margret Keuper, Steffen Eger

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Christoph Leiter, Yuki M. Asano, Margret Keuper, Steffen Eger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक टैलेंट शो के जज हैं जहाँ प्रतियोगी (AI मॉडल) आपके द्वारा दिए गए मौखिक विवरणों के आधार पर चित्र बनाने की कोशिश करते हैं। आपका काम यह तय करना है कि कौन से चित्र सबसे अच्छे हैं। लेकिन यहाँ एक पेच है: आपके पास न तो स्टॉपवॉच है और न ही स्केल। आपको यह तय करने के लिए कि विजेता कौन है, एक "जज के स्कोरकार्ड" (एक स्वचालित मीट्रिक) पर निर्भर रहना होगा।

समस्या क्या है? कभी-कभी स्कोरकार्ड खराब होता है। यह सफेद सेब के बजाय नीले सेब के चित्र को उच्च स्कोर दे सकता है, या यह ध्यान देने में विफल हो सकता है कि एक कुत्ते के चार के बजाय छह पैर हैं।

यह पेपर पेश करता है CROC, एक नया तरीका यह परीक्षण करने के लिए कि क्या ये स्कोरकार्ड वास्तवं में अपना काम कर रहे हैं, और एक बेहतर स्कोरकार्ड बनाने के लिए।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: टूटा हुआ स्कोरकार्ड

AI आर्ट (Text-to-Image) की दुनिया में, हमारे पास कई उपकरण हैं जो स्वचालित रूप से यह ग्रेड देते हैं कि एक चित्र टेक्स्ट प्रॉम्प्ट के साथ कितनी अच्छी तरह मेल खाता है। लेकिन हमें कैसे पता चलेगा कि वे उपकरण अच्छे हैं?

  • पुराना तरीका: हम पहले हजारों चित्रों को ग्रेड करने के लिए मनुष्यों का उपयोग करते थे ताकि यह देखा जा सके कि क्या स्कोरकार्ड उनके साथ सहमत है। यह हर एक ड्राइंग को फिर से ग्रेड करने के लिए कला समीक्षकों की एक टीम को काम पर रखने जैसा है। यह महंगा, धीमा और उबाऊ है।
  • जोखिम: यदि स्कोरकार्ड खराब है, तो हम एक भयानक AI को प्रतिभाशाली समझ सकते हैं, या एक अच्छे AI को इसलिए निकाल सकते हैं क्योंकि स्कोरकार्ड ने उसे गलत समझा।

2. समाधान: CROC ("अंतर पहचानें" खेल)

लेखकों ने CROC (कॉन्ट्रास्टिव रोबस्टनेस चेक्स) नामक एक फ्रेमवर्क बनाया है। इसे एक विशाल, स्वचालित "अंतर पहचानें" (Spot the Difference) खेल के रूप में समझें।

सब कुछ ग्रेड करने के लिए मनुष्यों से पूछने के बजाय, उन्होंने एक ऐसी मशीन बनाई है जो स्कोरकार्ड को चकमा देने के लिए "सही" और "गलत" उदाहरणों के जोड़े बनाती है।

  • सेटअप: सिस्टम दो प्रॉम्प्ट बनाता है:
    • प्रॉम्प्ट A: "एक लाल सेब।"
    • प्रॉम्प्ट B: "एक नीला सेब।"
  • परीक्षण: इसके बाद यह स्कोरकार्ड को दो चित्र दिखाता है:
    • चित्र 1: एक लाल सेब (प्रॉम्प्ट A से मेल खाता है)।
    • चित्र 2: एक नीला सेब (प्रॉम्प्ट B से मेल खाता है)।
  • लक्ष्य: एक अच्छा स्कोरकार्ड लाल सेब/प्रॉम्प्ट A के जोड़े को नीले सेब/प्रॉम्प्ट A के जोड़े की तुलना में अधिक स्कोर देना चाहिए। यदि स्कोरकार्ड भ्रमित हो जाता है और नीले सेब को उच्च स्कोर देता है, तो वह परीक्षण में विफल हो गया है।

उन्होंने इसे विभिन्न श्रेणियों (रंग, शरीर के अंग, गिनती, स्थानिक संबंध जैसे "के बाईं ओर" या "के ऊपर") में 10 लाख बार किया। इससे एक विशाल डेटासेट बना जिसे CROCsyn कहा जाता है।

3. "मानवीय" सुरक्षा जाल (CROChum)

कभी-कभी, "अंतर पहचानें" वाली मशीन भी भ्रमित हो सकती है क्योंकि चित्र बनाने वाला AI भी त्रुटिपूर्ण हो सकता है। इसे ठीक करने के लिए, लेखकों ने एक छोटा, सुपर-हार्ड डेटासेट बनाया जिसे CROChum कहा जाता है।

  • उन्होंने सबसे कठिन श्रेणियों को चुना (जैसे हाथ बनाना, उंगलियों की गिनती करना, या "हाँ" बनाम "नहीं" को समझना)।
  • उन्होंने यह सुनिश्चित करने के लिए इन विशिष्ट मामलों की मैन्युअल रूप से जांच की कि "सही" और "गलत" लेबल 100% सटीक हैं। यह सत्यापित करने के लिए एक "गोल्ड स्टैंडर्ड" के रूप में कार्य करता है कि क्या स्वचालित परीक्षण काम कर रहे हैं।

4. परिणाम: एक बेहतर स्कोरकार्ड बनाना (CROCScore)

अपने "अंतर पहचानें" खेल से मिले 10 लाख उदाहरणों का उपयोग करके, लेखकों ने एक बिल्कुल नया स्कोरकार्ड प्रशिक्षित किया जिसे CROCScore कहा जाता है।

  • उपमा: कल्पना कीजिए कि आप गणित में कमजोर छात्र को 10 लाख अभ्यास प्रश्न देते हैं, जिसमें उसकी गलतियों पर तुरंत फीडबैक मिलता है, और फिर उसे फिर से टेस्ट करते हैं।
  • परिणाम: CROCScore सबसे अच्छा ओपन-सोर्स स्कोरकार्ड बन गया। इसने अन्य सभी मौजूदा उपकरणों को हरा दिया, विशेष रूप से उंगलियों की गिनती या स्थानिक संबंधों जैसी कठिन चीजों पर।

5. उन्होंने क्या खोजा? ("पकड़े जाने वाली गलतियाँ")

CROC का उपयोग करके, उन्होंने वर्तमान स्कोरकार्ड में कुछ मजेदार लेकिन गंभीर खामियां पाईं:

  • "नकार" (Negation) की अंध बिंदु: कई स्कोरकार्ड "नहीं" शब्द को समझने में बहुत खराब हैं। यदि आप "बिना टोपी के एक बिल्ली" मांगते हैं, तो कई उपकरण ऐसे व्यवहार करते हैं जैसे आपने केवल "एक बिल्ली" मांगी हो और "बिना" को अनदेखा कर देते हैं।
  • "शरीर के अंग" का भ्रम: लगभग सभी ओपन-सोस उपकरण शरीर के अंगों के साथ संघर्ष करते हैं। वे अक्सर बाएं हाथ को दाएं हाथ के साथ भ्रमित कर देते हैं, या उंगलियों की गिनती गलत करते हैं। यह एक ऐसे डॉक्टर की तरह है जो यह नहीं बता सकता कि कौन सा पैर कौन सा है।
  • "लेआउट" का संघर्ष: चीजें कहाँ रखी गई हैं (जैसे, "मेज के नीचे एक कुत्ता") यह समझना इन उपकरणों के लिए केवल वस्तुओं को पहचानने की तुलना में बहुत कठिन है।

सारांश

यह पेपर मूल रूप से कह रहा है:

  1. स्कोरकार्डों पर आँख मूंदकर भरोसा करना बंद करें। उनमें छिपे हुए ब्लाइंड स्पॉट हैं।
  2. हमने उन ब्लाइंड स्पॉट को स्वचालित रूप से खोजने के लिए एक विशाल "अंतर पहचानें" परीक्षण (CROC) बनाया है।
  3. हमने उस परीक्षण का उपयोग एक नए, स्मार्ट स्कोरकार्ड (CROCScore) को प्रशिक्षित करने के लिए किया जो वर्तमान में उपलब्ध सबसे अच्छा ओपन-सोर्स विकल्प है।
  4. हमने पाया कि AI अभी भी विशिष्ट चीजों जैसे गिनती, शरीर के अंगों और "नहीं" को समझने में बुरा है, और अब हमारे पास यह मापने का एक तरीका है कि वह कितना बुरा है।

यह एक बड़ा कदम है क्योंकि यह शोधकर्ताओं को महत्वपूर्ण कार्यों के लिए AI टूल्स पर भरोसा करने से पहले उन्हें ठीक करने का एक विश्वसनीय तरीका देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →