← नवीनतम पेपर
💻 computer science

E-comIQ-ZH: A Human-Aligned Dataset and Benchmark for Fine-Grained Evaluation of E-commerce Posters with Chain-of-Thought

यह शोधपत्र E-comIQ-ZH को प्रस्तुत करता है, जो एक व्यापक ढांचा है जिसमें विशेषज्ञ-कैलिब्रेटेड चेन-ऑफ-थॉट तर्क के साथ E-comIQ-18k डेटासेट, E-comIQ-M मूल्यांकन मॉडल और E-comIQ-Bench बेंचमार्क शामिल हैं, जिसे चीनी ई-कॉमर्स पोस्टरों के पहले स्वचालित, मानव-संरेखित और सूक्ष्म-स्तरीय मूल्यांकन के लिए डिज़ाइन किया गया है।

मूल लेखक: Meiqi Sun, Mingyu Li, Junxiong Zhu

प्रकाशित 2026-02-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Meiqi Sun, Mingyu Li, Junxiong Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ E-comIQ-ZH पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

समस्या: "AI पोस्टर फैक्ट्री" गलतियाँ (Typos) कर रही है

एक विशाल, हाई-टेक फैक्ट्री की कल्पना करें जो हर दिन लाखों ऑनलाइन शॉपिंग पोस्टर प्रिंट करने के लिए AI का उपयोग करती है। इन पोस्टरों को सुंदर दिखना चाहिए, उत्पाद स्पष्ट रूप से दिखना चाहिए और इनमें टेक्स्ट एकदम सटीक होना चाहिए ताकि सामान बेचा जा सके।

लंबे समय से, हमारे पास ऐसे AI थे जो तस्वीरों को शानदार बना सकते थे। लेकिन जब बात चीनी टेक्स्ट (Chinese text) की आई, तो AI एक ऐसे प्रतिभाशाली कलाकार की तरह हो गया जो पढ़ नहीं सकता। वह जूते की एक सुंदर तस्वीर तो बना देता था, लेकिन "अभी खरीदें" (Buy Now) लिखने वाला टेक्स्ट या तो एक स्ट्रोक कम होता था, या उसमें अजीब लाइन ब्रेक होता था, या कोई अक्षर थोड़ा गलत दिखता था।

एक मानव विशेषज्ञ के लिए, यह एक आपदा है। एक मानक AI क्वालिटी चेकर के लिए, यह "ठीक" लग सकता है क्योंकि रंग अच्छे हैं और लेआउट संतुलित है। हमें कंप्यूटर को ये सूक्ष्म, महत्वपूर्ण गलतियाँ पहचानने के लिए सिखाने के तरीके की आवश्यकता थी, ठीक वैसे ही जैसे एक मानव विशेषज्ञ करता है।

समाधान: E-comIQ-ZH

अलिबाबा (Alibaba) के शोधकर्ताओं ने E-comIQ-ZH नामक एक नया सिस्टम बनाया है। इसे एक सुपर-इंटेलिजेंट, मानव-समान क्वालिटी इंस्पेक्टर के रूप में सोचें, जिसे विशेष रूप से चीनी ई-कॉमर्स पोस्टरों के लिए प्रशिक्षित किया गया है।

उन्होंने इसे तीन सरल चरणों में कैसे बनाया, यहाँ बताया गया है:

1. प्रशिक्षण नियमावली (डेटासेट: E-comIQ-18k)

आप बिना पाठ्यपुस्तक के छात्र को नहीं सिखा सकते। शोधकर्ताओं ने E-comIQ-18k नामक एक विशाल पाठ्यपुस्तक बनाई।

  • सामग्री: इसमें 18,000 वास्तविक दुनिया के शॉपिंग पोस्टर शामिल हैं।
  • ग्रेडिंग: केवल पोस्टर को "पास" या "फेल" देने के बजाय, मानव विशेषज्ञों ने उन्हें चार विशिष्ट क्षेत्रों में ग्रेड दिए:
    • बैकग्राउंड (Background): क्या दृश्य सही है?
    • ऑब्जेक्ट (Object): क्या उत्पाद स्पष्ट और बिना किसी क्षति के है?
    • टेक्स्ट (Text): क्या चीनी अक्षर (Chinese characters) एकदम सही हैं? (यह सबसे कठिन हिस्सा है)।
    • लेआउट (Layout): क्या सब कुछ संतुलित दिखता है?
  • सीक्रेट सॉस (चेन-ऑफ-थॉट/Chain-of-Thought): यह सबसे महत्वपूर्ण हिस्सा है। विशेषज्ञों ने केवल स्कोर नहीं दिया; उन्होंने एक विस्तृत व्याख्या भी लिखी (जैसे टेस्ट पर शिक्षक की टिप्पणी)। उन्होंने समझाया कि स्कोर कम क्यों था (जैसे, "बाएँ हाथ की ओर 'हैप्पी' अक्षर का एक स्ट्रोक गायब है")। AI ने केवल नंबरों से नहीं, बल्कि इन स्पष्टीकरणों से सीखा।

2. छात्र (मॉडल: E-comIQ-M)

एक बार जब "पाठ्यपुस्तक" तैयार हो गई, तो उन्होंने E-comIQ-M नामक एक विशेष AI मॉडल को प्रशिक्षित किया।

  • यह कैसे सीखता है: पहले, इसने नियमों को सीखने के लिए पाठ्यपुस्तक का अध्ययन किया (Supervised Fine-Tuning)। फिर, इसने GRPO (Group Relative Policy Optimization) नामक तकनीक का उपयोग करके सबसे कठिन उदाहरणों पर अभ्यास किया।
  • उपमा: कल्पना करें कि एक छात्र अभ्यास परीक्षा दे रहा है। यदि वे कोई प्रश्न गलत करते हैं, तो शिक्षक केवल "गलत" नहीं कहता। शिक्षक कहता है, "आपका उत्तर गलत है क्योंकि आपने इस विशिष्ट विवरण को मिस कर दिया।" फिर छात्र अगली बार उस विवरण को पकड़ने के लिए अपने मस्तिष्क को समायोजित करता है।
  • परिणाम: इस मॉडल ने सूक्ष्म त्रुटियों (जैसे टेढ़ा अक्षर या अजीब लाइन ब्रेक) को पहचानना सीख लिया जिन्हें अन्य शक्तिशाली AI मॉडल (जैसे GPT-4o या Gemini) पूरी तरह से मिस कर देते थे।

3. अंतिम परीक्षा (बेंचमार्क: E-comIQ-Bench)

यह साबित करने के लिए कि उनका नया इंस्पेक्टर सबसे अच्छा है, उन्होंने E-comIQ-Bench नामक एक अंतिम परीक्षा बनाई।

  • उन्होंने 500 नए उत्पादों को लिया और शीर्ष AI इमेज जनरेटर्स (जैसे Flux, GPT-4o और Gemini) से उनके लिए पोस्टर बनाने को कहा।
  • फिर, उन्होंने इन पोस्टरों को अपने नए इंस्पेक्टर (E-comIQ-M) के माध्यम से चलाया और उनके स्कोर की तुलना मानव विशेषज्ञों द्वारा दिए गए स्कोर से की।
  • परिणाम: E-comIQ-M मौजूदा अन्य सभी टूल्स की तुलना में मानव निर्णय के बहुत करीब था। इसने सफलतापूर्वक पहचान लिया कि एक सुंदर बैकग्राउंड वाला पोस्टर जिसमें टेक्स्ट में टाइपो (typo) था, वास्तव में एक "खराब" पोस्टर था।

यह क्यों मायने रखता है?

ऑनलाइन शॉपिंग की दुनिया में, भरोसा ही सब कुछ है। यदि किसी पोस्टर में टाइपो या टेक्स्ट में कोई अजीब गड़बड़ी है, तो ग्राहकों को लग सकता है कि ब्रांड गैर-पेशेवर है या उत्पाद नकली है।

  • पहले: कंपनियों को हर एक AI-जनरेटेड पोस्टर को पकड़ने के लिए गलतियों को देखने के लिए इंसानों की एक बड़ी फौज रखनी पड़ती थी। यह धीमा और महंगा था।
  • अब: E-comIQ-ZH के साथ, कंपनियाँ सेकंडों में हजारों पोस्टरों की स्वचालित रूप से जाँच कर सकती हैं, उन सूक्ष्म टेक्स्ट त्रुटियों को पकड़ सकती हैं जिन्हें इंसान थक जाने पर मिस कर सकते हैं, और यह सुनिश्चित कर सकती हैं कि अंतिम विज्ञापन पेशेवर दिखें।

सारांश उपमा (Summary Analogy)

पुराने AI क्वालिटी चेकर्स को ऐसे कला समीक्षकों (art critics) के रूप में सोचें जिन्हें केवल इस बात की परवाह है कि पेंटिंग रंगीन और सुंदर है या नहीं। वे एक ऐसी बिल्ली की पेंटिंग को 5-स्टार रेटिंग दे देंगे जो "CAT" के बजाय "C4T" कहती है क्योंकि रंग अच्छे थे।

E-comIQ-ZH एक सख्त संपादक (editor) की तरह है। यह पेंटिंग को देखता है, "C4T" को देखता है, और कहता है, "यह 1-स्टार पोस्टर है क्योंकि टेक्स्ट टूटा हुआ है, भले ही बिल्ली प्यारी दिख रही हो।" यह कंप्यूटर के निर्णय को उस चीज़ के साथ संरेखित करता है जिसकी वास्तव में ऑनलाइन खरीदारी करते समय एक इंसान को परवाह होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →