← नवीनतम पेपर
💬 NLP

BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model

यह शोध पत्र BEiTScore को प्रस्तुत करता है, जो एक संदर्भ-मुक्त (reference-free) इमेज कैप्शनिंग मूल्यांकन मीट्रिक है जो संवेदनशीलता और संरचनात्मक सामान्यीकरण (compositional generalization) में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एडवरसेरियल LLM-संवर्धित डेटा के साथ प्रशिक्षित एक हल्के क्रॉस-एनकोडर मॉडल का लाभ उठाता है और साथ ही गणनात्मक दक्षता बनाए रखता है।

मूल लेखक: Gonçalo Gomes, Bruno Martins, Chrysoula Zerva

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gonçalo Gomes, Bruno Martins, Chrysoula Zerva

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कला समीक्षक हैं जो एक छात्र द्वारा पेंटिंग के वर्णन को ग्रेड देने की कोशिश कर रहे हैं। छात्र कहता है, "एक लाल कुत्ता नीली गेंद का पीछा कर रहा है।" लेकिन पेंटिंग में, कुत्ता वास्तव में नीला है और लाल गेंद का पीछा कर रहा है।

लंबे समय तक, चित्रों के विवरण को ग्रेड देने वाले कंप्यूटर ऐसे समीक्षकों की तरह रहे हैं जो केवल उपयोग किए गए शब्दों की सूची देखते हैं, न कि उस कहानी को जो वे बताते हैं। यदि छात्र की शब्दों की सूची पेंटिंग की सूची (लाल, कुत्ता, नीला, गेंद) से मेल खाती है, तो कंप्यूटर उच्च स्कोर देता है, भले ही विवरण पूरी तरह से गलत हो। यह एक शिक्षक की तरह है जो एक छात्र को "A" ग्रेड दे देता है जिसने सिर्फ इसलिए सही शब्दावली का उपयोग किया क्योंकि उसने लिखा था "नीली गेंद ने लाल कुत्ते का पीछा किया," जबकि वह वाक्य कोई अर्थ नहीं रखता।

यह शोध पत्र एक नया, अधिक स्मार्ट ग्रेडिंग सिस्टम पेश करता है जिसे BEiTScore कहा जाता है। यह कैसे काम करता है, इसे सरल रूप में यहाँ दिया गया है:

1. समस्या: "बैग ऑफ वर्ड्स" (शब्दों की थैली) का जाल

वर्तमान में अधिकांश कंप्यूटर प्रोग्राम जो चित्र विवरणों की जाँच करते हैं (जैसे CLIP-आधारित मॉडल), वाक्यों के साथ एक कंचों की थैली जैसा व्यवहार करते हैं। वे थैली में कितने "लाल" कंचे या "कुत्ते" के कंचे हैं, इसकी गिनती करते हैं। यदि थैली में सही कंचे हैं, तो वे मान लेते हैं कि विवरण अच्छा है।

  • दोष: वे यह नहीं बता सकते कि "कुत्ता बिल्ली का पीछा कर रहा है" और "बिल्ली कुत्ते का पीछा कर रहा है" के बीच क्या अंतर है। वे लंबी कहानियों के साथ भी संघर्ष करते हैं। यदि कोई विवरण बहुत लंबा हो जाता है (77 शब्दों से अधिक), तो ये प्रोग्राम अक्सर पढ़ना बंद कर देते हैं और केवल अनुमान लगाने लगते हैं, जिससे वे अंत के विवरणों को छोड़ देते हैं।

2. समाधान: एक "जासूस" मॉडल

लेखकों ने BEiTScore बनाया है, जो एक शब्द-गिनने वाले की तुलना में एक जासूस की तरह कम काम करता है।

  • यह कैसे सोचता है: केवल शब्दों की सूची देखने के बजाय, यह एक ही समय में पूरी तस्वीर और पूरे वाक्य को एक साथ देखता है। यह पूछता है, "क्या यह विशिष्ट शब्द इस विशिष्ट स्थान पर इस विशिष्ट चित्र में फिट बैठता है?"
  • प्रशिक्षण: इस जासूस को सिखाने के लिए, लेखकों ने इसे केवल सही विवरण नहीं दिखाए। उन्होंने एक "विलेन" (एक शक्तिशाली AI) का उपयोग किया जो चालाकी भरे, नकली विवरण उत्पन्न करता था।
    • उदाहरण: AI एक सही वाक्य लेता और भूमिकाओं को बदल देता: "एक आदमी महिला को पकड़े हुए है" बन जाता "एक महिला आदमी को पकड़े हुए है।"
    • BEiTScore मॉडल को इन सूक्ष्म चालों को पकड़ने के लिए प्रशिक्षित किया गया था, जिससे इसने सीखा कि केवल वस्तुएं मौजूद हैं या नहीं, यह देखने के बजाय कि कौन, किसके साथ क्या कर रहा है

3. "लंबी कहानी" की चुनौती

कल्पना कीजिए कि आप एक उपन्यास पढ़ने की कोशिश कर रहे हैं, लेकिन आपकी आँखें केवल पहले दो वाक्यों पर ध्यान केंद्रित कर सकती हैं इससे पहले कि वे थक जाएँ। पुराने मॉडल लंबे कैप्शन के साथ ऐसा ही करते हैं।

  • BEiTScore की सुपरपावर: इसे चित्रों के बारे में लंबे, विस्तृत विवरणों पर प्रशिक्षित किया गया था। यह पहले शब्द से लेकर अंतिम शब्द तक पूरे कैप्शन को पढ़ सकता है, बिना "थके" या ध्यान खोए। यह उन त्रुटियों को पकड़ सकता है जो एक लंबे विवरण के बीच में या बिल्कुल अंत में होती हैं, जिन्हें अन्य मॉडल मिस कर देते हैं।

4. परिणाम: स्मार्ट और तेज़

शोध पत्र ने BEiTScore का दो प्रकार के प्रतिस्पर्धियों के विरुद्ध परीक्षण किया:

  1. "शब्द गिनने वाले" (Encoders): ये तेज़ हैं लेकिन अक्सर विवरणों के साथ मूर्खतापूर्ण गलतियाँ करते हैं।
  2. "विशाल मस्तिष्क" (LLMs): ये विशाल, अत्यंत बुद्धिमान मॉडल हैं जो लंबी कहानियाँ पढ़ सकते हैं और विवरणों को पकड़ सकते हैं, लेकिन वे धीमे और महंगे हैं (जैसे किराने की सूची की जाँच करने के लिए सुपरकंप्यूटर का उपयोग करना)।

BEiTScore की उपलब्धि:

  • इसने "शब्द गिनने वालों" की तुलना में अधिक गलतियाँ पकड़ीं
  • यह जटिल त्रुटियों (जैसे भूमिका बदलना या वस्तुओं की गिनती) को पकड़ने में "विशाल मस्तिष्क" के लगभग बराबर था।
  • सबसे अच्छी बात: यह "विशाल मस्तिष्क" की तुलना में 30 से 100 गुना तेज़ चलता है। यह एक ऐसे जासूस की तरह है जो एक जीनियस जितना तेज़ दिमाग रखता है लेकिन एक सामान्य व्यक्ति की गति से काम करता है।

5. नया परीक्षण (LongCapVLCP)

लेखकों को एहसास हुआ कि पुराने परीक्षण बहुत आसान थे; वे केवल छोटे वाक्यों का उपयोग करते थे। इसलिए, उन्होंने एक नया, कठिन परीक्षण बनाया जिसे LongCapVLCP कहा जाता है।

  • यह परीक्षण बहुत लंबे विवरणों का उपयोग करता है और इसमें चित्र के अंदर लिखे गए टेक्स्ट (जैसे पृष्ठभूमि में एक साइन जो "Open" कहता है) जैसी चालाकी भरी त्रुटियां शामिल हैं।
  • इस नए, कठिन परीक्षण पर, BEiTScore ने साबित किया कि यह लंबे टेक्स्ट को पढ़ सकता है और त्रुटियों को पहचान सकता है, जबकि पुराने "शब्द गिनने वाले" पूरी तरह विफल रहे।

सारांश

BEiTScore चित्र विवरणों को ग्रेड देने के लिए एक नया उपकरण है। यह पुराने कंप्यूटर वाली समस्या को ठीक करता है जहाँ वे केवल शब्दों को गिनते थे, और यह शब्दों और चित्रों के बीच के संबंधों को समझना सीखता है। यह लंबे विवरणों में सूक्ष्म झूठ पकड़ने के लिए पर्याप्त स्मार्ट है, हजारों छवियों पर उपयोग करने के लिए पर्याप्त तेज़ है, और इसे काम करने के लिए महंगे, धीमे सुपर-कंप्यूटर की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →