← नवीनतम पेपर
💬 NLP

Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning

यह शोध पत्र "एडजुडिकेटेड कैप्शनिंग" (Adjudicated Captioning) का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त, मल्टी-एजेंट इन्फरेंस फ्रेमवर्क है जो फ्रोजन रिट्रीवल एनकोडर और क्रॉस-अटेंशन वेरिफायर को सेल्फ-सुपरवाइज्ड, कंसेंसस-डिस्टिल्ड रेंकर के साथ एकीकृत करके स्ट्रिक्ट ज़ीरो-शॉट इमेज कैप्शनिंग को बेहतर बनाता है, ताकि अंतर्निहित कैप्शनर को पुन: प्रशिक्षित किए बिना COCO और Flickr30k पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Duy Tran Thanh, Thien-Phuc Doan, Long Nguyen-Vu, Ngo Tan Vu Khanh

प्रकाशित 2026-08-03
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Duy Tran Thanh, Thien-Phuc Doan, Long Nguyen-Vu, Ngo Tan Vu Khanh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को ऐसी तस्वीर का वर्णन करना सिखाने की कोशिश कर रहे हैं जिसे उसने पहले कभी नहीं देखा है। आप रोबोट को उसके स्कूल के वर्षों के दौरान तस्वीर और सही विवरण एक साथ नहीं दिखा सकते; सख्त ज़ीरो-शॉट लर्निंग (zero-shot learning) की दुनिया में इसे "सख्त ज़ीरो-शॉट लर्निंग प्रोटोकॉल का उल्लंघन" माना जाएगा। इसके बजाय, आप रोबोट को शब्दों के आधार पर एक विशाल टेक्स्ट लाइब्रेरी और एक विशेष चश्मा देते हैं जो मोटे तौर पर यह अनुमान लगा सकता है कि एक तस्वीर कैसी दिखती है। रोबोट का काम एक नई फोटो को देखना, उसकी लाइब्रेरी में सबसे समान विवरण खोजना और फिर उनका उपयोग करके एक नया कैप्शन लिखना है।

लंबे समय तक, यह प्रक्रिया एक निराशाजनक दीवार से टकराती रही। रोबोट कुछ मिलते-जुलते विवरण ढूंढता, सबसे अच्छे वाले चुनता, और फिर अपने आंतरिक "भाषा मस्तिष्क" (language brain) को वाक्य पूरा करने देता। समस्या यह थी कि एक बार जब रोबोट लिखना शुरू कर देता, तो वह यह जांचना बंद कर देता कि जो वह कह रहा है वह वास्तव में तस्वीर से मेल खाता है या नहीं। वह केवल प्रवाहपूर्ण और व्याकरण की दृष्टि से सही सुनाई देने पर बहुत अधिक केंद्रित हो जाता था, और अक्सर दृश्य विवरणों को अनदेखा कर देता था। यह एक ऐसे टूर गाइड की तरह था जिसने एक प्रसिद्ध पर्वत के बारे में एक स्क्रिप्ट याद कर ली है, लेकिन एक बार दौरा शुरू होने के बाद, वह केवल इस बारे में बात करता रहता है कि पहाड़ कितने सुंदर होते हैं, और यह भूल जाता है कि उसके सामने वाला विशिष्ट पर्वत वास्तव में एक ज्वालामुखी है।

यह शोध पत्र उसी समस्या को हल करता है। आर्टिफिशियल इंटेलिजेंस और कंप्यूटर विजन के क्षेत्र में काम करने वाले शोधकर्ताओं ने एक नया तरीका प्रस्तावित किया है ताकि रोबोट को ईमानदार रखा जा सके। वे अपने तरीके को "एडजुडिकेटेड कैप्शनिंग" (Adjudicated Captioning) कहते हैं। रोबोट को पूरा विवरण लिखने देने और फिर उम्मीद करने के बजाय कि सब ठीक होगा, वे कई चरणों में काम की जांच करने के लिए "कठोर न्यायाधीशों" की एक टीम स्थापित करते हैं। वे रोबोट के मस्तिष्क को फिर से प्रशिक्षित नहीं करते हैं (जिसके लिए चित्रों और उत्तरों को एक साथ देखने की आवश्यकता होगी); इसके बजाय, वे एक स्मार्ट, स्व-सुधारात्मक परत जोड़ते हैं जो रोबले द्वारा प्रारंभिक ड्राफ्ट तैयार करने के बाद चलती है।

यहाँ उनका नया सिस्टम कैसे काम करता है, एक सरल कहानी का उपयोग करते हुए:

पुराना तरीका: एक बार की जाँच
पुराने सिस्टम में, रोबोट एक स्नोबोर्डर की फोटो देखता और अपनी लाइब्रेरी से पूछता, "कौन से शब्द इससे मिलते-जुलते हैं?" उसे नौ समान विवरण मिले। उसने शीर्ष पांच चुने, और फिर उसके भाषा मस्तिष्क ने लिखना शुरू किया। उसने लिखा, "एक स्नोबोर्डर और एक स्नोबोर्डर पोज़ दे रहे हैं।" सिस्टम वहीं रुक गया। उसने कभी यह नहीं पूछा, "रुको, क्या यह तस्वीर वास्तव में दो लोगों को दिखा रही है?" उसने बस अपने भाषा मस्तिष्क पर भरोसा किया कि वह सही होगा। इससे CIDEr नामक एक मानक परीक्षण (जो यह मापता है कि कैप्शन कितना अच्छा है) पर 108.0 का स्कोर मिला।

नया तरीका: बहु-चरणीय अदालत (Multi-Stage Courtroom)
लेखकों ने महसूस किया कि रोबोट को एक से अधिक जांच की आवश्यकता है। उन्होंने एक पाइपलाइन बनाई जिसमें तीन नए "न्यायाधीश" हैं जो बिना "सही" उत्तरों (ग्राउंड ट्रुथ) को देखे एक साथ काम करते हैं।

  1. बेहतर लाइब्रेरियन (चरण 1): सबसे पहले, उन्होंने रोबोट के चश्मे को एक बहुत ही तेज जोड़ी से बदल दिया। एक मानक लेंस के बजाय, उन्होंने शुरुआती विवरण खोजने के लिए एक विशाल, शक्तिशाली मॉडल (OpenCLIP ViT-bigG/14) का उपयोग किया। इसने अकेले ही रोबोट को स्मार्ट बना दिया, जिससे स्कोर बढ़कर 111.6 हो गया।
  2. क्रॉस-एग्जामिनर (चरण 2): इसके बाद, उन्होंने एक दूसरा न्यायाधीश जोड़ा। यह न्यायाधीश केवल शब्दों को नहीं देखता; यह एक विशेष "क्रॉस-अटेंशन" टूल (एक BLIP-ITM Verifier) का उपयोग करके फोटो और टेक्स्ट के बीच के संबंध का गहराई से अध्ययन करता है। यह लाइब्रेरियन द्वारा खोजे गए नौ शीर्ष विवरणों को लेता है और उन्हें फिर से रैंक करता है, सबसे अच्छे पांच चुनता है। यह न्यायाधीश लाइब्रेरियन से अलग है; यह उन चीजों को पकड़ लेता है जिन्हें लाइब्रेरियन मिस कर देता है। यदि लाइब्रेरियन सोचता है कि फोटो "एक आदमी" के बारे में है, तो यह न्यायाधीश महसूस कर सकता है कि यह वास्तव में "दो आदमी" हैं। यह चरण महत्वपूर्ण है क्योंकि दोनों न्यायाधीश अक्सर असहमत होते हैं, और यह असहमति सिस्टम को सत्य खोजने में मदद करती है।
  3. अंतिम मध्यस्थ (चरण 4): अंत में, रोबोट 20 संभावित वाक्यों की एक सूची (एक "बीम") बनाता है। आमतौर पर, वह उस एक को चुनता है जो सबसे अधिक प्रवाहपूर्ण लगता है। लेकिन अब, दो नए, छोटे, स्व-शिक्षित AI हेड (जिन्हें TriFuse और MemAttend कहा जाता है) हस्तक्षेप करते हैं। ये हेड 20 वाक्यों को देखते हैं और प्रत्येक के लिए तीन प्रश्न पूछते हैं:
    • क्या भाषा मस्तिष्क इसे पसंद करता है?
    • क्या स्ट्रॉन्गर लाइब्रेरियन को लगता है कि यह फोटो से मेल खाता है?
    • क्या क्रॉस-एग्जामिनर को लगता है कि यह फोटो से मेल खाता है?

इन दो नए हेड्स को एक चतुर तरीके से प्रशिक्षित किया गया है। उन्हें सही उत्तरों के साथ शिक्षक की आवश्यकता नहीं है। इसके बजाय, वे ऊपर दिए गए तीन न्यायाधीशों को देखते हैं। यदि तीनों न्यायाधीश सहमत होते हैं कि एक विशिष्ट वाक्य सबसे अच्छा है, तो नए हेड्स उस वाक्य को चुनना सीखते हैं। यह एक छात्र की तरह है जो सीधे उत्तर बताए जाने के बजाय विशेषज्ञों के एक पैनल को सही उत्तर पर सहमत होते हुए देखकर सीखता है।

परिणाम
इन जांचों को जोड़ने से, सिस्टम न केवल बेहतर सुनाई देने लगा; बल्कि यह अधिक सटीक भी हो गया। COCO Karpathy टेस्ट पर, नए सिस्टम ने 117.6 का CIDEr स्कोर प्राप्त किया, जो पिछले सर्वश्रेष्ठ 108.0 से एक बड़ी छलांग है। इससे भी अधिक प्रभावशाली बात यह है कि इसने उस तरीके को भी मात दी जिसमें अन्य AI द्वारा उत्पन्न "नकली" छवियों का उपयोग खुद को प्रशिक्षित करने के लिए किया गया था (जिसने 109.9 स्कोर किया), और वह भी बिना रोबोट को प्रशिक्षण के दौरान एक भी युग्मित छवि और कैप्शन दिखाए।

शोध पत्र ने Flickr30k और NoCaps जैसे विभिन्न प्रकार के फोटो पर भी इसका परीक्षण किया। इस सिस्टम ने उन स्कोर में भी सुधार किया, क्रमशः +8.1 और +5.7 अंक प्राप्त किए, जिससे सिद्ध होता है कि यह "बहु-न्यायाधीश" दृष्टिकोण उन चित्रों पर भी काम करता है जिनके लिए रोबोट को विशेष रूप से प्रशिक्षित नहीं किया गया था।

उन्होंने क्या खारिज किया
शोधकर्ता सावधान थे कि यह जादू नहीं था। उन्होंने साबित किया कि केवल भाषा मस्तिष्क को मजबूत बनाना समाधान नहीं था; सुधार इस बात से आया कि इमेज-टेक्स्ट मिलान को कहाँ और कैसे जांचा गया। उन्होंने यह भी दिखाया कि केवल दूसरा न्यायाधीश जोड़ना पर्याप्त नहीं था; न्यायाधीशों को अलग प्रकार के मॉडल (एक "डुअल एनकोडर" और एक "क्रॉस-अटेंशन मैचर") होने चाहिए ताकि वे अलग-अलग प्रकार की गलतियों को पकड़ सकें। उन्होंने एक "नकारात्मक" विचार का भी परीक्षण किया: रोबोट को यह सिखाने के लिए कि क्या नहीं कहना है, सबसे खराब विवरणों का उपयोग करना। इसने वास्तव में चीजों को और खराब कर दिया, जिससे साबित हुआ कि सबसे अच्छे मिलानों पर ध्यान केंद्रित करना सही रास्ता था।

वे कितने आश्वस्त हैं?
शोध पत्र इन आंकड़ों में बहुत आश्वस्त है। उन्होंने परीक्षणों को कई बार चलाया और पाया कि परिणाम स्थिर थे, और कंप्यूटर हार्डवेयर की खामियों के कारण केवल मामूली, यादृच्छिक उतार-चढ़ाव (लगभग 0.1 अंक) थे। उन्होंने यह भी दिखाया कि सुधार केवल इसलिए नहीं हुआ क्योंकि उन्होंने उसी टेस्ट सेट पर प्रशिक्षित न्यायाधीश का एक विशिष्ट संस्करण उपयोग किया था; यहाँ तक कि जब उन्होंने एक अलग फोटो सेट पर प्रशिक्षित न्यायाधीश को भी बदल दिया, तब भी सिस्टम में महत्वपूर्ण सुधार हुआ।

संक्षेप में, यह शोध पत्र सुझाव देता है कि AI कैप्शनिंग के रुकने का कारण यह नहीं था कि रोबोट बहुत कम बुद्धिमान थे, बल्कि वे अपने स्वयं के शब्दों पर बहुत अधिक भरोसा करते थे। हर चरण में अपने काम को सत्यापित करने के लिए स्वतंत्र, स्व-पर्यवेक्षित न्यायाधीशों की एक टीम को जोड़ने से, सिस्टम ने दुनिया का अधिक सटीक वर्णन करना सीखा, और वह भी सख्त ज़ीरो-शॉट लर्निंग के नियमों को तोड़े बिना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →