← नवीनतम पेपर
💻 computer science

Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection

यह शोध पत्र हेड एनसेंबल क्लासिफायर (HEC) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त विधि है जो स्टेट-ऑफ-द-आर्ट ज़ीरो-शॉट और फ्यू-शॉट इमेज क्लासिफिकेशन प्रदर्शन प्राप्त करने के लिए प्रॉम्प्ट कंडीशनिंग और लार्ज विज़न लैंग्वेज मॉडल्स (LVLMs) के भीतर डिस्क्रिमिनेटिव अटेंशन हेड्स के चयन का लाभ उठाता है, जो प्रभावी रूप से LVLMs और CLIP-आधारित विधियों के बीच के अंतर को पाटता है।

मूल लेखक: Adhemar de Senneville, Xavier Bou, Jérémy Anger, Rafael Grompone, Gabriele Facciolo

प्रकाशित 2026-03-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Adhemar de Senneville, Xavier Bou, Jérémy Anger, Rafael Grompone, Gabriele Facciolo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक है जिसका नाम LVLM (लार्ज विजन-लैंग्वेज मॉडल) है। यह रोबोट चित्रों का वर्णन करने, चित्रों में जो दिख रहा है उसके बारे में उत्तर देने और चित्रों के अंदर लिखे टेक्स्ट को पढ़ने में अविश्वसनीय रूप से प्रतिभाशाली है। यह एक जीनियस आर्ट क्रिटिक की तरह है जो आपको बता सकता है कि एक पेंटिंग में वास्तव में क्या हो रहा है या किसी विदेशी भाषा में लिखे मेनू को पढ़ सकता है।

हालाँकि, एक समस्या है। जब आप इस रोबोट को "कुत्ते की नस्ल पहचानें" या "कार का मॉडल पहचानें" जैसा एक सरल खेल खेलने के लिए कहते हैं, तो यह अक्सर लड़खड़ा जाता है। यह एक पुराने और सरल रोबोट (जिसे CLIP कहा जाता है) की तुलना में खराब प्रदर्शन करता है, जिसे विशेष रूप से चित्रों को नामों के साथ मिलाने के लिए बनाया गया था।

ऐसा क्यों हो रहा है? यह एक प्रतिभाशाली उपन्यासकार (नोवेलिस्ट) से बहुविकल्पीय प्रश्नोत्तरी (मल्टीपल चॉइस क्विज़) भरने के लिए कहने जैसा है। उपन्यासकार कहानी और संदर्भ को गहराई से समझता है, लेकिन वह क्विज़ के कठोर प्रारूप से भ्रमित हो जाता है। पुराना रोबोट (CLIP) कम रचनात्मक है लेकिन "इमेज A" को "लेबल B" से मिलाने के विशिष्ट कार्य में बेहतर है।

इस शोध पत्र के लेखकों ने पूछा: "क्या हम दोनों दुनियाओं का सर्वश्रेष्ठ प्राप्त कर सकते हैं? क्या हम बिना दोबारा ट्रेनिंग दिए, एक प्रतिभाशाली उपन्यासकार के दिमाग का उपयोग करके बहुविकल्पीय प्रश्नोत्तरी जीत सकते हैं?"

इसका उत्तर है हाँ, और उन्होंने इसे दो चतुर तरीकों का उपयोग करके किया: प्रॉम्प्ट कंडीशनिंग (Prompt Conditioning) और हेड सिलेक्शन (Head Selection)

1. "प्रॉम्प्ट कंडीशनिंग" का तरीका: सही संदर्भ देना

कल्पना कीजिए कि आप एक कुत्ते की पहचान करने के लिए अपने रोबोट सहायक से पूछ रहे हैं।

  • खराब प्रॉम्प्ट: "यह क्या है?" (रोबोट कुत्ते के मूड, उसके मालिक या मौसम के बारे में सोच सकता है)।
  • अच्छा प्रॉम्प्ट: "उस कुत्ते की नस्ल (breed) क्या है? क्या वह बॉक्सर है, यॉर्कशायर है, बीगल है या हवनीज़ है?"

शोध पत्र दिखाता है कि केवल प्रश्न (प्रॉम्प्ट) को बदलकर—जो कार्य (जैसे "नस्ल क्या है?") और डोमेन (जैसे "क्या यह एक कुत्ता है?") के बारे में बहुत विशिष्ट हो—आप रोबोट के मस्तिष्क को सही विवरणों पर ध्यान केंद्रित करने के लिए मजबूर करते हैं। यह एक जासूस को यह बताने जैसा है कि, "कातिल को मत ढूंढो; उंगलियों के निशान ढूंढो।" अचानक, रोबोट की आंतरिक समझ बहुत अधिक सटीक और स्पष्ट हो जाती है।

2. "हेड सिलेक्शन" का तरीका: सही विशेषज्ञों को काम पर रखना

यह सबसे दिलचस्प हिस्सा है। रोबोट के मस्तिष्क (AI मॉडल) के अंदर, हजारों छोटे कार्यकर्ता होते हैं जिन्हें "अटेंशन हेड्स" (attention heads) कहा जाता है।

  • कुछ कार्यकर्ता कुत्ते के कानों के आकार को देखने में माहिर हैं।
  • कुछ प्रॉम्प्ट में लिखे टेक्स्ट को पढ़ने में माहिर हैं।
  • कुछ कुत्ते के बालों के रंग को नोटिस करने में माहिर हैं।
  • कुछ बस... विचलित या इस विशिष्ट कार्य के लिए खराब हैं।

आमतौर पर, रोबोट निर्णय लेने के लिए इन सभी कार्यकर्ताओं की "औसत राय" लेता है। लेकिन शोध पत्र में पाया गया कि कुछ विशिष्ट कार्यकर्ता इस कार्य में जीनियस हैं, जबकि अन्य केवल शोर (noise) हैं।

लेखकों ने HEC (हेड एनसेंबल क्लासिफायर) नामक एक प्रणाली बनाई जो एक टैलेंट स्काउट (प्रतिभा खोजकर्ता) की तरह काम करती है:

  1. स्काउट सपोर्ट सेट को देखता है: रोबoret को कुत्तों के कुछ उदाहरण दिखाए जाते हैं (सपोर्ट सेट)।
  2. स्काउट विजेताओं को चुनता है: वह यह पता लगाता है कि कौन से विशिष्ट "कार्यकर्ता" (अटेंशन हेड्स) नस्लों के बीच अंतर करने के लिए सही विशेषताओं (जैसे कुत्ते की थूथन का आकार) पर सबसे अधिक ध्यान दे रहे हैं।
  3. स्काउट बाकी सबको निकाल देता है: वह भ्रमित कार्यकर्ताओं को अनदेखा करता है और केवल शीर्ष विशेषज्ञों की बात सुनता है।

यह एक ऐसी क्वायर (गायक दल) की तरह है जहाँ, बजाय इसके कि सभी एक साथ गाएं, आप केवल तीन सर्वश्रेष्ठ गायकों को ही प्रदर्शन करने देते हैं। परिणाम एक बहुत अधिक स्पष्ट और सटीक ध्वनि है।

तीन सुपर-टूल्स जो उन्होंने बनाए

इन दो तरीकों का उपयोग करके, उन्होंने तीन अलग-अलग "सुपर-सॉल्वर" बनाए:

  1. HEC-V (विजुअल स्पेशलिस्ट): यह तब बहुत अच्छा होता है जब आपके पास उत्तर की कुछ तस्वीरें हों लेकिन आप अभी तक नाम नहीं जानते। यह श्रेणी का अनुमान लगाने के लिए "सर्वश्रेष्ठ विजुअल वर्कर्स" का उपयोग करता है।
  2. HEC-T (टेक्स्ट स्पेशलिस्ट): यह तब बहुत अच्छा होता है जब आप नाम जानते हैं लेकिन आपके पास कोई तस्वीर नहीं है। यह लेबल को समझने के लिए "सर्वश्रेष्ठ टेक्स्ट वर्कर्स" का उपयोग करता है।
  3. HEC-VT (अल्टीमेट हाइब्रिड): यह दोनों को जोड़ता है! यह विजुअल विशेषज्ञों और टेक्स्ट विशेषज्ञों दोनों को एक साथ सुनता है। यह सबसे शक्तिशाली है, जो बिना दोबारा प्रशिक्षित हुए लगभग हर अन्य पद्धति को हरा देता है।

बड़ी तस्वीर

सोचिए कि पुराने रोबोट (CLIP) को एक विशेषज्ञ कैलकुलेटर के रूप में: यह गणित में तेज़ और अच्छा है, लेकिन यह कविता नहीं लिख सकता।
नया रोबोट (LVLM) एक कवि है: वह बारीकियों और संदर्भ को समझता है, लेकिन गणित में कमजोर है।

यह शोध पत्र कहता है: "कवि को मत फेंको! बस उन्हें एक कैलकुलेटर दो और उन्हें उनके दिमाग के उन हिस्सों का उपयोग करने के लिए कहो जो गणित में अच्छे हैं।"

केवल बेहतर प्रश्न पूछकर (प्रॉम्प्ट कंडीशनिंग) और मस्तिष्क के सबसे स्मार्ट हिस्सों को सुनकर (हेड सिलेक्शन), उन्होंने एक भ्रमित कवि को एक चैंपियन क्विज़-टेकर में बदल दिया। उन्होंने यह बिना किसी महंगी ट्रेनिंग या रीप्रोग्रामिंग के किया, बस अपने रोबोट के मौजूदा दिमाग का उपयोग करने के तरीके के बारे में स्मार्ट होकर।

संक्षेप में: उन्होंने बेहतर निर्देश देकर और उन्हें अपना सर्वश्रेष्ठ विशेषज्ञ चुनने देकर, स्मार्ट AI मॉडलों की छिपी हुई क्षमता को अनलॉक किया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →