← नवीनतम पेपर
🤖 machine learning

Post-hoc Probabilistic Vision-Language Models

यह शोध पत्र एक प्रशिक्षण-मुक्त (training-free), पोस्ट-हॉक विधि प्रस्तावित करता है जो विजन-लैंग्वेज मॉडल्स के अंतिम परतों पर बेयसियन पोस्टीरियर एप्रोक्सिमेशन (Bayesian posterior approximation) का लाभ उठाकर कोसाइन सिमिलरिटीज़ (cosine similarities) में अनिश्चितताओं को विश्लेषणात्मक रूप से परिमाणित करता है, जिससे सुरक्षा-महत्वपूर्ण अनुप्रयोगों के लिए एक्टिव लर्निंग में प्रेडिक्टिव कैलिब्रेशन और सैंपल दक्षता में सुधार होता है।

मूल लेखक: Anton Baumann, Rui Li, Marcus Klasson, Santeri Mentu, Shyamgopal Karthik, Zeynep Akata, Arno Solin, Martin Trapp

प्रकाशित 2026-02-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anton Baumann, Rui Li, Marcus Klasson, Santeri Mentu, Shyamgopal Karthik, Zeynep Akata, Arno Solin, Martin Trapp

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट लाइब्रेरियन है जिसका नाम CLIP है। इस रोबोट ने अरबों किताबें पढ़ी हैं और अरबों तस्वीरें देखी हैं। यदि आप इसे एक बिल्ली की तस्वीर दिखाते हैं और पूछते हैं, "क्या यह एक बिल्ली है?", तो यह 100% आत्मविश्वास के साथ कहेगा "हाँ"। यदि आप इसे एक टोस्टर की तस्वीर दिखाते हैं और पूछते हैं, "क्या यह एक बिल्ली है?", तो यह 100% आत्मविश्वास के साथ कहेगा "नहीं"।

समस्या क्या है? CLIP कभी-कभी अति-आत्मविश्वासी (overconfident) हो जाता है।

यदि आप CLIP को एक बिल्ली की तस्वीर दिखाते हैं जिसने टोस्टर वाली टोपी पहनी है, तो यह अभी भी 100% आत्मविश्वास के साथ कह सकता है "बिल्ली!", भले ही वह एक अजीब और भ्रमित करने वाली तस्वीर हो। वास्तविक दुनिया में, यदि एक सेल्फ-ड्राइविंग कार या मेडिकल AI भ्रमित होने पर अति-आत्मविश्वासी होता है, तो यह खतरनाक हो सकता है। हमें एक ऐसा तरीका चाहिए जिससे AI कह सके, "मैं इस बारे में निश्चित नहीं हूँ।"

यह पेपर BayesVLM पेश करता है, जो इन सुपर-स्मार्ट रोबोटों को यह बताने का एक चतुर "post-hoc" (बाद में किया जाने वाला) तरीका है कि वे अपनी निश्चितता के बारे में कितने आश्वस्त हैं, बिना उन्हें फिर से प्रशिक्षित किए या उनके मस्तिष्क की संरचना को बदले बिना।

यह कैसे काम करता है, यहाँ कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "आत्मविश्वासी मूर्ख" (The "Confident Fool")

वर्तमान विजन-लैंग्वेज मॉडल्स (VLMs) एक डिटरमिनिस्टिक कैलकुलेटर की तरह काम करते हैं। आप एक इमेज और एक शब्द डालते हैं, और यह तय करने के लिए कि वे मेल खाते हैं या नहीं, एक सिंगल नंबर (एक समानता स्कोर) बाहर निकालता है। यह उस छात्र की तरह है जो परीक्षा देते समय हमेशा उत्तर लिख देता है लेकिन कभी यह मार्क नहीं करता कि किन सवालों पर उसने केवल अनुमान लगाया था। यदि परीक्षा ऐसी चीज़ के बारे में है जिसे उसने पहले कभी नहीं देखा (जैसे किसी नए प्रकार का जानवर), तो वे अभी भी आत्मविश्वास के साथ अनुमान लगा सकते हैं और गलत हो सकते हैं।

2. समाधान: एक "लचक" जोड़ना (The Bayesian Approach)

लेखकों ने महसूस किया कि रोबोट के मस्तिष्क को एक कठोर, अपरिवर्तनीय मशीन मानने के बजाय, हम मान सकते हैं कि इसके अंतिम निर्णय लेने वाले स्तरों (layers) में थोड़ी सी अनिश्चितता (uncertainty) अंतर्निहित है।

रोबोट के अंतिम लेयर को एक रस्सी पर चलने वाले (tightrope walker) के रूप में सोचें।

  • पुराना तरीका: वॉकर एक मूर्ति की तरह है। वे बिल्कुल स्थिर खड़े हैं। यदि वे गिरते हैं, तो वे जोर से गिरते हैं, और हमें पता नहीं चलता कि क्यों।
  • नया तरीका (BayesVLM): हम कल्पना करते हैं कि वॉकर वास्तव में रस्सी पर एक जेलीफिश है। वे थोड़ा डगमगाते (wobble) हैं।
    • यदि जेलीफिश थोड़ा सा डगमगाती है, तो वह निश्चित है।
    • यदि जेलीफिश हिंसक रूप से कांप रही है, तो वह अनिश्चित है।

पेपर एक गणितीय ट्रिक का उपयोग करता है जिसे Laplace Approximation कहा जाता है ताकि यह गणना की जा सके कि वह "जेलीफिश" कितनी डगमगाएगी। यह रोबोट के प्रशिक्षण इतिहास (जिस डेटा से उसने सीखा है) को देखता है ताकि यह अनुमान लगाया जा सके कि अगर उसने थोड़ा अलग प्रशिक्षण डेटा देखा होता, तो रोबोट की "राय" कितनी बदल सकती थी।

3. जादुई ट्रिक: "ProbCosine"

इन मॉडल्स में, रोबोट यह तय करता है कि एक इमेज एक शब्द से मेल खाती है या नहीं, इसके लिए Cosine Similarity (मूल रूप से यह मापना कि दो तीर एक ही दिशा में कितने करीब इशारा कर रहे हैं) को मापता है।

आमतौर पर, रोबक आपको एक तीर देता है। BayesVLM आपको तीरों का एक बादल (cloud of arrows) देता है।

  • उपमा: कल्पना कीजिए कि आप छिपे हुए खजाने के स्थान का अनुमान लगाने की कोशिश कर रहे हैं।
    • पुराना रोबोट: एक सटीक स्थान की ओर इशारा करता है। "यह यहाँ है!"
    • BayesVLM: उस स्थान के चारों ओर एक घेरा बनाता है। "यह शायद यहाँ है, लेकिन यह इस घेरे में कहीं भी हो सकता है।"
    • नवाचार: पेपर ने एक तेज़, गणितीय रूप से भारी तरीका निकाला है जिससे उस घेरे के आकार (अनिश्चितता) की गणना की जा सके, बिना हजारों अलग-अलग परिदृश्यों का अनुकरण (simulate) किए (जो बहुत धीमा होगा)। वे इसे ProbCosine कहते हैं। यह एक "अनिश्चितता रडार" की तरह है जो तुरंत बता देता है कि घेरा कितना चौड़ा होना चाहिए।

4. यह क्यों उपयोगी है? (The "Active Learning" Superpower)

पेपर दिखाता है कि यह हमें दो मुख्य सुपरपावर देता है:

A. बेहतर सुरक्षा (Calibration)
यदि आप BayesVLM से एक अजीब, खराब की गई इमेज (जैसे टोस्टर वाली टोपी पहने बिल्ली) को पहचानने के लिए कहते हैं, तो यह केवल "बिल्ली" नहीं कहेगा। यह कहेगा, "मुझे लगता है कि यह एक बिल्ली है, लेकिन मेरी निश्चितता कम है क्योंकि इमेज अजीब है।" यह महत्वपूर्ण स्थितियों जैसे सेल्फ-ड्राइविंग कारों या मेडिकल डायग्नोसिस में AI को खतरनाक गलतियाँ करने से रोकता है।

B. स्मार्ट छात्र (Active Learning)
कल्पना कीजिए कि आप एक सीमित बजट वाले शिक्षक हैं जो ट्यूटर रखने के लिए छात्रों को चुनना चाहते हैं। आप उन छात्रों को चुनना चाहते जिन्हें सबसे अधिक मदद की आवश्यकता है।

  • रैंडम चयन: आप रैंडम तरीके से छात्रों को चुनते हैं।
  • एंट्रॉपी चयन (Entropy Selection): आप उन छात्रों को चुनते हैं जो भ्रमित हैं (उच्च अनिश्चितता)।
  • BayesVLM चयन: यह सबसे स्मार्ट तरीका है। यह रोबोट के "डगमगाहट" (wobble) को देखता है। यह कहता है, "हे, रोबोट इस विशेष प्रकार की इमेज के बारे में बहुत अनिश्चित है। चलिए रोबोट को इस विशिष्ट चीज़ के और उदाहरण दिखाते हैं ताकि वह डगमगाना बंद कर दे।"
    • पेपर दिखाता है कि BayesVLM का उपयोग करके यह चुनना कि रोबोट को आगे क्या सिखाना है, रोबोट को बहुत तेज़ी से सीखने में मदद करता है और कम उदाहरणों के साथ अधिक सटीक बनाता है।

5. "नो-ट्रेनिंग" बोनस

आमतौर पर, AI को स्मार्ट बनाने या उसकी सीमाओं के प्रति जागरूक बनाने के लिए, आपको उसे शुरू से फिर से प्रशिक्षित करना पड़ता है या उसके मस्तिष्क में नए, भारी हिस्से जोड़ने पड़ते हैं। यह महंगा और धीमा है।

BayesVLM रोबोट को चश्मा पहनाने जैसा है।

  • रोबोट का मस्तिष्क बिल्कुल वैसा ही रहता है।
  • आप बस चश्मा पहना देते हैं (गणितीय सन्निकटन/approximation) ताकि वह अपनी अनिश्चितता को देख सके।
  • इसे पहनने में लगभग कोई अतिरिक्त समय नहीं लगता है, और यह किसी भी रोबोट (CLIP, SigLIP, आदि) के साथ तुरंत काम करता है।

सारांश

यह पेपर अति-आत्मविश्वासी AI मॉडल्स को एक रियलिटी चेक देने के बारे में है। एक चतुर गणितीय शॉर्टकट का उपयोग करके, लेखक इन मॉडल्स को यह कहने की अनुमति देते हैं कि, "मैं निश्चित नहीं हूँ," जब वे किसी भ्रमित करने वाली चीज़ का सामना करते हैं। यह उन्हें वास्तविक दुनिया के उपयोग के लिए सुरक्षित बनाता है और उन्हें बहुत अधिक कुशलता से नई चीजें सीखने में मदद करता है, और वह भी बिना रोबोट को फिर से बनाए (rebuild) किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →