← नवीनतम पेपर
🤖 machine learning

Epistemic Uncertainty Quantification for Pre-trained VLMs via Riemannian Flow Matching

यह शोध पत्र REPVLM प्रस्तुत करता है, जो प्री-ट्रेन्ड विजन-लैंग्वेज मॉडल एम्बेडिंग्स के हाइपरस्फेरिकल मैनिफोल्ड पर प्रायिकता घनत्व (प्रोबेबिलिटी डेंसिटी) की गणना करने के लिए रिमानियन फ्लो मैचिंग का लाभ उठाता है, जिससे प्रभावी एपिस्टेमिक अनसर्टेंटी क्वांटिफिकेशन, आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्शन और स्वचालित डेटा क्यूरेशन सक्षम होता है।

मूल लेखक: Li Ju, Mayank Nautiyal, Andreas Hellander, Ekta Vats, Prashant Singh

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Li Ju, Mayank Nautiyal, Andreas Hellander, Ekta Vats, Prashant Singh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "REPVLM: Epistemic Uncertainty Quantification for Pre-trained VLMs via Riemannian Flow Matching" का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी समस्या: "अति-आत्मविश्वासी" रोबोट

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट है (एक विजन-लैंग्वेज मॉडल या VLM) जिसने इंटरनेट पर मौजूद लगभग हर किताब पढ़ ली है और लगभग हर तस्वीर देख ली है। वह बिल्ली या सूर्यास्त की फोटो का सटीक वर्णन कर सकता है।

हालाँकि, इसमें एक छिपा हुआ दोष है: रोबोट अति-आत्मविश्वासी (overconfident) है।

यदि आप उसे एक ऐसी तस्वीर दिखाते हैं जो बिल्ली जैसी दिखने वाली टोस्टर है, या कोई ऐसा वाक्य दिखाते जिसका कोई अर्थ नहीं निकलता, तो भी रोबोट आपको 100% निश्चितता के साथ उत्तर देगा। वह यह नहीं जानता कि उसे क्या नहीं पता है। AI की दुनिया में, इसे एपिस्टेमिक अनसर्टेंटी (Epistemic Uncertainty) या "मॉडल की अज्ञानता" की कमी कहा जाता है। रोबोट को यह कहने का एक तरीका चाहिए कि, "मैं इस बारे में निश्चित नहीं हूँ," ताकि इंसान हस्तक्षेप कर सकें और जाँच कर सकें।

समाधान: "भीड़भाड़ वाली पार्टी" की उपमा

लेखकों ने इस समस्या को ठीक करने के लिए REPVLM नामक एक नई विधि प्रस्तावित की है। इसे समझने के लिए, कल्पना करें कि रोबोट का मस्तिष्क एक विशाल, अदृश्य पार्टी रूम (एक गणितीय स्थान जिसे "हाइपरस्फीयर" कहा जाता है) है।

  1. भीड़ (The Crowd): जब रोबोट को प्रशिक्षित किया गया था, तो उसने सामान्य चीजों (बिल्लियाँ, कुत्ते, कारें, "नमस्ते") के बारे में सीखा। हमारी पार्टी की उपमा में, ये सामान्य चीजें भीड़भाड़ वाले डांस फ्लोर की तरह हैं। हर कोई एक साथ घने समूहों में नाच रहा है।
  2. खाली कोने (The Empty Corners): यदि आप रोबốt को कुछ अजीब दिखाते हैं (जैसे टोस्टर-बिल्ली या निरर्थक टेक्स्ट), तो उस इनपुट को कमरे के ऐसे स्थान पर मैप किया जाता है जहाँ कोई नाच नहीं रहा है। यह एक खाली, अकेला कोना है।
  3. अंतर्दृष्टि (The Insight): शोध पत्र का तर्क है कि यदि कोई इनपुट भीड़भाड़ वाले क्षेत्र में आता है, तो रोबोट आश्वस्त होता है। यदि वह एक खाली क्षेत्र में आता है, तो वह अनिश्चित होता है और उसे अनिश्चितता दिखानी चाहिए।

जादुई उपकरण: "फ्लो मैचिंग" (Flow Matching)

यह मापना कि एक विशिष्ट स्थान वास्तव में कितना भीड़भाड़ वाला है, एक कठिन काम है। आप लोगों को गिनकर ऐसा नहीं कर सकते क्योंकि कमरा बहुत बड़ा और जटिल है।

लेखक रिमानियन फ्लो मैचिंग (Riemannian Flow Matching) नामक एक गणितीय ट्रिक का उपयोग करते हैं। यहाँ इसकी उपमा दी गई है:

  • पानी का प्रवाह (The Water Flow): कल्पना करें कि कमरे के खाली कोने पानी से भरे हैं और भीड़भाड़ वाले डांस फ्लोर द्वीप (islands) हैं।
  • धारा (The Current): REPVLM पानी की "धारा" को सीखता है। यह सीखता है कि पानी खाली स्थानों से भीड़भाड़ वाले द्वीपों की ओर स्वाभाविक रूप से कैसे बहता है।
  • मापन (The Measurement): पानी की एक बूंद का पीछा करके यह देखने के लिए कि वह कहाँ से आई थी, सिस्टम यह गणना कर सकता है कि वह क्षेत्र कितना "सघन" (dense/crowded) है।
    • यदि पानी एक घनी भीड़ से आसानी से बहता है, तो इनपुट सुरक्षित है।
    • यदि पानी को एक खाली शून्य से एक लंबी, अकेली दूरी तय करनी पड़ती है, तो इनपुट "अनिश्चित" (uncertain) है।

यह विधि विशेष है क्योंकि यह कमरे के आकार का सम्मान करती है। अधिकांश गणित सीधी रेखा में दूरी मापने की कोशिश करता है (एक स्केल की तरह), लेकिन यह कमरा एक गेंद की तरह घुमावदार है। REPVлоम सटीक दूरी मापने के लिए जियोडेसिक्स (geodesics) (एक घुमावदार सतह पर सबसे छोटा रास्ता, जैसे ग्लोब पर उड़ान का पथ) का उपयोग करता है।

उन्होंने क्या पाया (परिणाम)

टीम ने अपने इस नए "क्राउड-मीटर" का परीक्षण कई मानक परीक्षणों पर किया:

  1. गलतियों को पकड़ना: जब उन्होंने रोबोट को अपने सबसे "अनिश्चित" उत्तरों (जो खाली कोनों में थे) को अनदेखा करने के लिए कहा, तो बचे हुए उत्तर लगभग हमेशा सही थे। यह विधि यह पहचानने में लगभग पूर्ण थी कि रोबोट कब भ्रमित था।
  2. अजीब चीजों को ढूँढना: उन्होंने इसे "आउट-ऑफ-डिस्ट्रीब्यूशन" डेटा (ऐसी छवियां जो रोबोट के प्रशिक्षण से बिल्कुल अलग हैं) पर परखा। REPVLM ने सफलतापूर्वक इन्हें "कम घनत्व" (खाली कोने) के रूप में चिह्नित किया और कहा, "मुझे यह नहीं पता।"
  3. डेटा की सफाई: उन्होंने दिखाया कि यह विधि विशाल डेटासेट में खराब, धुंधली या निरर्थक छवियों को स्वचालित रूप से ढूंढ सकती है, जिससे भविष्य के रोबोट को प्रशिक्षित करने से पहले डेटा को साफ करने के लिए एक फिल्टर के रूप में काम किया जा सके।

यह क्यों महत्वपूर्ण है

रोबोट को अनिश्चितता स्वीकार करने के लिए बनाने वाले पिछले तरीके या तो बहुत धीमे थे (जिसके लिए रोबोट को 100 बार एक ही परीक्षण करने की आवश्यकता होती थी) या इन विशिष्ट प्रकार के मॉडलों के लिए ठीक से काम नहीं करते थे।

REPVLM है:

  • तेज़: इसे रोबोट को कई बार चलाने की आवश्यकता नहीं है।
  • नेटिव (Native): यह रोबोट को फिर से बनाए बिना सीधे उसके मस्तिष्क के आकार पर काम करता है।
  • सटीक: यह "कम भीड़ घनत्व" और "उच्च त्रुटि" के बीच एक लगभग पूर्ण संबंध बनाता है।

सीमाओं पर एक नोट

लेखक अपनी सीमाओं के बारे में ईमानदार हैं:

  • प्रॉक्सी की समस्या (The Proxy Problem): "भीड़" कहाँ है यह सीखने के लिए, सिस्टम को डेटा के एक नमूने (प्रॉक्सी) की आवश्यकता होती है जो वैसा ही दिखे जैसा रोबोट मूल रूप से प्रशिक्षित किया गया था। यदि रोबोट को साफ डेटा पर प्रशिक्षित किया गया था, लेकिन आप इसका उपयोग गंदे डेटा पर करने की कोशिश करते हैं, तो "क्राउड मैप" थोड़ा गलत हो सकता है।
  • निष्पक्षता चेतावनी (Fairness Warning): क्योंकि सिस्टम "दुर्लभ" चीजों को "अनिश्चित" के रूप में चिह्नित करता है, यह अनजाने में वैध लेकिन दुर्लभ चीजों (जैसे कम प्रतिनिधित्व वाले समूहों की छवियां) को केवल इसलिए "त्रुटि" के रूप में चिह्नित कर सकता है क्योंकि वे प्रशिक्षण डेटा में कम सामान्य हैं। लेखक सुझाव देते हैं कि इन चिह्नित वस्तुओं को स्वचालित रूप से हटाने के बजाय मनुष्यों द्वारा समीक्षा की जानी चाहिए।

सारांश

संक्षेप में, REPVLM एक सुपर-स्मार्ट रोबोट को "अंतर्ज्ञान" (gut feeling) देता है। यह रोबोट के ज्ञान को एक भीड़भाड़ वाली पार्टी रूम में मैप करके ऐसा करता है। यदि रोबोट एक भीड़भाड़ वाले स्थान पर है, तो वह आश्वस्त है। यदि वह एक खाली स्थान पर है, तो वह जानता है कि वह अनभिज्ञ है। यह हमें रोबोट पर अधिक भरोसा करने की अनुमति देता है क्योंकि हम जानते हैं कि वह कब केवल अनुमान लगा रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →