← नवीनतम पेपर
🤖 machine learning

Online Self-Calibration Against Hallucination in Vision-Language Models

यह शोध पत्र OSCAR का प्रस्ताव करता है, जो एक ऑनलाइन स्व-अंशांकन (self-calibration) ढांचा है जो मोंटे-कार्लो ट्री सर्च (Monte-Carlo Tree Search) और डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (Direct Preference Optimization) के माध्यम से प्राथमिकता डेटा का निर्माण करने के लिए लार्ज विजन-लैंग्वेज मॉडल्स में एक जनरेटिव-डिस्क्रिमिनेटिव अंतराल का लाभ उठाता है, जिससे बाहरी पर्यवेक्षण पर निर्भर किए बिना मतिभ्रम (hallucinations) को प्रभावी रूप से कम किया जा सकता है।

मूल लेखक: Minghui Chen, Chenxu Yang, Hengjie Zhu, Dayan Wu, Zheng Lin, Qingyi Si

प्रकाशित 2026-05-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minghui Chen, Chenxu Yang, Hengjie Zhu, Dayan Wu, Zheng Lin, Qingyi Si

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "अति-आत्मविश्वासी" कलाकार

कल्पना कीजिए कि एक प्रतिभाशाली कलाकार (AI मॉडल) है जो किसी फोटो का वर्णन करने में बहुत अच्छा है। हालांकि, उसमें एक बुरी आदत है: जब वह किसी विवरण को ठीक से नहीं देख पाता, तो वह यह नहीं कहता कि "मुझे यकीन नहीं है।" इसके बजाय, वह अनुमान लगाता है कि आमतौर पर ऐसी तस्वीरों में क्या होता है।

यदि आप उसे एक लिविंग रूम की तस्वीर दिखाते हैं, तो वह आत्मविश्वास से कह सकता है, "वहाँ एक नीला दीवार है और चिमनी के ऊपर एक दर्पण है," भले ही दीवार वास्तव में सफेद हो और वहाँ कोई दर्पण न हो। वह भ्रम (Hallucinate) पैदा करता है – वह उन तथ्यों को गढ़ लेता है जो अस्तित्व में ही नहीं हैं।

पुराना तरीका: "दबदबा बनाने वाले शिक्षक" की गलती

पहले, शोधकर्ताओं ने इसे ठीक करने के लिए एक "सुपर-टीचर" (एक बहुत अधिक बुद्धिमान AI जैसे GPT) को काम पर रखने की कोशिश की ताकि वे आदर्श विवरण लिख सकें। फिर उन्होंने छात्र-कलाकार को उन आदर्श विवरणों की नकल करने के लिए मजबूर किया।

पेपर की खोज: यह विफल रहा।
कल्पना कीजिए कि एक छात्र एक गणित के जीनियस प्रोफेसर से उन्नत कैलकुलस (Advanced Calculus) सीखने की कोशिश कर रहा है। प्रोफेसर उन सूक्ष्म, जटिल विवरणों को देख सकता है जिन्हें छात्र का मस्तिष्क अभी तक प्रोसेस नहीं कर सकता। यदि छात्र प्रोफेसर के नोट्स की नकल करने की कोशिश करता है, तो वह वास्तव में गणित को देख नहीं पाता; वह केवल शब्दों को रट लेता है।

  • परिणाम: छात्र चित्र को देखना बंद कर देता है और रटे हुए शब्दों के आधार पर अनुमान लगाने लगता है। वह और भी अधिक भ्रम (Hallucinate) पैदा करता है क्योंकि वह उन चीजों का वर्णन करने की कोशिश करता है जिन्हें उसकी आँखें वास्तव में नहीं देख सकतीं। पेपर इसे मॉनिटरिंग-परसेप्शन विसंगति (Monitoring-Perception Discrepancy) कहता है।

समाधान: "स्वयं जाँच करने वाला" जासूस

लेखकों ने महसूस किया कि हालांकि कलाकार अपनी ओर से कहानी बनाने (Generation) में बुरा है, लेकिन वह यह जाँच करने में काफी अच्छा है कि कोई विशिष्ट विवरण सत्य है या नहीं (Discrimination)।

  • जेनरेशन (Generation): "इस कमरे का वर्णन करें।" -> कलाकार अनुमान लगाता है कि एक दर्पण मौजूद है।
  • डिस्क्रिमिनेशन (Discrimination): "क्या इस कमरे में एक दर्पण है?" -> कलाकार बारीकी से देखता है और कहता है, "नहीं, वहाँ नहीं है।"

पेपर इसे जेनरेटिव-डिस्क्रिमिनेटिव गैप (Generative-Discriminative Gap) कहता है। मॉडल एक कहानीकार की तुलना में एक बेहतर जासूस है।

नया तरीका: OSCAR (द "ट्री क्लाइंबर")

बिना किसी सुपर-टीचर की आवश्यकता के इस समस्या को हल करने के लिए, लेखकों ने OSCAR नामक एक प्रणाली विकसित की। यह एक पेड़ पर चढ़ने वाले पर्वतारोही की तरह काम करता है जो ऊपर की ओर सबसे अच्छा रास्ता खोजने के लिए चढ़ता है।

  1. ट्री सर्च (MCTS): एक वाक्य लिखकर आगे बढ़ने के बजाय, AI विवरणों के कई अलग-अलग संस्करणों की कल्पना करता है। यह वाक्यों के विभिन्न रास्तों के साथ एक पेड़ की तरह शाखाओं में बंट जाता है।
  2. दो-चरणीय रिवॉर्ड सिस्टम:
    • चरण 1 (नोड चेक): जैसे-जैसे AI प्रत्येक वाक्य लिखता है, वह एक जासूस की तरह कार्य करता है। वह खुद से पूछता है: "क्या मैंने अभी किसी ऐसी वस्तु का उल्लेख किया है जो चित्र में नहीं है?" यदि उत्तर "हाँ, मैंने इसे बनाया है" है, तो उस पथ (Path) को कम स्कोर दिया जाता है।
    • चरण 2 (द फाइनल गेट): एक बार में पूरा विवरण लिखे जाने के बाद, AI पूरी चीज़ की जाँच करता है। यदि विवरण में कोई भी मनगढ़ंत वस्तु शामिल है, तो पूरे पथ को शून्य (Zero) स्कोर मिलता है। यह एक "फेल-सेफ" गेट की तरह है: यदि आपने एक बार भी झूठ बोला, तो आपको कोई पुरस्कार नहीं मिलेगा।
  3. पेड़ पर चढ़ना (Climbing the Tree): AI इन स्कोर का उपयोग करके पेड़ पर वापस ऊपर चढ़ता है। वह पहचानता है कि किन रास्तों ने "भ्रम-मुक्त" (Hallucination-free) विवरण दिए और अगली बार उन रास्तों को चुनना सीखता है।

परिणाम: करके सीखना

एक जीनियस शिक्षक के उत्तरों की नकल करने के लिए मजबूर होने के बजाय, AI पुनरावृत्ति (Iteration) के माध्यम से सीखता है:

  1. यह एक चित्र का वर्णन करने का प्रयास करता है।
  2. यह अपनी गलतियों को खोजने के लिए अपने स्वयं के "जासूसी कौशल" का उपयोग करता है।
  3. यह अगली बार बेहतर होने के लिए अपनी गलतियों से सीखता है।

परिणाम:

  • कम अनुमान लगाना: AI अब वस्तुओं का आविष्कार नहीं करता (जैसे गलत दर्पण या नीली दीवार)।
  • बेहतर सटीकता: यह चित्र के बारे में "हाँ/नहीं" वाले सवालों के जवाब देने में बहुत बेहतर हो जाता है।
  • अभी भी रचनात्मक: यह उबाऊ नहीं होता; यह समृद्ध और प्रवाहमयी विवरण लिखना जारी रखता है, लेकिन ये अब वास्तव में जो वह देख रहा है, उस पर आधारित होते हैं।

सारांश

यह पेपर तर्क देता है कि AI को यह बताने से रोकने के लिए कि वह क्या देख रहा है, हमें उसे उन उत्तरों की नकल करने के लिए मजबूर नहीं करना चाहिए जिन्हें वह समझ नहीं सकता। इसके बजाय, हमें उसे अपने काम की जाँच करने के लिए अपने स्वयं के "जासूसी कौशल" का उपयोग करने, विभिन्न संभावनाओं को तलाशने और अपनी गलतियों से एक चक्र में सीखने की अनुमति देनी चाहिए। यह AI को अधिक ईमानदार और विश्वसनीय बनाता है बिना किसी अत्यधिक बुद्धिमान मानव (या AI) द्वारा हर कदम की निगरानी किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →