← नवीनतम पेपर
💻 computer science

SchröMind: Mitigating Hallucinations in Multimodal Large Language Models via Solving the Schrödinger Bridge Problem

Schrömind एक नवीन ढांचा है जो श्रोडिंगर ब्रिज समस्या (Schrödinger bridge problem) का उपयोग करके भ्रमपूर्ण (hallucinatory) और सत्य (truthful) सक्रियणों के बीच एक कम लागत वाला, टोकन-स्तरीय मानचित्रण स्थापित करता है ताकि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम किया जा सके।

मूल लेखक: Ziqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ziqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: मशीन में "आत्मविश्वासी झूठा"

कल्पना कीजिए कि आप एक पार्क की फोटो अपने एक बहुत ही बुद्धिमान, लेकिन थोड़े विचलित (distracted) दोस्त को दिखा रहे हैं। आप उससे पूछते हैं, "क्या इस पार्क में एक नीला हाथी है?"

आपका दोस्त, जिसने जानवरों के बारे में हजारों किताबें पढ़ी हैं लेकिन फोटो को ध्यान से नहीं देख रहा है, आत्मविश्वास से जवाब दे सकता है, "हाँ, फव्वारे के पास एक शानदार नीला हाथी है!"

वैज्ञानिक इसे "हैलुसिनेशन" (Hallucination) कहते हैं। मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs)—वे AI दिमाग जो छवियों को "देख" सकते हैं और उनके बारे में "बात" कर सकते हैं—इससे पीड़ित होते हैं। उनके पास बहुत अधिक "किताबी ज्ञान" (भाषा का ज्ञान) है, इसलिए कभी-कभी वे अपनी कल्पना को वास्तविक दृश्य पर हावी होने देते हैं। वे जरूरी नहीं कि गलती को "देखते" हैं; वे बस विचार के उस पथ का अनुसरण करते हैं जो उन्हें सच्चाई से दूर ले जाता है।


समाधान: SchröMind ("सच्चाई का GPS")

शोधकर्ताओं ने SchröMind नामक एक नई प्रणाली बनाई है। यह कैसे काम करती है, इसे समझने के लिए आइए दो उपमाओं (analogies) का उपयोग करें।

1. "ड्रिफ्ट" की उपमा (स्टीयरिंग व्हील)

AI की विचार प्रक्रिया को एक हाईवे पर चलती कार की तरह समझें।

  • सत्य का पथ: एक सीधा, अच्छी तरह से पक्का रास्ता।
  • हैलुसिनेशन का पथ: एक ऐसा रास्ता जो कीचड़ भरे गड्ढे में जाने लगता है क्योंकि ड्राइवर ख्यालों में खोया हुआ है।

वर्तमान AI सुधार आमतौर पर कार को वापस सड़क पर लाने के लिए स्टीयरिंग व्हील को जोर से बाईं ओर "झटकने" (yank) की कोशिश करते हैं। समस्या क्या है? यदि आप पहिए को बहुत जोर से झटका देते हैं, तो आप कार को पलट सकते हैं (यह तब होता है जब AI बेतुकी बातें करने लगता है या अपनी प्रवाह क्षमता खो देता है)।

SchröMind एक हाई-टेक सेल्फ-ड्राइविंग सिस्टम की तरह काम करता है। अचानक झटके देने के बजाय, यह गणना करता है कि कार को वापस पक्की सड़क पर लाने के लिए सबसे सुचारू वक्र (curve) की आवश्यकता है। यह कीचड़ वाले गड्ढे से वापस हाईवे तक पहुँचने के लिए "सबसे छोटा, सबसे कुशल पथ" खोजता है, ताकि यात्रियों (उपयोगकर्ताओं) को कोई झटका महसूस न हो।

2. "श्रोडिंगर ब्रिज" की उपमा (जादुई पुल)

इसका नाम एक जटिल गणितीय अवधारणा "श्रोडिंगर ब्रिज प्रॉब्लम" (Schrödinger Bridge Problem) से लिया गया है।

कल्पना कीजिए कि आपके पास दो द्वीप हैं: द्वीप हॉलुसिनेशन (जहाँ AI मनगढ़ंत बातें बना रहा है) और द्वीप सत्य (जहाँ AI सटीक है)। आप लोगों की भीड़ को हॉलुसिनेशन द्वीप से सत्य द्वीप की ओर ले जाना चाहते हैं।

  • पुराने तरीके: वे एक ही समय में सभी को एक ही दिशा में धकेलने की कोशिश करते हैं। यह अराजक और अव्यवset है।
  • SchröMind: यह "स्मार्ट पुलों" की एक श्रृंखला बनाता है। यह प्रत्येक व्यक्ति (प्रत्येक "टोकन" या शब्द जिसे AI बोलने वाला है) को देखता है और कहता है, "तुम्हें, विशेष रूप से, सत्य तक पहुँचने के लिए बिल्कुल इसी तरह चलना होगा।" यह हर एक शब्द के लिए एक व्यक्तिगत, गणितीय पुल बनाता है, जिससे यह सुनिश्चित होता है कि परिवर्तन निर्बाक (seamless) हो और इसमें कम से कम ऊर्जा खर्च हो।

यह वास्तव में कैसे काम करता है? (दो-चरणीय नृत्य)

  1. डिटेक्टिव चरण (जांच चरण): सिस्टम पहले AI की "मस्तिष्क तरंगों" (activations) को देखता है ताकि यह पता चल सके कि उसके दिमाग के कौन से हिस्से झूठ बोलने के प्रति प्रवृत्त हैं। यह उन विशिष्ट "अटेंशन हेड्स" (मस्तिष्क के वे हिस्से जो गलत चीजों पर ध्यान केंद्रित कर रहे हैं) की पहचान करता है।
  2. करेक्शन चरण (सुधार चरण): एक बार जब यह मस्तिष्क के "झूठे" हिस्सों को ढूंढ लेता है, तो यह उन विचारों को छवि की दृश्य वास्तविकता की ओर वापस धकेलने के लिए गणित (ब्रिज) लागू करता है।

यह क्यों महत्वपूर्ण है?

रोजमर्रा की जिंदगी में, किसी फोटो में बिल्ली के बारे में AI का भ्रमित होना केवल एक मजेदार गलती है। लेकिन यदि कोई AI किसी डॉक्टर को एक्स-रे देखने में मदद कर रहा है या किसी स्व-चालित कार (self-driving car) को स्टॉप साइन देखने में मदद कर रहा है, तो एक हॉलुसिनेशन खतरनाक हो सकता है।

SchröMind इन मॉडल्स को बहुत अधिक विश्वसनीय बनाता है। इसके लिए पूरे मस्तिष्क को "पुनः प्रशिक्षित" (re-training) करने की आवश्यकता नहीं होती (जो महंगा और धीमा है); यह केवल उस क्षण में एक "स्मार्ट धब्बा" (smart nudge) प्रदान करता है जब AI बोल रहा होता है। यह AI को कम बुद्धिमान बनाए बिना उसे अधिक ईमानदार बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →