SchröMind: Mitigating Hallucinations in Multimodal Large Language Models via Solving the Schrödinger Bridge Problem
Schrömind एक नवीन ढांचा है जो श्रोडिंगर ब्रिज समस्या (Schrödinger bridge problem) का उपयोग करके भ्रमपूर्ण (hallucinatory) और सत्य (truthful) सक्रियणों के बीच एक कम लागत वाला, टोकन-स्तरीय मानचित्रण स्थापित करता है ताकि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
समस्या: मशीन में "आत्मविश्वासी झूठा"
कल्पना कीजिए कि आप एक पार्क की फोटो अपने एक बहुत ही बुद्धिमान, लेकिन थोड़े विचलित (distracted) दोस्त को दिखा रहे हैं। आप उससे पूछते हैं, "क्या इस पार्क में एक नीला हाथी है?"
आपका दोस्त, जिसने जानवरों के बारे में हजारों किताबें पढ़ी हैं लेकिन फोटो को ध्यान से नहीं देख रहा है, आत्मविश्वास से जवाब दे सकता है, "हाँ, फव्वारे के पास एक शानदार नीला हाथी है!"
वैज्ञानिक इसे "हैलुसिनेशन" (Hallucination) कहते हैं। मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs)—वे AI दिमाग जो छवियों को "देख" सकते हैं और उनके बारे में "बात" कर सकते हैं—इससे पीड़ित होते हैं। उनके पास बहुत अधिक "किताबी ज्ञान" (भाषा का ज्ञान) है, इसलिए कभी-कभी वे अपनी कल्पना को वास्तविक दृश्य पर हावी होने देते हैं। वे जरूरी नहीं कि गलती को "देखते" हैं; वे बस विचार के उस पथ का अनुसरण करते हैं जो उन्हें सच्चाई से दूर ले जाता है।
समाधान: SchröMind ("सच्चाई का GPS")
शोधकर्ताओं ने SchröMind नामक एक नई प्रणाली बनाई है। यह कैसे काम करती है, इसे समझने के लिए आइए दो उपमाओं (analogies) का उपयोग करें।
1. "ड्रिफ्ट" की उपमा (स्टीयरिंग व्हील)
AI की विचार प्रक्रिया को एक हाईवे पर चलती कार की तरह समझें।
- सत्य का पथ: एक सीधा, अच्छी तरह से पक्का रास्ता।
- हैलुसिनेशन का पथ: एक ऐसा रास्ता जो कीचड़ भरे गड्ढे में जाने लगता है क्योंकि ड्राइवर ख्यालों में खोया हुआ है।
वर्तमान AI सुधार आमतौर पर कार को वापस सड़क पर लाने के लिए स्टीयरिंग व्हील को जोर से बाईं ओर "झटकने" (yank) की कोशिश करते हैं। समस्या क्या है? यदि आप पहिए को बहुत जोर से झटका देते हैं, तो आप कार को पलट सकते हैं (यह तब होता है जब AI बेतुकी बातें करने लगता है या अपनी प्रवाह क्षमता खो देता है)।
SchröMind एक हाई-टेक सेल्फ-ड्राइविंग सिस्टम की तरह काम करता है। अचानक झटके देने के बजाय, यह गणना करता है कि कार को वापस पक्की सड़क पर लाने के लिए सबसे सुचारू वक्र (curve) की आवश्यकता है। यह कीचड़ वाले गड्ढे से वापस हाईवे तक पहुँचने के लिए "सबसे छोटा, सबसे कुशल पथ" खोजता है, ताकि यात्रियों (उपयोगकर्ताओं) को कोई झटका महसूस न हो।
2. "श्रोडिंगर ब्रिज" की उपमा (जादुई पुल)
इसका नाम एक जटिल गणितीय अवधारणा "श्रोडिंगर ब्रिज प्रॉब्लम" (Schrödinger Bridge Problem) से लिया गया है।
कल्पना कीजिए कि आपके पास दो द्वीप हैं: द्वीप हॉलुसिनेशन (जहाँ AI मनगढ़ंत बातें बना रहा है) और द्वीप सत्य (जहाँ AI सटीक है)। आप लोगों की भीड़ को हॉलुसिनेशन द्वीप से सत्य द्वीप की ओर ले जाना चाहते हैं।
- पुराने तरीके: वे एक ही समय में सभी को एक ही दिशा में धकेलने की कोशिश करते हैं। यह अराजक और अव्यवset है।
- SchröMind: यह "स्मार्ट पुलों" की एक श्रृंखला बनाता है। यह प्रत्येक व्यक्ति (प्रत्येक "टोकन" या शब्द जिसे AI बोलने वाला है) को देखता है और कहता है, "तुम्हें, विशेष रूप से, सत्य तक पहुँचने के लिए बिल्कुल इसी तरह चलना होगा।" यह हर एक शब्द के लिए एक व्यक्तिगत, गणितीय पुल बनाता है, जिससे यह सुनिश्चित होता है कि परिवर्तन निर्बाक (seamless) हो और इसमें कम से कम ऊर्जा खर्च हो।
यह वास्तव में कैसे काम करता है? (दो-चरणीय नृत्य)
- डिटेक्टिव चरण (जांच चरण): सिस्टम पहले AI की "मस्तिष्क तरंगों" (activations) को देखता है ताकि यह पता चल सके कि उसके दिमाग के कौन से हिस्से झूठ बोलने के प्रति प्रवृत्त हैं। यह उन विशिष्ट "अटेंशन हेड्स" (मस्तिष्क के वे हिस्से जो गलत चीजों पर ध्यान केंद्रित कर रहे हैं) की पहचान करता है।
- करेक्शन चरण (सुधार चरण): एक बार जब यह मस्तिष्क के "झूठे" हिस्सों को ढूंढ लेता है, तो यह उन विचारों को छवि की दृश्य वास्तविकता की ओर वापस धकेलने के लिए गणित (ब्रिज) लागू करता है।
यह क्यों महत्वपूर्ण है?
रोजमर्रा की जिंदगी में, किसी फोटो में बिल्ली के बारे में AI का भ्रमित होना केवल एक मजेदार गलती है। लेकिन यदि कोई AI किसी डॉक्टर को एक्स-रे देखने में मदद कर रहा है या किसी स्व-चालित कार (self-driving car) को स्टॉप साइन देखने में मदद कर रहा है, तो एक हॉलुसिनेशन खतरनाक हो सकता है।
SchröMind इन मॉडल्स को बहुत अधिक विश्वसनीय बनाता है। इसके लिए पूरे मस्तिष्क को "पुनः प्रशिक्षित" (re-training) करने की आवश्यकता नहीं होती (जो महंगा और धीमा है); यह केवल उस क्षण में एक "स्मार्ट धब्बा" (smart nudge) प्रदान करता है जब AI बोल रहा होता है। यह AI को कम बुद्धिमान बनाए बिना उसे अधिक ईमानदार बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।