Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution
SIRA एक प्रशिक्षण-मुक्त (training-free), आंतरिक कंट्रास्टिविव डिकोडिंग फ्रेमवर्क है जो बाद की परतों में मास्क्ड अटेंशन के माध्यम से उसी ट्रांसफार्मर के भीतर भाषा-प्राथमिकता-प्रधान काउंटरफैक्चुअल संदर्भ उत्पन्न करके बड़े विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम करता है, जिससे बाहरी उपकरणों और अतिरिक्त फॉरवर्ड पासेज पर निर्भरता कम होती है और वर्णनात्मक कवरेज भी सुरक्षित रहता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सुशिक्षित सहायक (एक लार्ज विजन-लैंग्वेज मॉडल) है जो आपके द्वारा दिखाई गई तस्वीर का वर्णन करने की कोशिश कर रहा है। कभी-कभी, यह सहायक उस चीज़ के बारे में बताने में बहुत अधिक आत्मविश्वासी हो जाता है जो वे वास्तव में देखते हैं, बजाय उसके जो वास्तव में वहां मौजूद है। वे कह सकते हैं, "मुझे एक लाल साइकिल दिख रही है," जबकि तस्वीर वास्तव में केवल एक धुंधली आकृति है जो एक साइकिल हो सकती है, या वे विवरणों का आविष्कार कर सकते हैं क्योंकि उन्होंने साइकिलों के बारे में इतनी कहानियाँ पढ़ी हैं कि उनका मस्तिष्क खाली जगहों को भर देता है। इसे हैलुसिनेशन (hallucination) कहा जाता है।
यह पेपर एक चतुर नया तरीका पेश करता है जिसे SIRA कहा जाता है, ताकि इस तरह की गलतियों को रोका जा सके, बिना सहायक को फिर से प्रशिक्षित किए या काम की दोबारा जाँच करने के लिए किसी दूसरे व्यक्ति को नियुक्त किए।
पुराने तरीकों के साथ समस्या
पहले, सहायक को झूठ बोलने से रोकने के लिए, शोधकर्ताओं ने इस तरह की विधि का प्रयास किया:
- सहायक को मूल तस्वीर दिखाएं।
- फिर, उन्हें उसी तस्वीर का एक धुंधला या बिगड़ा हुआ संस्करण दिखाएं।
- दोनों उत्तरों की तुलना करें। यदि धुंधली तस्वीर होने पर सहायक अपनी बात बदल देता है, तो शायद वह केवल अनुमान लगा रहा था।
दोष: यह किसी को एक पेंटिंग का वर्णन करने के लिए कहने जैसा है, और फिर उसी पेंटिंग का वर्णन करने के लिए कहने जैसा है जब उन्होंने धुंधले चश्मे पहने हों। "धुंधले चश्मे" वाला संस्करण एक निष्पक्ष तुलना नहीं है क्योंकि चश्मे स्वयं छवि को विकृत कर देते हैं। यह अव्यवस्थित है, इसमें दोगुना समय लगता है (आपको तस्वीर को दो अलग-अलग बार देखना पड़ता है), और विकृति नई त्रुटियां भी पैदा कर सकती है।
SIRA समाधान: "शेयर्ड प्रीफिक्स" (Shared Prefix)
SIRA एक अलग दृष्टिकोण अपनाता है। तस्वीर के साथ छेड़छाड़ करने के बजाय, यह सहायक की आंतरिक विचार प्रक्रिया के साथ छेड़छाड़ करता है जबकि वे अभी सोच रहे होते हैं।
सोचिए कि सहायक का मस्तिष्क एक फैक्ट्री असेंबली लाइन की तरह है जिसमें कई स्टेशन (परतें) हैं जो छवि और प्रश्न को प्रोसेस करती हैं।
- साझा शुरुआत (The Shared Start): सहायक तस्वीर और प्रश्न को एक साथ देखना शुरू करता है। वे फैक्ट्री के शुरुआती स्टेशनों में दृश्य की एक ठोस समझ बनाते हैं। यह "शेयर्ड प्रीफिक्स" है। SIRA यह सुनिश्चित करता है कि दोनों संस्करण इस प्रारंभिक समझ पर सहमत हों।
- रास्ते का विभाजन (The Fork in the Road): प्रारंभिक समझ बनने के बाद, SIRA एक ही मस्तिष्क के भीतर दो समानांतर ट्रैक में प्रक्रिया को विभाजित करता है:
- ट्रैक A (पूर्ण दृश्य - The Full View): सहायक अपना वाक्य पूरा करते समय चित्र के विवरणों को देखना जारी रखता है।
- ट्रैक B ("अंधा" दृश्य - The "Blind" View): सहायक ठीक उसी शुरुआती बिंदु से आगे बढ़ता है, लेकिन बाद के स्टेशनों में, वे विशिष्ट चित्र विवरणों के लिए आंखों पर पट्टी बंधे होते हैं। वे केवल अपने सामान्य ज्ञान और उस वाक्य पर निर्भर रह सकते हैं जो उन्होंने पहले ही लिखना शुरू कर दिया है।
यह झूठ को कैसे ठीक करता है
अब, SIRA वाक्य लिखने के हर चरण पर इन दोनों ट्रैकों की तुलना करता है:
- यदि सहायक कहता है, "मुझे एक कुत्ता दिख रहा है," और ट्रैक A (कुत्ते को देखते हुए) और ट्रैक B (आंखों पर पट्टी बंधे हुए) दोनों उच्च आत्मविश्वास के साथ "कुत्ता" कहते हैं, तो SIRA जानता है कि यह केवल सामान्य भाषा पर आधारित एक अनुमान है (शायद कहानियों में कुत्ते आम हैं)। यह "कुत्ता" के लिए स्कोर कम कर देता है क्योंकि अंधे वर्जन को यह कहने के लिए तस्वीर की आवश्यकता नहीं थी।
- यदि सहायक कहता है, "मुझे एक बैंगनी हाथी दिख रहा है," और ट्रैक A "बैंगनी हाथी" कहता है (क्योंकि वे देख रहे हैं) लेकिन ट्रैक B "बिल्कुल नहीं, यह कहानी में नहीं है" कहता है (क्योंकि वे देख नहीं सकते), तो SIRA जानता है कि यह दावा केवल तस्वीर के कारण है। यह "बैंगनी हाथी" के लिए स्कोर बढ़ाता है।
यह बेहतर क्यों है
- कोई अतिरिक्त चरण नहीं: इसे तस्वीर को दो बार देखने की आवश्यकता नहीं है। यह सब एक बार में करता है, बस विचार प्रक्रिया को विभाजित करके।
- कोई अव्यवस्थित विकृति नहीं: यह तस्वीर को धुंधला नहीं करता है। यह केवल विचार प्रक्रिया के एक संस्करण के लिए विजुअल इनपुट को अस्थायी रूप से "बंद" कर देता है, जिससे बाकी का संदर्भ पूरी तरह से संरेखित रहता है।
- किसी प्रशिक्षण की आवश्यकता नहीं: यह मौजूदा मॉडलों पर तुरंत काम करता है। आपको मॉडल को कुछ भी नया सिखाने की आवश्यकता नहीं है।
परिणाम
परीक्षणों में, SIRA ने सहायकों को ऐसी चीजें बनाने से सफलतापूर्वक रोका जो वहां नहीं थीं (जैसे कि एक "केला" जो फोटो में नहीं है) जबकि उन्हें वास्तविक चीजों को सटीक रूप से वर्णित करने भी दिया। यह एक अंतर्निहित "रियलिटी चेक" की तरह है जो मॉडल के अपने मस्तिष्क के भीतर तुरंत होता है, यह सुनिश्चित करता है कि वे जो कहते हैं वह वास्तव में उनके द्वारा देखे गए दृश्यों द्वारा समर्थित है, न कि केवल उस पर जो वे देखने की उम्मीद करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।