← नवीनतम पेपर
💬 NLP

FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA

यह शोध पत्र FilterRAG को प्रस्तुत करता है, जो एक ज़ीरो-शॉट रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो विज़ुअल क्वेश्चन अनस्विरिंग (Visual Question Answering) में विशेष रूप से ज्ञान-संचालित और आउट-ऑफ-डिस्ट्रीब्यूशन परिदृश्यों के लिए मतिभ्रम (hallucinations) को काफी कम करने और सटीकता में सुधार करने हेतु विकिपीडिया और DBpedia जैसे बाहरी ज्ञान स्रोतों के साथ BLIP-VQA को एकीकृत करता है।

मूल लेखक: Nobin Sarwar

प्रकाशित 2026-01-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nobin Sarwar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पार्टी में हैं, और कोई आपको अजीब टॉपिंग्स वाला हॉट डॉग का चित्र दिखाता है और आपसे पूछता है, "ये क्या हैं?" यदि आपने पहले कभी वह विशिष्ट टॉपिंग नहीं देखी है, तो आपका मस्तिष्क इसे जो आप सोचते हैं उसके आधार पर अनुमान लगाने की कोशिश कर सकता है। आप कह सकते हैं, "यह शायद मस्टर्ड (सरसों का पेस्ट) है," भले ही वह वास्तव में रिलिश हो। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इस अनुमान लगाने के खेल को हैलुसिनेशन (Hallucination) कहा जाता है। AI पूरी तरह आश्वस्त होता है, लेकिन वह गलत होता है।

यह पेपर FilterRAG नामक एक नई प्रणाली पेश करता है ताकि AI को ये आत्मविश्वासी गलतियाँ करने से रोका जा सके, विशेष रूप से तब जब वह ऐसी चीजों का सामना करता है जिन्हें उसने अपने प्रशिक्षण डेटा (training data) में नहीं देखा है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "सब कुछ जानने वाला" जो अनुमान लगाता है

वर्तमान AI मॉडल (जैसे कि वे जो एक चित्र देख सकते हैं और प्रश्नों के उत्तर दे सकते हैं) जो वे देखते हैं उसका वर्णन करने में बहुत अच्छे हैं। लेकिन यदि आप उनसे ऐसा प्रश्न पूछते हैं जिसके लिए बाहरी ज्ञान की आवश्यकता हो—जैसे कि "इस मोटरसाइकिल का उपयोग किस खेल के लिए किया जाता है?" या "यह विशिष्ट कंडिमेंट (मसाला/चटनी) क्या है?"—तो वे अक्सर संघर्ष करते हैं।

तथ्यों की जाँच करने के तरीके के बिना, ये मॉडल अपने प्रशिक्षण से मिली "यादों" पर भरोसा करते हैं। यदि प्रशिक्षण डेटा पक्षपाती या अधूरा है, तो AI अनुमान लगाता है। यह उस छात्र की तरह है जो परीक्षा देने बैठा है जिसने उस विशिष्ट अध्याय को नहीं पढ़ा है; वे एक ऐसा उत्तर देने की कोशिश करते हैं जो सुनने में अच्छा लगे लेकिन वास्तव में गलत हो।

2. समाधान: "लाइब्रेरियन" दृष्टिकोण

लेखकों ने FilterRAG बनाया है। इस सिस्टम को एक ऐसे छात्र के रूप में सोचें जिसे परीक्षा के दौरान लाइब्रेरी (पुस्तकालय) का उपयोग करने की अनुमति है।

  • छात्र (BLIP-VQA): यह AI का वह हिस्सा है जो चित्र को देखता है और प्रश्न को पढ़ता है। यह चित्र देखने में स्मार्ट है लेकिन तथ्यों के लिए इसे मदद की आवश्यकता है।
  • लाइब्रेरी (Wikipedia और DBpedia): अनुमान लगाने के बजाय, सिस्टम रुकता है और एक डिजिटल लाइब्रेरी की ओर दौड़ता है। यह चित्र और प्रश्न के बारे में वास्तविक दुनिया के तथ्यों की खोज करता है।
  • लाइब्रेरियन (GPT-Neo): यह वह हिस्सा है जो उन तथ्यों को पढ़ता है जो लाइब्रेरी ने खोजे हैं और अंतिम उत्तर लिखता है।

AI को उत्तर देने से पहले "लाइब्रेरी चेक करने" के लिए मजबूर करके, यह अनुमान लगाना बंद कर देता है और तथ्यों का उपयोग करना शुरू कर देता है।

3. यह कैसे काम करता है (चरण-दर-चरण)

पेपर एक विशिष्ट प्रक्रिया का वर्णन करता है, जिसे हम भोजन तैयार करने की तरह देख सकते हैं:

  1. सामग्री काटना (ग्रिड): सिस्टम चित्र को लेता है और उसे 2x2 ग्रिड (चार वर्गों) में काटता है।
    • क्यों? यदि आप एक फोटो को बहुत सारे छोटे टुकड़ों में काटते हैं (जैसे 4x4 ग्रिड), तो आप बड़ी तस्वीर खो देते हैं, और AI भ्रमित हो जाता है। यदि आप इसे एक बड़े ब्लॉक के रूप में रखते हैं, तो आप छोटे विवरणों को मिस कर देते हैं। 2x2 ग्रिड "गोल्डिलॉक्स" (Goldilocks) आकार है—यह चित्र को सुसंगत रखता है लेकिन पर्याप्त विस्तृत भी है।
  2. चित्र को देखना: सिस्टम इन चार वर्गों के साथ प्रश्न का विश्लेषण करता है।
  3. खोज (The Search): यह प्रासंगिक तथ्य खोजने के लिए "लाइब्रेरी" (Wikipedia और DBpedia) को एक क्वेरी भेजता है। मोटरसाइकिल वाले प्रश्न के लिए, यह "मोटोक्रॉस" के बारे में तथ्य पा सकता है। हॉट डॉग के लिए, यह "रिलिश" के बारे में तथ्य पा सकता है।
  4. असेंबली (The Assembly): सिस्टम चित्र, प्रश्न और अभी खोजे गए नए तथ्यों को जोड़ता है।
  5. उत्तर: एक फ्रीज्ड लैंग्वेज मॉडल (GPT-Neo) इस संयुक्त जानकारी को पढ़ता है और उत्तर लिखता है। क्योंकि इसके पास तथ्य हैं, इसे अनुमान लगाने की आवश्यकता नहीं है।

4. परिणाम: "अनजान" स्थितियों में बेहतर

शोधकर्ताओं ने इसका परीक्षण OK-VQA नामक एक डेटासेट पर किया, जो कठिन प्रश्नों से भरा है जिनके लिए बाहरी ज्ञान की आवश्यकता होती है।

  • बेसलाइन (Baseline): मानक AI मॉडल (बिना लाइब्रेरी के) इन कठिन प्रश्नों पर लगभग 40% उत्तर सही दे पाते थे। वे काफी हद तक हैलुसिनेशन (भ्रम) कर रहे थे।
  • FilterRAG: इस नए सिस्टम ने 36.5% सटीकता प्राप्त की।
    • क्या यह कम है? पेपर नोट करता है कि हालांकि कच्चा नंबर कुछ विशाल, अत्यधिक जटिल सिस्टम की तुलना में थोड़ा कम है जो बड़े कंप्यूटरों का उपयोग करते हैं, FilterRAG बहुत अधिक कुशल है। यह प्रदर्शन और गति/लागत के बीच संतुलन बनाता है।
    • असली जीत: सिस्टम आउट-ऑफ-डिस्ट्रीब्यूशन (OOD) परिदृश्यों में बहुत बेहतर था। इसका मतलब है कि जब AI ने कुछ बिल्कुल नया या अजीब देखा (जैसे कि एक मोटरसाइकिल जिसे उसने पहले के संदर्भ में नहीं देखा था), तो उसके द्वारा गलत अनुमान लगाने की संभावना बहुत कम थी। यह केवल बातें बनाने के बजाय तथ्यों पर आधारित रहा।

5. "ग्राउंडिंग स्कोर" (The Grounding Score)

यह साबित करने के लिए कि AI केवल अनुमान नहीं लगा रहा था, लेखकों ने एक "ग्राउंडिंग स्कोर" का उपयोग किया। इसे एक सत्य मीटर (truth meter) के रूप में समझें।

  • यदि AI कहता है "मस्टर्ड" लेकिन लाइब्रेरी कहती है "रिलिश," तो स्कोर गिर जाता है।
  • यदि AI "रिलिश" कहता है क्योंकि लाइब्रेरी ने "रिलिश" कहा था, तो स्कोर उच्च रहता है।
    FilterRAG ने अपना सत्य मीटर ऊँचा रखा, जिससे सिद्ध हुआ कि वह वास्तव में खोजे गए तथ्यों का उपयोग कर रहा था, न कि केवल कहानियाँ बना रहा था।

सारांश

FilterRAG एक AI को परीक्षा के दौरान "चीट शीट" (सर्च इंजन) देने जैसा है। हॉट डॉग या मोटरसाइकिल के बारे में कठिन प्रश्न का उत्तर देने के लिए अपनी दोषपूर्ण याददाश्त पर भरोसा करने के बजाय, यह एक विश्वसनीय डेटाबेस में उत्तर खोजता है। यह इसे आत्मविश्वास के साथ गलत बात कहने से रोकता है, जिससे यह उन वास्तविक दुनिया के उपयोगों के लिए सुरक्षित और अधिक विश्वसनीय बन जाता है जहाँ इसे ऐसी चीजें मिल सकती हैं जिन्हें इसने पहले कभी नहीं देखा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →