← नवीनतम पेपर
🤖 AI

TIGER: Traceable Inference with Graph-Based Evidence Routing for Mitigating Hallucinations in Multimodal Generation

TIGER एक इन्फरेंस-टाइम फ्रेमवर्क है जो एक फ्रोजन बैकबोन के माध्यम से उच्च-जोखिम वाले असमर्थित तथ्यों की पहचान करने और उन्हें सुधारने के लिए अवलोकन और दावे के ग्राफों को स्वतंत्र रूप से निर्मित करके मल्टीमॉडल जनरेशन में मतिभ्रम (hallucinations) को कम करता है, जिससे विभिन्न क्रॉस-मोडल कार्यों में कार्य की गुणवत्ता को बनाए रखते हुए अनग्राउंडेड सामग्री को कम किया जाता है।

मूल लेखक: Kaixiang Zhao, Tianrun Yu, Shawn Huang, Porter Jenkins, Yushun Dong, Amanda Hughes

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaixiang Zhao, Tianrun Yu, Shawn Huang, Porter Jenkins, Yushun Dong, Amanda Hughes

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली लेकिन थोड़ा विचलित रहने वाला कलाकार (AI मॉडल) है। आप उसे एक शांत झील की तस्वीर दिखाते हैं जिसमें दो बत्तखें हैं और उससे एक विवरण लिखने को कहते हैं। कलाकार एक सुंदर, प्रवाहपूर्ण अनुच्छेद लिखता है, लेकिन बीच में, वह गलती से दावा कर देता है कि वहाँ तीन बत्तखें हैं और पास में एक नाव भी है, जबकि तस्वीर में न तो वे मौजूद हैं और न ही नाव।

इसे "हैलुसिनेशन" (Hallucination) कहा जाता है। कहानी अच्छी लगती है, लेकिन तथ्य गलत होते हैं।

यह शोध पत्र TIGER (Traceable Inference with Graph-Based Evidence Routing) नामक एक नई प्रणाली पेश करता है ताकि कलाकार को निकालने या उसे फिर से प्रशिक्षित करने के बिना इन गलतियों को ठीक किया जा सके। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग यहाँ दिया गया है:

समस्या: "इको चैंबर" (Echo Chamber) प्रभाव

पिछले तरीकों ने इस त्रुटि को सुधारने के लिए कलाकार से "अपने काम की समीक्षा करने" के लिए कहकर कोशिश की थी। वे कलाकार को फोटो और गलत अनुच्छेद दोनों दिखाते थे, फिर पूछते थे, "क्या यह सही लग रहा है?"

शोध पत्र का तर्क है कि यह एक बुरा विचार है। क्योंकि कलाकार अपने गलत अनुच्छेद को देखते हुए फोटो को देख रहा होता है, इसलिए गलत विचार (जैसे कि "नाव") उसके मस्तिष्क को धोखा दे सकते हैं। वह सोच सकता है, "ओह, मुझे पानी में एक नाव दिख रही है!" भले ही वह केवल एक प्रतिबिंब हो, क्योंकि उसके अपने टेक्स्ट ने पहले ही उसका सुझाव दे दिया था। यह अपनी लिखी हुई कहानी को पढ़ते समय तथ्य-जांच करने जैसा है; आप अनजाने में खुद को विश्वास दिला सकते हैं कि झूठ सच है।

TIGER का समाधान: "दो-टीम" रणनीति

TIGER प्रक्रिया को इस तरह बदल देता है कि कलाकार तथ्यों की जांच करते समय अपने स्वयं के गलतियों को कभी नहीं देखता। यह एक सख्त संपादक की तरह कार्य करता है जिसके पास दो-चरणीय प्रक्रिया है:

चरण 1: स्वतंत्र तथ्य-जांचकर्ता (Independent Fact-Checkers)
पूरी कहानी की समीक्षा करने के लिए कलाकार को भेजने के बजाय, TIGER फोटो को एक टीम को और कहानी को पूरी तरह से अलग टीम को भेजता है।

  • टीम A (इनपुट टीम): केवल फोटो को देखती है और ठोस तथ्यों की एक सूची बनाती है: "दो बत्तखें," "पानी," "कोई नाव नहीं।" वे एक "फैक्ट मैप" (Fact Map) बनाते हैं।
  • टीम B (आउटपुट टीम): केवल कहानी को देखती है और दावों की एक सूची बनाती है: "तीन बत्तखें," "नाव," "पानी।" वे एक "क्लेम मैप" (Claim Map) बनाते हैं।

चूंकि टीम A ने कहानी नहीं देखी है, इसलिए वे प्रभावित नहीं होते हैं। वे पूरी तरह से निष्पक्ष हैं।

चरण 2: जोखिम स्कोर (Risk Score)
अब, TIGER उन दोनों मानचित्रों को एक साथ लाता है। यह कहानी के हर दावे की तुलना फोटो के तथ्यों से करता है।

  • "दो बत्तखें" बनाम "तीन बत्तखें"? उच्च जोखिम (High Risk)।
  • "पानी" बनाम "पानी"? कम जोखिम (Low Risk)।
  • "नाव" बनाम "कोई नाव नहीं"? उच्च जोखिम (High Risk)।

TIGER कहानी के हर वाक्य को एक "जोखिम स्कोर" देता है। यह केवल यह नहीं कहता कि "यह गलत है"; यह कहता है, "इस विशिष्ट वाक्य के झूठ होने की संभावना 90% है।"

चरण 3: लक्षित सर्जरी (Targeted Surgery)
पूरी कहानी को फिर से लिखने के बजाय (जिससे अच्छे हिस्से खराब हो सकते हैं), TIGER केवल उच्च-जोखिम वाले वाक्यों को कलाकार के पास वापस भेजता है। यह कहता है, "आपने कहा कि वहाँ तीन बत्तखें और एक नाव थी। फिर से फोटो देखें। केवल इन दो चीजों को ठीक करें।"

कलाकार उन विशिष्ट स्थानों को ठीक करता है, और बाकी सुंदर कहानी अपरिवर्तित रहती है।

यह बेहतर क्यों है

  • कोई पूर्वाग्रह नहीं (No Bias): फोटो की जांच को कहानी की जांच से अलग करके, सिस्टम उस "इको चैंबर" को रोकता है जहाँ गलतियाँ खुद को पुख्ता करती हैं।
  • सटीकता (Precision): यह अनुमान नहीं लगाता कि किन हिस्सों को ठीक करना है; यह गणित का उपयोग करके ठीक से रैंक करता है कि कौन से तथ्य खतरनाक हैं।
  • दक्षता (Efficiency): यह केवल टूटे हुए हिस्सों को ठीक करने में ऊर्जा खर्च करता है, पूरी कहानी को नहीं।

क्या यह काम करता है?

लेखकों ने कई अलग-अलग कार्यों पर TIGER का परीक्षण किया:

  • इमेज टू टेक्स्ट (Images to Text): फोटो का वर्णन करना।
  • ऑडियो टू टेक्स्ट (Audio to Text): ध्वनि क्लिप का सारांश देना।
  • वीडियो टू टेक्स्ट (Video to Text): मूवी दृश्यों का वर्णन करना।
  • संकट रिपोर्टिंग (Crisis Reporting): एक वास्तविक दुनिया का परीक्षण जहाँ उन्हें तूफान (hurricane) के बारे में ट्विटर, फेसबुक और फोटो से समाचारों का सारांश तैयार करना था।

इन सभी परीक्षणों में, TIGER ने (जैसे अतिरिक्त बत्तखों या गैर-मौजूद नाव जैसे) फर्जी तथ्यों को सफलतापूर्वक हटा दिया, जबकि कहानी के प्रवाह और सटीकता को बनाए रखा। यह तब भी अच्छी तरह से काम किया जब इनपुट डेटा अव्यवस्थित और शोर भरा था, जैसा कि तूफान वाले मामले में देखा गया।

संक्षेप में: TIGER एक स्मार्ट संपादक की तरह है जो "साक्ष्य" को "ड्राफ्ट" से अलग करता है, गलतियों को स्कोर देता है, और केवल लेखक को विशिष्ट झूठ को ठीक करने के लिए कहता है, जिससे यह सुनिश्चित होता है कि अंतिम कहानी सुंदर और सत्य दोनों हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →