← नवीनतम पेपर
💻 computer science

Scalpel: Fine-Grained Alignment of Attention Activation Manifolds via Mixture Gaussian Bridges to Mitigate Multimodal Hallucination

स्कैल्पल (Scalpel) एक मॉडल-अज्ञेय (model-agnostic) इन्फरेंस विधि है जो गाऊसी मिश्रण मॉडलों (Gaussian mixture models) और एंट्रोपिक ऑप्टिमल ट्रांसपोर्ट (entropic optimal transport) का उपयोग करके मिसअलाइन्ड अटेंशन एक्टिवेशन मैनिफोल्ड्स को अधिक विश्वसनीय दृश्य क्षेत्रों की ओर सटीक रूप से संरेखित करके बड़े विजन-लैंग्वेज मॉडल्स में मल्टीमॉडल मतिभ्रम (multimodal hallucinations) को कम करती है।

मूल लेखक: Ziqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ziqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पेशेवर शेफ को भोजन तैयार करते हुए देख रहे हैं। अधिकांश समय, वे रेसिपी का पूरी तरह से पालन करते हैं। लेकिन कभी-कभी, शेफ खिड़की के बाहर के एक सुंदर दृश्य से विचलित हो जाता है और ऐसी चीजें डालना शुरू कर देता है जो रेसिपी में नहीं हैं—जैसे कि स्टेक पर चॉकलेट सॉस डालना। शेफ "टूटा हुआ" नहीं है, बस उसका ध्यान भटक गया और उसकी कल्पना बेकाबू हो गई।

AI की दुनिया में, इसे "Hallucination" (भ्रम) कहा जाता है। लार्ज विजन-लैंग्वेज मॉडल्स (LVLMs) इन शेफ की तरह ही हैं: वे एक तस्वीर (रेसिपी) देखते हैं और उसका वर्णन करते हैं (भोजन), लेकिन कभी-कभी वे उन वस्तुओं का "भ्रम" पैदा कर देते हैं जो वास्तव में वहां नहीं हैं क्योंकि वे इस पर बहुत अधिक निर्भर करते हैं कि उन्हें क्या होना चाहिए, बजाय इसके कि वे वास्तव में क्या देख रहे हैं।

यह पेपर इस समस्या को ठीक करने के लिए Scalpel नामक एक नया टूल पेश करता है। यह कैसे काम करता है, इसे कुछ सरल उपमाओं के माध्यम से समझाया गया है।

1. समस्या: "विचलित शेफ" (Misaligned Attention)

जब एक AI किसी तस्वीर को देखता है, तो वह "अटेंशन" (Attention) नामक चीज़ का उपयोग करता है। "अटेंशन" को एक स्पॉटलाइट की तरह समझें। पार्क में एक कुत्ते का वर्णन करने के लिए, AI को अपना स्पॉटलाइट कुत्ते और घास पर केंद्रित करना चाहिए।

हालाँकि, क्योंकि इन मॉडल्स ने लाखों किताबें पढ़ी हैं, उनके पास "स्ट्रॉन्ग प्रायर्स" (strong priors)—यानी पूर्वधारणाएं हैं। यदि वे एक पार्क देखते हैं, तो उनका "दिमाग" स्वचालित रूप से "पिकनिक बास्केट" या "फ्रिसबी" के बारे में सोचने लगता है, भले ही वे वहां न हों। उनका स्पॉटलाइट (अटेंशन) वास्तविक छवि से हटकर इन काल्पनिक विचारों की ओर भटक जाता है।

2. समाधान: "फोकस के लिए GPS" (GMMs और Schrödinger Bridges)

शोधकर्ताओं ने महसूस किया कि जब AI भ्रम (hallucinating) पैदा कर रहा होता है, तो उसका "आंतरिक स्पॉटलाइट" बहुत विशिष्ट, अनुमानित पैटर्न में चलता है। उन्होंने इन पैटर्न्स को मैप करने का निर्णय लिया।

  • मैप (GMMs): कल्पना करें कि AI के विचार आकाश में बादलों की तरह हैं। शोधकर्ताओं ने दो प्रकार के बादलों को मैप किया: "ट्रुथ क्लाउड्स" (Truth Clouds - जहाँ स्पॉटलाइट तब होता है जब AI सही होता है) और "हैलुसिनेशन क्लाउड्स" (Hallucination Clouds - जहाँ स्पॉटलाइट तब भटक जाता है जब AI गलत होता है)। उन्होंने इन बादलों का बहुत सटीक नक्शा बनाने के लिए गौसियन मिक्सचर मॉडल (Gaussian Mixture Model - GMM) नामक एक गणितीय उपकरण का उपयोग किया।
  • ब्रिज (Schrödinger Bridge): अब, उनके पास एक समस्या है: AI का स्पॉटलाइट वर्तमान में एक "हैलुसिनेशन क्लाउड" में फंसा हुआ है। उन्हें इसे वापस "ट्रुथ क्लाउड" में ले जाने की आवश्यकता है। लेकिन वे इसे सीधे टेलीपोर्ट नहीं कर सकते; वे चाहते हैं कि यह सबसे कुशल, प्राकृतिक तरीके से चले ताकि वे AI की बुद्धिमत्ता को "तोड़" न दें। वे श्रोडिंगर ब्रिज (Schrödinger Bridge) का उपयोग करते हैं—इसे विचारों के लिए एक GPS के रूप में समझें। यह स्पॉटलाइट को "गलत" क्लाउड से वापस "सही" क्लाउड की ओर मोड़ने के लिए सबसे छोटा, सुगम रास्ता निकालता है।

3. टूल: "स्कैल्पल" (Fine-Grained Intervention)

इसका नाम Scalpel (सर्जिकल चाकू) इसलिए रखा गया है क्योंकि यह पूरे मस्तिष्क पर "सर्जरी" नहीं करता (जो धीमा और महंगा होगा)। इसके बजाय, यह अविश्वसनीय रूप से सटीक है।

पूरे AI को फिर से प्रशिक्षित (retrain) करने के बजाय (जो कि शेफ को चार साल के लिए वापस कुकरी स्कूल भेजने जैसा है), Scalpel "खाना पकाने" की प्रक्रिया (inference) के दौरान काम करता है। यह वास्तविक समय में AI के स्पॉटलाइट पर नज़र रखता है। जैसे ही यह देखता है कि स्पॉटलाइट "हैलुसिनेशन क्लाउड" में भटक रहा है, यह स्पॉटलाइट को सच्चाई की ओर वापस धकेलने के लिए उस "GPS" का उपयोग करके एक छोटा, सटीक धक्का देता है।

यह एक बड़ी बात क्यों है?

  1. यह तेज़ और सस्ता है: इसके लिए मॉडल को फिर से प्रशिक्षित करने के लिए विशाल सुपरकंप्यूटर की आवश्यकता नहीं है। यह एक "प्लग-एंड-प्ले" समाधान है।
  2. यह स्मार्ट है: यह केवल AI को "झूठ मत बोलो" नहीं कहता। यह समझता है कि AI कैसे भटक रहा है और उसे वापस मार्गदर्शन देता है।
  3. यह काम करता है: परीक्षणों में, इसने छवियों में वस्तुओं, रंगों और स्थानों को सही ढंग से पहचानने की AI की क्षमता में काफी सुधार किया, और पिछले तरीकों से बेहतर प्रदर्शन किया।

संक्षेप में: Scalकल (Scalpel) एक अत्यधिक कुशल सू-शेफ (sous-chef) की तरह कार्य करता है जो मुख्य शेफ के बगल में खड़ा रहता है, और जब भी शेफ अपने ख्यालों में खोने लगता है, तो चुपचाप उनके हाथ को सही सामग्री की ओर वापस धकेलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →