← नवीनतम पेपर
🤖 AI

Real-Time Visual Attribution Streaming in Thinking Model

यह शोध पत्र एक एमोर्टाइज्ड (amortized) ढांचे को प्रस्तुत करता है जो अटेंशन फीचर्स से कॉज़ल प्रभावों (causal effects) का अनुमान लगाना सीखकर मल्टीमॉडल थिंकिंग मॉडल्स में रीयल-टाइम, फेथफुल विजुअल एट्रिब्यूशन को सक्षम बनाता है, जिससे पारंपरिक कॉज़ल विधियों की कम्प्यूटेशनल लागत को दूर करते हुए रीजनिंग के दौरान तत्काल ग्राउंडिंग साक्ष्य प्रदान किया जा सके।

मूल लेखक: Seil Kang, Woojung Han, Junhyeok Kim, Jinyeong Kim, Youngeun Kim, Seong Jae Hwang

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seil Kang, Woojung Han, Junhyeok Kim, Jinyeong Kim, Youngeun Kim, Seong Jae Hwang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लेकिन बहुत अधिक बातें करने वाला रोबोट सहायक है। आप उसे एक जटिल गणितीय समस्या या एक अव्यवस्थित स्प्रेडशीट की तस्वीर दिखाते हैं, और वह उसे हल करने के लिए कदम-दर-कदम "सोचना" शुरू कर देता है। वह कहता है, "ठीक है, मुझे यहाँ संख्या 5 दिख रही है, तो मैं इसे 10 में जोड़ दूँगा..."

समस्या:
कभी-कभी, यह रोबोट झूठ बोल रहा होता है (या भ्रमित हो रहा होता है)। वह कह सकता है, "मैं तस्वीर में लाल कार देख रहा हूँ," जबकि वहाँ कोई लाल कार है ही नहीं। वह केवल इसलिए ऐसा कह रहा है क्योंकि वह अनुमान लगाने में बहुत माहिर है कि इंसान आमतौर पर क्या कहते हैं।

पारंपरिक रूप से, यह जाँचने के लिए कि क्या रोबोट वास्तव में तस्वीर को देख रहा है या केवल अनुमान लगा रहा है, हमें एक "ब्रूट फ़ोर्स" (brute force) विधि का उपयोग करना पड़ता था। यह ऐसा है जैसे रोबोट को फिर से समस्या हल करने के लिए कहना, लेकिन इस बार, हम छवि के एक हिस्से को काले बॉक्स से ढक देते हैं और पूछते हैं, "क्या आपका उत्तर बदल गया?" फिर हम छवि के एक अलग हिस्से को ढक देते हैं और फिर से पूछते हैं, "क्या आपका उत्तर बदल गया?" हमें छवि के हर एक हिस्से के लिए ऐसा करना पड़ता है।

  • चुनौती: इसमें बहुत समय लगता है। यदि रोबले की "सोचने" की प्रक्रिया लंबी है, तो यह जाँचने की प्रक्रिया इतनी धीमी हो जाती है कि आपको यह देखने के लिए घंटों इंतजार करना होगा कि रोबोट सच बोल रहा था या नहीं। यह एक 100 पन्नों की किताब में गलतियाँ ढूँढने के लिए पूरी किताब को 500 बार फिर से टाइप करने जैसा है।

समाधान (VSTREAM):
लेखकों ने एक नया सिस्टम बनाया है जिसे VSTREAM (विजुअल एट्रिब्यूशन स्ट्रीमिंग) कहा जाता है। इसे एक वास्तविक "लाइ डिटेक्टर" (झूठ पकड़ने वाले) कैमरे के रूप में समझें जो तुरंत काम करता है।

यहाँ उन्होंने इसे एक सरल उपमा का उपयोग करके समझाया है:

1. "स्मार्ट गेसिंग" कोच (अमोर्टाइजेशन - Amortization)

हर बार गलतियाँ ढूँढने के लिए पूरी किताब को फिर से टाइप करने के बजाय, लेखकों ने एक छोटा, अत्यंत तेज़ "कोच" (एक छोटा AI मॉडल) प्रशिक्षित किया।

  • प्रशिक्षण: उन्होंने कोच को हजारों उदाहरण दिखाए जहाँ उन्होंने वास्तव में छवि के कुछ हिस्सों को ढका था और देखा कि रोबोट के उत्तर में कैसे बदलाव आया। कोच ने पैटर्न सीख लिए: "आह, जब रोबोट की आँखें (अटेंशन) ऊपर-बाएँ कोने पर अधिक ध्यान केंद्रित करती हैं, तो इसका मतलब है कि वह कोना उत्तर के लिए महत्वपूर्ण है।"
  • चाल: कोच यह अनुमान लगाने में सक्षम हो गया कि "कवर-अप टेस्ट" (छवि को ढकने का परीक्षण) का परिणाम क्या होगा, केवल यह देखकर कि रोबोट वर्तमान में कहाँ देख रहा है। उसे वास्तव में कुछ भी ढकने की आवश्यकता नहीं है; वह बस जानता है कि क्या होगा।

2. "लाइव कमेंट्री" (स्ट्रीमिंग - Streaming)

आमतौर पर, आपको पूरे कार्य के पूरा होने के बाद ही रोबोट के "विचारों" को देखने को मिलता है। VSTREAM इसे बदल देता है।

  • जैसे-जैसे रोबोट कदम-दर-कदम अपना तर्क लिखता है, कोच बैकग्राउंड में चल रहा होता है और आपसे फुसफुसाकर कहता है: "हे, अभी, रोबोट ग्राफ के X-एक्सिस को देख रहा है। अच्छा है! वह वास्तव में डेटा का उपयोग कर रहा है।"
  • यदि रोबोट "नीले आसमान" के बारे में बात करने लगता है जब तस्वीर ब्लैक एंड व्हाइट है, तो कोच तुरंत चेतावनी देता है: "रुको! रोबोट आसमान को नहीं देख रहा है; वह भ्रमित (hallucinating) हो रहा है!"

3. "सिमेंटिक मैप" (ग्रुपिंग - Grouping)

रोबोट छवियों को लाखों छोटे बिंदुओं (पिक्सेल) के रूप में देखते हैं। यह बहुत अव्यवस्थित है।

  • लेखकों ने उन बिंदुओं को पहले सार्थक वस्तुओं में समूहबद्ध करने के लिए एक टूल (DINOv3) का उपयोग किया। "पिक्सेल 402 महत्वपूर्ण है" कहने के बजाय, यह कहता है "लाल कार महत्वपूर्ण है।"
  • यह स्पष्टीकरण को मानव-पठनीय बनाता है। आप बिंदुओं का धुंधला सा मिश्रण नहीं देखते; आप उस विशिष्ट वस्तु पर हाइलाइट देखते हैं जिसका उपयोग रोबोट समस्या को हल करने के लिए कर रहा है।

यह क्यों महत्वपूर्ण है

  • गति: पुरानी विधि एक पुल पार करने के लिए टैंक चलाने जैसी थी (धीमी और भारी)। यह नई विधि एक साइकिल की तरह है (तेज़ और हल्की)। यह पुराने तरीकों की तुलना में 117 गुना तेज़ है।
  • विश्वास: अब, जब एक डॉक्टर एक्स-रे पढ़ने के लिए AI का उपयोग करता है, या एक छात्र ज्यामिति को हल करने के लिए इसका उपयोग करता है, तो हम AI को वास्तविक समय में "सोचते" हुए देख सकते हैं। यदि AI छवि के गलत हिस्से को घूरने लगता है, तो हम उसे तुरंत पकड़ लेते हैं।
  • "अहा!" क्षण: यह AI को एक "ब्लैक बॉक्स" (जहाँ हमें केवल एक उत्तर मिलता है) से बदलकर एक पारदर्शी प्रक्रिया में बदल देता है जहाँ हम देख सकते हैं कि वह उस निष्कर्ष तक कैसे पहुँचा।

संक्षेप में:
यह पेपर एक तरीका पेश करता है जिससे आप वास्तविक समय में एक सोचते हुए AI को देख सकते हैं ताकि यह पता चल सके कि वह समस्या को हल करने के लिए छवि के किन हिस्सों का उपयोग कर रहा है। यह एक धीमी, दर्दनाक जाँच प्रक्रिया को एक तेज़, स्मार्ट भविष्यवाणी प्रणाली से बदल देता है, जिससे यह सुनिश्चित होता है कि जब AI कहता है, "मुझे उत्तर यहाँ दिख रहा है," तो वह वास्तव में उत्तर को ही देख रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →