← नवीनतम पेपर
💻 computer science

TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding

यह शोधपत्र TraceVision को प्रस्तुत करता है, जो एक नवीन एंड-टू-एंड विजन-लैंग्वेज मॉडल है जो एक 'ट्रैजेक्टरी-अवेयर विजुअल परसेप्शन' मॉड्यूल और एक विशिष्ट प्रशिक्षण पाइपलाइन के माध्यम से प्रक्षेपवक्र-जागरूक स्थानिक समझ (trajectory-aware spatial understanding) को एकीकृत करता है, और मानव दृश्य ध्यान प्रक्षेपवक्रों (human visual attention trajectories) का अनुकरण करके कैप्शनिंग, स्थानीयकरण और विभाजन जैसे कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Fan Yang, Shurong Zheng, Hongyin Zhao, Yufei Zhan, Xin Li, Yousong Zhu, Chaoyang Zhao Ming Tang, Jinqiao Wang

प्रकाशित 2026-02-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fan Yang, Shurong Zheng, Hongyin Zhao, Yufei Zhan, Xin Li, Yousong Zhu, Chaoyang Zhao Ming Tang, Jinqiao Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पेंटिंग देख रहे हैं। एक मानक AI (जैसे कि एक सामान्य लार्ज विज़न-लैंग्वेज मॉडल) पूरी तस्वीर को एक साथ देखता है और कहता है, "मुझे एक कुत्ता दिख रहा है।" यह एक हेलीकॉप्टर से जंगल को देखने जैसा है जहाँ वह बस कह देता है, "पेड़।" उसे सामान्य विचार तो मिल जाता है, लेकिन वह इस बात को मिस कर देता है कि आप वास्तव में कहाँ देख रहे हैं और उस कुत्ते को खोजने के लिए आपकी आँखें कैसे घूमीं।

TraceVision उस AI को चश्मा देने जैसा है जो न केवल चित्र को देख सकता है, बल्कि स्क्रीन पर आपके उंगली से बनाए गए पथ (path) को भी समझ सकता है। यह समझता है कि जब आप एक विशिष्ट स्थान पर इशारा करते हैं, फिर दूसरे स्थान पर जाते हैं, और फिर तीसरे स्थान पर घेरा बनाते हैं, तो आप जो देख रहे हैं उसके बारे में एक कहानी बता रहे हैं।

यहाँ बताया गया है कि TraceVision कैसे काम करता है, कुछ रोज़मर्रा के उदाहरणों का उपयोग करते हुए:

1. समस्या: "हेलीकॉप्टर व्यू" बनाम "उंगली का निशान"

वर्तमान AI मॉडल पूरे दृश्य का वर्णन करने में बहुत अच्छे हैं, लेकिन उन्हें स्थानिक ध्यान (spatial attention) लगाने में कठिनाई होती है।

  • पुराना तरीका: यदि आप AI से पूछते हैं, "मेज पर क्या है?" तो वह पूरी छवि के आधार पर अनुमान लगा सकता है। यदि वहाँ तीन मेजें हैं, तो उसे नहीं पता होगा कि आप कौन सी मेज की बात कर रहे हैं, या वह बैकग्राउंड में रखी एक कुर्सी से विचलित हो सकता है।
  • मानवीय तरीका: जब इंसान एक जटिल दृश्य देखते हैं, तो उनकी आँखें बेतरतीब ढंग से नहीं कूदतीं। वे एक पथ (path) का अनुसरण करती हैं। हम एक लाल टोपी को देख सकते हैं, फिर अपनी आँखों को नीले जूतों तक नीचे ले जा सकते हैं, और फिर कुत्ते की ओर घूम सकते हैं। इस पथ को ट्रैजेक्टरी (trajectory) कहा जाता है।

TraceVision पहला ऐसा AI है जो इन 'आई-मूवमेंट' पथों को केवल एक विचार के रूप में नहीं, बल्कि बातचीत के एक महत्वपूर्ण हिस्से के रूप में मानता है।

2. जादुई घटक: "जियोमेट्रिक सिम्प्लीफिकेशन" (संपादन की कला)

कच्चा आई-ट्रैकिंग डेटा अव्यवस्थित होता है। यह हाथ लहराने वाले एक हिलते हुए वीडियो रिकॉर्डिंग जैसा है; इसमें हजारों छोटे, झटकेदार बिंदु होते हैं जिनका कोई खास अर्थ नहीं होता।

  • उदाहरण: कल्पना कीजिए कि आपके पास 410 पन्नों की एक हस्तलिखित डायरी है, लेकिन अधिकांश पन्ने केवल आड़ी-तिरछီ लकीरों (scribbles) से भरे हैं। आप कहानी को रखना चाहते हैं लेकिन शोर (noise) को हटाना चाहते हैं।
  • समाधान: TraceVision एक स्मार्ट "संपादक" (जिसे जियोमेट्रिक सिम्प्लीफिकेशन कहा जाता है) का उपयोग करता है। यह आपके द्वारा बनाए गए पथ को देखता है और पूछता है, "क्या इस पथ का यह हिस्सा महत्वपूर्ण है?"
    • यदि आपने एक कुत्ते के चारों ओर धीरे-धीरे एक घेरा बनाया, तो AI उन बिंदुओं को रखता है क्योंकि कुत्ता महत्वपूर्ण है।
    • यदि आपने खाली आसमान में अपनी उंगली तेजी से घुमाई, तो AI उन बिंदुओं को हटा देता है क्योंकि वे केवल "शोर" हैं।
    • परिणाम: यह एक अस्त-व्यस्त 410-बिंदुओं वाली लकीर को एक साफ 37-बिंदुओं वाले पथ में बदल देता है जो आपकी दृष्टि के इरादे को पूरी तरह से पकड़ लेता है।

3. मस्तिष्क: "ट्रैजेक्टरी-अवेयर विज़ुअल परसेप्शन" (TVP) मॉड्यूल

यह इसके इंजन के नीचे का हिस्सा है। सोचिए कि AI के मस्तिष्क में दो दोस्त आपस में बात कर रहे हैं:

  1. विज़ुअल दोस्त: "मैं एक कमरे की तस्वीर देख रहा हूँ जिसमें एक कुर्सी और एक लैंप है।"
  2. ट्रैजेक्टरी दोस्त: "लेकिन यूजर की उंगली ने अभी कुर्सी के चारों ओर एक घेरा बनाया है!"

पुराने मॉडलों में, ये दोनों दोस्त शायद ही कभी बात करते थे। TraceVision में, उनके बीच एक दो-तरफा बातचीत (Bidirectional Fusion) होती है।

  • ट्रैजेक्टरी दोस्त विज़ुअल दोस्त को बताता है: "कुर्सी पर ध्यान केंद्रित करो, लैंप को अनदेखा करो।"
  • विज़ुअल दोस्त ट्रैजेक्टरी दोस्त को बताता है: "आह, तुमने जो घेरा बनाया है? वह निश्चित रूप से एक कुर्सी है, मेज नहीं।"

वे एक-दूसरे की समझ को तब तक परिष्कृत करते रहते हैं जब तक कि वे इस बात पर सहमत न हो जाएं कि उपयोगकर्ता वास्तव में क्या देख रहा है।

4. प्रशिक्षण: "320,000 छात्रों वाली कक्षा"

AI को यह कौशल सिखाने के लिए, शोधकर्ताओं को केवल पुराने पाठ्यपुस्तकों का उपयोग नहीं करना था। उन्होंने RILN (रीजनिंग-बेस्ड इंटरैक्टिव लोकलाइज्ड नैरेटिव्स) नामक एक नई, विशाल कक्षा बनाई।

  • उदाहरण: कल्पना कीजिए कि आप एक छात्र को टूर गाइड बनने के लिए सिखा रहे हैं।
    • पुराना डेटा: उन्हें सिर्फ एक फोटो और तथ्यों की एक सूची दिखाना।
    • RILN डेटा: उन्हें एक फोटो, एक वीडियो जिसमें एक टूर गाइड की उंगली चीजों की ओर इशारा कर रही है, और एक ट्रांसक्रिप्ट दिखाना जिसमें गाइड समझा रहा है कि उसने वहां इशारा क्यों किया।
  • उन्होंने इस "इशारा करने और समझाने" वाले उदाहरणों को उत्पन्न करने के लिए सुपर-स्मार्ट AI (जैसे GPT-4o) का उपयोग किया। इसने TraceVision को न केवल देखना, बल्कि यह तर्क (reason) करना भी सिखाया कि कोई किसी चीज़ को क्यों देख रहा है।

5. यह अब क्या कर सकता है?

क्योंकि यह "फिंगर ट्रेस" को समझता है, TraceVision वे चीजें कर सकता है जो अन्य AI नहीं कर सकते:

  • "फॉलो द फिंगर" गेम: आप एक चित्र पर एक पथ बनाते हैं, और यह आपको बताता है कि आप किन वस्तुओं को देख रहे थे।
  • "ड्रॉ टू डिस्क्राइब" गेम: आप कहते हैं, "लाल कार का वर्णन करें," और AI उस पथ को बनाता है जिसे आपकी आँखें उस कार को खोजने के लिए लेंगी।
  • "वीडियो डिटेक्टिव": यह एक वीडियो देख सकता है और फ्रेम-दर-फ्रेम ध्यान (attention) कैसे बदलता है, इसे ट्रैक कर सकता है, जिससे यह समझ आता है कि समय के साथ एक कहानी कैसे विकसित होती है।
  • "प्रिसिजन सर्जन": यह आपके द्वारा बनाए गए पथ के माध्यम से मार्गदर्शन प्राप्त करके, एक फोटो से विशिष्ट वस्तुओं को अत्यधिक सटीकता के साथ काट (segment) सकता है।

सारांश

TraceVision एक AI को एक पर्यटक से अपग्रेड करने जैसा है जो पूरे शहर की धुंधली फोटो लेता है, एक स्थानीय गाइड में जो आपके साथ चलता है, विशिष्ट इमारतों की ओर इशारा करता है, और ठीक वहीं से कहानी सुनाता है जहाँ आप देख रहे हैं। यह "कंप्यूटर क्या देखता है" और "इंसान क्या सोच रहा है" के बीच के अंतर को पाटता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →