← नवीनतम पेपर
💻 computer science

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

PercepCap एक नवीन वीडियो कैप्शनिंग फ्रेमवर्क है जो अंतिम कैप्शन उत्पन्न करने से पहले ऑब्जेक्ट ट्रैजेक्टरीज और घटनाओं का एक धारणात्मक ट्रेस (perception trace) स्पष्ट रूप से बनाकर स्थानिक-कालिक समझ (spatio-temporal understanding) को बढ़ाता है, जिसे धारणात्मक साक्ष्य और वर्णनात्मक आउटपुट के बीच संरेखण सुनिश्चित करने के लिए एक दो-चरणीय प्रशिक्षण रणनीति और एक कैप्शन-एंकरित डेटा निर्माण पाइपलाइन द्वारा समर्थित किया गया है।

मूल लेखक: Yifan Xu, Zihao Wang, Zhixiao Wang, Jiaming Zhang, Yichun Yang, Desen Meng, Yuanxing Zhang, Pengfei Wan, Limin Wang

प्रकाशित 2026-07-23
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifan Xu, Zihao Wang, Zhixiao Wang, Jiaming Zhang, Yichun Yang, Desen Meng, Yuanxing Zhang, Pengfei Wan, Limin Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को फिल्म देखना और उसकी समीक्षा लिखना सिखाने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस कार्य को "वीडियो कैपशनिंग" कहा जाता है। लंबे समय से, सबसे स्मार्ट रोबोट (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स या MLLMs के रूप में जाना जाता है) इसमें बेहतर होते आ रहे हैं, लेकिन उनकी एक गुप्त कमजोरी है: वे जादूगरों की तरह हैं जो आपको दिखाए बिना टोपी से खरगोश निकाल लेते हैं। वे वीडियो देखते हैं और तुरंत एक वाक्य बोल देते हैं जैसे, "एक कुत्ता खेत में दौड़ रहा है।" लेकिन वे अपना काम नहीं दिखाते। वे आपको यह नहीं बताते कि कौन सा कुत्ता, वह ठीक कहाँ दौड़ रहा था, या उसने कब शुरू किया और कब समाप्त किया। यदि रोबोट कोई गलती करता है—मान लीजिए, वह सोचता है कि कुत्ता पीछे की ओर दौड़ रहा था—तो वह त्रुटि अंतिम वाक्य के भीतर छिपी होती है, जिससे उसे सुधारना कठिन हो जाता है। वैज्ञानिकों के लिए यह महत्वपूर्ण है क्योंकि यदि हम चाहते हैं कि रोबट वास्तव में दुनिया को समझें, तो हमें यह जानने की आवश्यकता है कि वे इसे कैसे देखते हैं, न कि केवल यह कि वे क्या कहते हैं।

यहाँ PercepCap आता है, जो एक नए फ्रेमवर्क के रूप में वीडियो रोबोट्स के लिए एक जासूस की तरह काम करता है। रोबोट को सीधे अंतिम समीक्षा लिखने देने के बजाय, PercepCap रोबोट को पहले अपने "जासूसी नोट्स" लिखने के लिए मजबूर करता है। अंतिम कैप्शन लिखने से पहले, उसे मिले हुए सुरागों को स्पष्ट रूप से सूचीबद्ध करना होगा: "मैं एक कुत्ता (ID: 123) देख रहा हूँ जो स्क्रीन के बाईं ओर से दाईं ओर 2 सेकंड और 5 सेकंड के बीच चल रहा है।" यह "देखना-फिर-वर्णन-करना" (perceive-then-describe) वाली श्रृंखला रोबोट की सोच को दृश्यमान बनाती है। शोधकर्ताओं ने पाया कि रोबोट को अंतिम कहानी लिखने से पहले अपनी स्थानिक-कालिक (spatio-temporal) साक्ष्य (चीजें कहाँ हैं और कब होती हैं) दिखाने के लिए मजबूर करने से, अंतिम विवरण बहुत अधिक सटीक और विस्तृत हो जाता है। उन्होंने केवल यह अनुमान नहीं लगाया कि यह काम करेगा; उन्होंने एक विशेष दो-चरणीय प्रक्रिया का उपयोग करके एक मॉडल को प्रशिक्षित किया और कई चुनौतीपूर्ण बेंचमार्क पर इसका परीक्षण किया, जिससे यह साबित हुआ कि यह "अपना काम दिखाओ" वाला दृष्टिकोण पुराने "बस उत्तर का अनुमान लगाओ" वाले तरीकों से लगातार बेहतर है।

जासूस की नोटबुक: PercepCap कैसे काम करता है

पुराने तरीके की वीडियो कैपशनिंग को एक ऐसे छात्र की तरह समझें जो केवल बबल शीट पर अंतिम उत्तर लिखने की अनुमति रखता है। यदि छात्र गलत होता है, तो शिक्षक को पता नहीं चलता कि उसने प्रश्न को गलत पढ़ा, कोई तथ्य भूल गया, या बस अनुमान लगाया। नया तरीका, PercepCap, उस छात्र को एक रफ-नोटबुक (scratchpad) देने जैसा है।

"परसीव" चरण (रफ-नोटबुक/Scratchpad)
सबसे पहले, रोबोट वीडियो देखता है और एक संरचित "जासूसी नोटबुक" भरता है। यह केवल एक यादृच्छिक सूची नहीं है; यह दो चीजों का एक सख्त, व्यवस्थित लॉग है:

  1. ऑब्जेक्ट ट्रेजेक्टरीज (वस्तुओं के पथ): यह विशिष्ट वस्तुओं (जैसे व्यक्ति या कार) को ट्रैक करता है और लिखता है कि वे अलग-अलग समय पर स्क्रीन पर ठीक कहाँ हैं।
  2. टेम्पोरल इवेंट्स (सामयिक घटनाएँ): यह नोट करता है कि विशिष्ट क्रियाएं कब होती हैं, सटीक प्रारंभ और समाप्ति समय को चिह्नित करता है।

"डिस्क्राइब" चरण (अंतिम रिपोर्ट)
नोटबुक भरने के बाद ही रोबोट अंतिम कैप्शन लिखता है। वह रफ-नोटबुक के नोट्स का उपयोग एक मार्गदर्शक के रूप में करता है। क्योंकि रोबोट ने घटनाओं की पहचान करने और समय निर्धारित करने का कठिन काम पहले ही कर लिया है, इसलिए अंतिम कहानी में भ्रम (hallucinations) या छूटे हुए विवरणों की संभावना बहुत कम होती है।

गुप्त नुस्खा: उन्होंने रोबोट को कैसे सिखाया

आप सोच सकते हैं, "रोबोट ने यह नोटबुक भरना कहाँ से सीखा यदि पहले किसी ने उसे नोटबुक नहीं दी थी?" शोधकर्ताओं को प्रशिक्षण डेटा बनाने के लिए एक चतुर तरीका आविष्कार करना पड़ा, जिसे वे कैप्शन-एंकरड परसेप्शन डेटा कंस्ट्रक्शन कहते हैं।

कल्पना कीजिए कि आपके पास एक मानव विशेषज्ञ द्वारा लिखी गई एक आदर्श फिल्म समीक्षा है, लेकिन इसमें कोई टाइमस्टैम्प या स्थान टैग नहीं है। शोधकर्ताओं ने इस समीक्षा को लिया और एक सुपर-स्मार्ट AI से फिर से फिल्म देखने के लिए कहा, इस बार विशेष रूप से उन चीजों को खोजने के लिए जिनका समीक्षा में उल्लेख किया गया है।

  1. एंकर (Anchor): उन्होंने अंतिम कैप्शन (एंकर) से शुरुआत की।
  2. एक्सट्रैक्ट (Extract): उन्होंने समीक्षा में उल्लेखित वस्तुओं और घटनाओं के नाम निकाले।
  3. ग्राउंड (Ground): उन्होंने AI को वीडियो को फिर से देखने के लिए कहा ताकि वह खोज सके कि वे विशिष्ट चीजें ठीक कहाँ और कब हुईं, उनके चारों ओर बॉक्स बनाए और टाइमस्टैम्प जोड़े।

इससे एक आदर्श प्रशिक्षण सेट बना जहाँ अंतिम कैप्शन और "जासूसी नोट्स" पूरी तरह से मेल खाते थे।

दो-चरणीय प्रशिक्षण शिविर

रोबोट को सोचने का यह नया तरीका सिखाने के लिए, शोधकर्ताओं ने दो-चरणीय प्रशिक्षण रणनीति का उपयोग किया:

  1. चरण 1: सुपरवाइज्ड फाइन-ट्यूनिंग ( "नियम सीखने" का चरण)
    उन्होंने रोबोट को इन हजारों आदर्श उदाहरणों (कैप्शन + मिलान वाले नोट्स) को दिखाया और उसे इस प्रक्रिया की नकल करना सिखाया। रोबोट ने सीखा: "पहले, मुझे सुरागों को सूचीबद्ध करना चाहिए। फिर, मैं कहानी लिखूँगा।" इसे परसीव-देन-डिस्क्राइब सुपरवाइज्ड फाइन-ट्यूनिंग (PD-SFT) कहा जाता है।

  2. चरण 2: रीइन्फोर्समेंट लर्निंग ( "गोल्ड स्टार पाने" का चरण)
    केवल नकल करना पर्याप्त नहीं है; रोबोट को इसमें बेहतर होना होगा। यहाँ, उन्होंने परसेप्शन-ग्राउंडेड रीइन्फोर्समेंट लर्निंग (PG-RL) नामक एक विधि का उपयोग किया। कल्पना कीजिए कि एक शिक्षक रोबोट के काम को दो अलग-अलग श्रेणियों में ग्रेड दे रहा है:

    • नोट्स: क्या आपने वस्तुओं को सही ढंग से ट्रैक किया? क्या आपको शुरुआत और अंत का समय सही मिला?
    • कहानी: क्या अंतिम कैप्शन सटीक और पूर्ण है?

    रोबोट को दोनों के आधार पर एक "स्कोर" मिलता है। यदि वह एक महान कहानी लिखता है लेकिन अपने नोट्स में एक प्रमुख वस्तु को छोड़ देता है, तो उसे कम स्कोर मिलता है। यह रोबोट को केवल अपने वाक्यों के प्रवाह के लिए नहीं, बल्कि अपने धारणा (perception) की गुणवत्ता के लिए भी ध्यान देने के लिए मजबूर करता है।

परिणाम: क्या यह वास्तव में काम करता है?

शोधकर्ताओं ने कई कठिन वीडियो समझ चुनौतियों पर PercepCap का परीक्षण किया, जिसमें DREAM-1K, CaReBench, ShortVidBench, और MotionBench शामिल हैं। उन्होंने अपने नए मॉडल की तुलना मानक Qwen3-VL बेसलाइन (एक शक्तिशाली मौजूदा मॉडल जो सीधे कैप्शन लिखता है) से की।

परिणाम स्पष्ट थे: PercepCap ने लगातार बेसलाइन से बेहतर प्रदर्शन किया।

  • DREAM-1K पर, इसने 33.9 का F1 स्कोर प्राप्त किया (बेसलाइन के 29.1 की तुलना में), जिसका अर्थ है कि यह नकली चीजें बनाए बिना सही विवरणों को पकड़ने में बेहतर था।
  • CaReBench पर, इसने क्रियाओं और वस्तुओं की पहचान करने की सटीकता में काफी सुधार किया।
  • यहाँ तक कि ShortVidBench और MotionBench पर भी, जो यह परीक्षण करते हैं कि एक कैप्शन वीडियो के बारे में प्रश्नों का उत्तर कितनी अच्छी तरह दे सकता है, PercepCap ने उच्च स्कोर किया (उदाहरण के लिए, 76.1% सटीकता बनाम बेसलाइन के लिए 72.8%)।

यह क्यों मायने रखता है (और यह अभी क्या नहीं कर सकता)

मुख्य बात यह है कि रोबोट को बोलने से पहले अपना "काम दिखाने" के लिए मजबूर करने से वह अधिक स्मार्ट और विश्वसनीय बनता है। देखने (धारणा) के कार्य को बोलने (कैप्शनिंग) से अलग करके, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जिसे डीबग करना आसान है और जिसे धोखा देना कठिन है।

हालाँकि, पेपर इसकी सीमाओं के बारे में ईमानदार है। क्योंकि प्रशिक्षण डेटा एक AI (कैप्शन-एंकरड विधि) द्वारा बनाया गया था, यदि प्रारंभिक AI ने नोट्स में गलती की, तो वह गलती रोबोट तक पहुँच सकती है। इसके अलावा, यह विधि अधिक समय और कंप्यूटर शक्ति लेती है क्योंकि रोबोट को अंतिम वाक्य लिखने से पहले नोट्स की एक लंबी सूची लिखनी पड़ती है। लेकिन, उन सभी के लिए जो ऐसा वीडियो AI चाहते हैं जो केवल अनुमान नहीं लगाता बल्कि वास्तव में घटनाओं की समयरेखा और स्थान को समझता है, PercepCap एक बहुत ही आशाजनक नई दिशा का सुझाव देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →