← नवीनतम पेपर
💻 computer science

PEARL: Personalized Streaming Video Understanding Model

यह शोध पत्र निरंतर दृश्य इनपुट और त्वरित प्रतिक्रिया के बीच के अंतर को पाटकर विज़न-लैंग्वेज मॉडल्स में वास्तविक समय, संवादात्मक व्यक्तिगत प्रतिक्रियाओं को सक्षम करने के लिए, PEARL-Bench बेंचमार्क और एक ट्रेनिंग-फ्री PEARL रणनीति के साथ मिलकर, पर्सनलाइज्ड स्ट्रीमिंग वीडियो अंडरस्टैंडिंग (PSVU) के नवीन कार्य को प्रस्तुत करता है।

मूल लेखक: Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu Zhang, Haodong Li, Qintong Zhang, Renrui Zhang, Guopeng Li, Yifan Zhang, Yuheng Li, Wentao Zhang

प्रकाशित 2026-03-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu Zhang, Haodong Li, Qintong Zhang, Renrui Zhang, Guopeng Li, Yifan Zhang, Yuheng Li, Wentao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त के साथ एक लंबी, निरंतर चलने वाली फिल्म देख रहे हैं। फिल्म के बीच में, आपका दोस्त एक पात्र की ओर इशारा करता है और कहता है, "वह बॉब है।" कुछ मिनटों बाद, वह एक विशिष्ट डांस मूव की ओर इशारा करता है और कहता है, "यह मूनवॉक है।"

अब, कल्पना कीजिए कि आपका दोस्त फिल्म चलते रहने के दौरान ही आपसे बॉब और मूनवॉक के बारे में सवाल पूछता है। वे पूछ सकते हैं, "क्या बॉब ने अभी टोपी पहनी है?" (रियल-टाइम) या "10 मिनट पहले बॉब क्या कर रहा था?" (पास्ट-टाइम)।

समस्या:
वर्तमान AI असिस्टेंट उन लोगों की तरह हैं जिनकी या तो अल्पकालिक स्मृति (short-term memory) होती है या जो फिल्म खत्म होने के बाद ही उसे देखते हैं।

  • स्टैटिक AI (Static AI): वे एक अकेली फोटो को देखकर कह सकते हैं, "वह बॉब है।" लेकिन अगर फिल्म चलती रहती है, तो वे भूल जाते हैं कि बॉब कौन है।
  • ऑफलाइन वीडियो AI (Offline Video AI): वे पूरी फिल्म देख सकते हैं और फिर सवालों के जवाब दे सकते हैं, लेकिन वे आपसे चलते समय बात नहीं कर सकते। वे यह नहीं कह सकते, "ओह, मैंने देखा कि बॉब अभी अंदर आया है!"
  • अंतराल (The Gap): वास्तविक जीवन एक लाइव स्ट्रीम की तरह है। हमें एक ऐसे AI की आवश्यकता है जो एक लाइव स्ट्रीम देख सके, नए नाम और क्रियाओं को तुरंत सीख सके, और तुरंत उनके बारे में सवालों के जवाब दे सके, ठीक वैसे ही जैसे एक इंसान करता है।

समाधान: PEARL
यह पेपर एक नया कार्य पेश करता है जिसे पर्सनलाइज्ड स्ट्रीमिंग वीडियो अंडरस्टैंडिंग (PSVU) कहा जाता है और इस समस्या को हल करने के लिए एक नया AI फ्रेमवर्क PEARL पेश करता है।

यहाँ बताया गया है कि PEARL कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. दो-नोटबुक सिस्टम (डुअल-ग्रेन्ड मेमोरी)

कल्पना कीजिए कि फिल्म चलते समय चीजों को याद रखने के लिए PEARL के पास दो विशेष नोटबुक हैं:

  • नोटबुक A: "कौन क्या है" की सूची (कॉन्सेप्ट मेमोरी)
    जब आपका दोस्त कहता है, "यह बॉब है," तो PEARL इस नोटबुक में एक त्वरित विवरण लिखता है: "बॉब बिखरे हुए सुनहरे बालों और नीली आँखों वाला एक आदमी है।" यह केवल नाम "बॉब" नहीं लिखता; यह लिखता है कि बॉब कैसा दिखता है ताकि वह बाद में उसे पहचान सके, भले ही उसने अपनी शर्ट बदल ली हो।
  • नोटबुक B: मूवी लॉग (स्ट्रीमिंग मेमोरी)
    जैसे-जैसे फिल्म चलती है, PEARL लगातार छोटे वीडियो क्लिप लेता है और प्रत्येक क्लिप में क्या हुआ उसका एक "सारांश" लिखता है। यह एक लाइब्रेरियन की तरह है जो लाइब्रेरी के हर दृश्य का एक चलता-फिरता लॉग रखता है, जो समय के अनुसार व्यवस्थित है।

2. स्मार्ट सर्च इंजन (कॉन्सेप्ट-अवेयर रिट्रीवल)

जब आपका दोस्त कोई सवाल पूछता है, तो PEARL केवल अनुमान नहीं लगाता। यह एक चतुर खोज रणनीति का उपयोग करता है:

  • सवाल: "बॉब क्या कर रहा है?"
  • अनुवाद: PEARL अपनी "कौन क्या है" सूची को देखता है, देखता है कि बॉब "बिखरे हुए सुनहरे बालों वाला आदमी" है, और सवाल को अपनी आंतरिक भाषा में फिर से लिखता है: "बिखरे हुए सुनहरे बालों वाला आदमी क्या कर रहा है?"
  • खोज (Search): यह अपने "मूवी लॉग" (नोटबुक B) को पलटता है ताकि उस सटीक क्षण को खोजा जा सके जहाँ बिखरे हुए सुनहरे बालों वाला एक आदमी दिखाई देता है। यह उस विशिष्ट क्लिप को निकालता है और उसे मुख्य AI मस्तिष्क को दिखाता है।
  • जवाब: AI मस्तिष्क उस क्लिप को देखता है और कहता है, "वह कॉफी का कप पकड़े हुए है।"

3. यह एक बड़ी बात क्यों है

लेखकों ने एक टेस्ट ट्रैक भी बनाया है जिसे PEARL-Bench कहा जाता है। इसे AI के लिए एक ड्राइविंग टेस्ट समझें।

  • ट्रैक: इसमें 132 लंबी वीडियो (जैसे फिल्में और एनिमे) हैं जिनमें 2,000+ विशिष्ट प्रश्न हैं।
  • चुनौती: इन प्रश्नों के लिए AI को वीडियो के दौरान परिभाषित किए गए विशिष्ट लोगों या क्रियाओं को याद रखने और बाद में उनके बारे में सवालों के जवाब देने की आवश्यकता होती है।
  • परिणाम: जब उन्होंने अन्य शीर्ष AI मॉडलों के मुकाबले PEARL का परीक्षण किया, तो PEARL आसानी से जीत गया। यह एकमात्र ऐसा मॉडल था जो बिना भ्रमित हुए या चीजें भूले बिना "लाइव स्ट्रीम" की प्रकृति को संभाल सकता था।

निष्कर्ष (The Takeaway)

इस पेपर से पहले, AI एक ऐसे छात्र की तरह था जो केवल एक पाठ्यपुस्तक (स्टैटिक इमेज) पढ़ सकता था या रिकॉर्ड किए गए लेक्चर (ऑफलाइन वीडियो) देख सकता था और फिर परीक्षा दे सकता था।

PEARL एक ऐसे छात्र की तरह है जो एक लाइव लेक्चर हॉल में बैठ सकता है, प्रोफेसर द्वारा पेश किए गए नए कॉन्सेप्ट्स पर नोट्स ले सकता है, और लेक्चर के दौरान ही दर्शकों के सवालों के जवाब दे सकता है।

यह भविष्य के वास्तविक AI असिस्टेंट बनाने की दिशा में एक महत्वपूर्ण कदम है—ऐसे रोबोट या ऐप्स जो आपके वर्कआउट को देख सकें, आपके विशिष्ट फॉर्म को याद रख सकें और रियल-टाइम में आपको सुधार सकें, या एक रोबोट जो आपके बच्चों को खेलते हुए देख सके और याद रख सके कि कौन कौन है, भले ही वे कमरे में अंदर आएं या बाहर जाएं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →