← नवीनतम पेपर
💻 computer science

GeoMag: Geometric-Aware Video Motion Magnification via State Space Model

यह शोध पत्र GeoMag को पेश करता है, जो स्टेट स्पेस मॉडल्स का लाभ उठाने वाला एक ज्यामितीय-जागरूक (geometric-aware) वीडियो मोशन मैग्निफिकेशन फ्रेमवर्क है, जो वैश्विक रूप से सुसंगत और रैखिक-जटिलता वाले प्रवर्धन (amplification) के लिए है, जिसे संरचनात्मक निरंतरता और प्रशिक्षण विविधता के संबंध में मौजूदा विधियों की सीमाओं को दूर करने के लिए नए Geo-200K डेटासेट द्वारा समर्थित किया गया है।

मूल लेखक: Kecheng Han, Yuchen Zhang, Bingqing Liu, Boqiang Guo, Wenbin Zheng, Shiyuan Pei

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kecheng Han, Yuchen Zhang, Bingqing Liu, Boqiang Guo, Wenbin Zheng, Shiyuan Pei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास किसी हमिंगबर्ड (hummingbird) के पंखों या किसी मशीन के पुर्जे के कंपन का एक वीडियो है। नग्न आंखों से देखने पर, ये हरकतें इतनी सूक्ष्म होती हैं कि वे केवल एक धुंधलेपन या स्थिर शोर (static noise) की तरह दिखती हैं। वीडियो मोशन मैग्निफिकेशन (VMM) एक "मोशन माइक्रोस्कोप" की तरह है जो इन अदृश्य थरथराहटों को इतना बड़ा दिखाने की कोशिश करता है कि हम उन्हें देख सकें।

हालाँकि, इन सूक्ष्म हलचलों को बड़ा करना कठिन है। यदि आप केवल गति (motion) के वॉल्यूम को बढ़ा देते हैं, तो आप "स्टैटिक" (शोर) को भी बढ़ा देते हैं और अक्सर तस्वीर बिगड़ जाती है, जिससे चीजें हिलती हुई या विकृत दिखने लगती हैं।

यह शोध पत्र एक नया टूल पेश करता है जिसे GeoMag कहा जाता है जो इन समस्याओं को हल करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "धुंधला बनाम टूटा हुआ" दुविधा

पिछले तरीकों ने गति को बड़ा करने के लिए दो मुख्य दृष्टिकोणों का उपयोग किया, जिनमें दोनों की अपनी खामियां थीं:

  • लोकल डिटेक्टिव (CNNs): ये एक समय में एक छोटे कमरे को देखने वाले जासूस की तरह हैं। ये तेज़ हैं, लेकिन इन्हें नहीं पता होता कि बाकी घर में क्या हो रहा है। इससे स्थानीय विकृति (local distortions) पैदा होती है जहाँ चित्र के कुछ हिस्से टेढ़े-मेढ़े दिखने लगते हैं।
  • ग्लोबल वॉचर (Transformers): ये एक पूरे शहर का ड्रोन व्यू देखने वाले जासूस की तरह हैं। वे बड़े परिदृश्य को पूरी तरह से देखते हैं, लेकिन वे इतने धीमे और महंगे हैं कि वे हाई-डेफिनिशन वीडियो को रियल-टाइम में नहीं संभाल सकते।

GeoMag उस "गोल्डिलॉक्स" (Goldilocks) ज़ोन को खोज लेता है: यह पूरे चित्र को देखता है (ग्लोबल कंसिस्टेंसी) लेकिन एक लोकल डिटेक्टिव की तरह तेज़ चलता है।

2. सीक्रेट सॉस: "मैम्बा" (Mamba) इंजन

GeoMag एक नए प्रकार के AI आर्किटेक्चर का उपयोग करता है जिसे स्टेट स्पेस मॉडल (विशेष रूप से Mamba नामक एक वेरिएंट) कहा जाता है।

  • उपमा: कल्पना कीजिए कि आप एक किताब पढ़ रहे हैं। पुराने तरीके (Transformers) कहानी समझने के लिए किताब के हर एक शब्द को पढ़ने और हर शब्द की तुलना दूसरे शब्द से एक साथ करने की कोशिश करते हैं। यह धीमा है।
  • GeoMag का दृष्टिकोण: यह किताब को रैखिक रूप से (linearly), शब्द दर शब्द पढ़ता है, लेकिन इसके पास एक "चयनात्मक स्मृति" (selective memory) है। यह महत्वपूर्ण कथानक (वास्तविक गति) को याद रखता है और पेज पर मौजूद रैंडम स्क्रिबल्स (शोर) को तुरंत भूल जाता है। यह पूरे दृश्य (पूरे वीडियो फ्रेम) को समझे बिना भी बहुत तेज़ और कुशल तरीके से काम करता है।

3. ट्रेनिंग ग्राउंड: "Geo-200K"

AI मॉडल्स को यह सीखने के लिए कि बिना चीज़ों को बिगाड़े गति को कैसे बड़ा किया जाए, उदाहरणों पर प्रशिक्षित (train) करने की आवश्यकता होती है।

  • पुराना तरीका: अधिकांश पिछले मॉडल्स को उन वीडियो पर प्रशिक्षित किया गया था जहाँ वस्तुएं केवल सीधी रेखा में चलती थीं (जैसे एक कार आगे की ओर जा रही हो)। यह एक पायलट को केवल एक सीधी, खाली रनवे पर उड़ान भरना सिखाने जैसा था।
  • नया तरीका (Geo-200K): लेखकों ने Geo-200K नामक एक विशाल नया ट्रेनिंग डेटासेट बनाया। उन्होंने एक "वर्चुअल प्लेग्राउंड" बनाया जहाँ वस्तुएं केवल सीधी नहीं चलतीं; वे घूमती हैं, मुड़ती हैं और रोटेट करती हैं। उन्होंने इसमें वास्तविक "कैमरा ग्लिच" जैसे ग्रेन और ब्लर भी जोड़े।
  • परिणाम: यह उस पायलट को तूफान में, हवा के झोंकों और तीखे मोड़ों के बीच प्रशिक्षित करने जैसा है। अब, जब Geoما сталки (सामना) वास्तविक दुनिया के वीडियो से होता है, तो यह जटिल गतिविधियों या कैमरा शोर से घबराता नहीं है। इसे पता है कि जटिल हलचल और कैमरा शोर को कैसे संभालना है।

4. GeoMag कैसे काम करता है (दो-धारा वाला किचन)

सिस्टम में अंतिम वीडियो बनाने के लिए दो "शेफ" मिलकर काम करते हैं:

  • शेफ 1 (मोशन स्पेशलिस्ट): यह शेफ गति को खोजने के लिए Mamba इंजन का उपयोग करता है। वे सूक्ष्म हलचल को लेते हैं, उसे बढ़ाते हैं (amplify), और फिर अपने "चयनात्मक स्मृति" का उपयोग करके किसी भी ऊबड़-खाबड़ किनारों या शोर को सुचारू (smooth) करते हैं। वे यह सुनिश्चित करते हैं कि चलती हुई वस्तु स्थिर रहे और धुंधली न बने।
  • शेफ 2 (डिटेल स्पेशलिस्ट): यह शेफ बैकग्राउंड और स्थिर विवरणों (जैसे दीवार या शर्ट की बनावट) पर ध्यान केंद्रित करता है। उनका काम यह सुनिश्चित करना है कि जबकि गति को बड़ा किया जा रहा है, बाकी चित्र धुंधला न हो या अपनी स्पष्टता न खो दे।
  • अंतिम डिश: वे अपने काम को मिला देते हैं। आपको एक ऐसा वीडियो मिलता है जहाँ गति बड़ी और स्पष्ट है, लेकिन बैकग्राउंड शार्प रहता है और वस्तु पिघलती हुई नहीं दिखती।

5. परिणाम

पेपर ने मौजूदा सर्वोत्तम तरीकों के मुकाबले GeoMag का परीक्षण किया:

  • बेहतर गुणवत्ता: यह कम "आर्टिफैक्ट्स" (अजीब विजुअल ग्लिच जैसे लहरें या टूटे हुए आकार) के साथ स्पष्ट वीडियो बनाता है।
  • तेज़: यह "ग्लोबल वॉचर" (Transformer) दृष्टिकोण का उपयोग करने वाले पिछले उन्नत तरीकों की तुलना में लगभग 5 गुना तेज़ है।
  • अधिक मजबूत (Robust): क्योंकि इसे जटिल Geo-200K डेटासेट पर प्रशिक्षित किया गया था, यह घूमने वाली वस्तुओं और शोर वाले कैमरों को सरल सीधी-रेखा वाली गतिविधियों वाले मॉडल्स की तुलना में बहुत बेहतर तरीके से संभालता है।

संक्षेप में: GeoMag वीडियो में अदृश्य गतिविधियों को ज़ूम करने का एक नया, तेज़ और स्मार्ट तरीका है। यह चित्र को स्थिर रखने के लिए एक चतुर "चयनात्मक स्मृति" प्रणाली का उपयोग करता है और एक सुपर-चार्ज्ड ट्रेनिंग डेटासेट का उपयोग करता है ताकि यह सुनिश्चित हो सके कि यह चीजों के घूमने या कैमरा हिलने पर भी काम करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →