← नवीनतम पेपर
💻 computer science

SNM-VFI: Symmetric Nonlinear Motion-Guided Generative Video Frame Interpolation

यह शोध पत्र SNM-VFI का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त ढांचा (training-free framework) है जो सममित गैररेखीय गति-व्युत्पन्न लेटेंट प्रायर्स (symmetric nonlinear motion-derived latent priors) और कॉन्फिडेंस मैप्स के माध्यम से पूर्व-प्रशिक्षित वीडियो डिफ्यूजन मॉडल्स को निर्देशित करके वीडियो फ्रेम इंटरपोलेशन को बढ़ाता है, ताकि बिना किसी अतिरिक्त प्रशिक्षण की आवश्यकता के उच्च-गुणवत्ता वाले, गति-संगत परिणाम प्राप्त किए जा सकें।

मूल लेखक: Jisoo Jeong, Hong Cai, Jamie Menjay Lin, Hanno Ackermann, Hyeonjun Sim, Yinhao Zhu, Yunxiao Shi, Fatih Porikli

प्रकाशित 2026-08-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jisoo Jeong, Hong Cai, Jamie Menjay Lin, Hanno Ackermann, Hyeonjun Sim, Yinhao Zhu, Yunxiao Shi, Fatih Porikli

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म देख रहे हैं, लेकिन किसी ने गलती से बीच के कुछ पन्ने फाड़ दिए हैं। पात्र एक दृश्य से दूसरे दृश्य पर कूदते हुए दिखाई देते हैं, और क्रिया टूटी हुई और झटकेदार महसूस होती है। वीडियो तकनीक में बिल्कुल यही होता है जब हम दो फ्रेमों के बीच के गायब क्षणों को भरने या वीडियो को धीमा करने की कोशिश करते हैं। यह विज्ञान का क्षेत्र जो इसे ठीक करने की कोशिश करता है, वीडियो फ्रेम इंटरपोलेशन (Video Frame Interpolation) कहलाता है। इसे एक डिजिटल टाइम मशीन की तरह समझें जो दो तस्वीरों के बीच के उस पल का अनुमान लगाती है जो घटित हुआ था।

इसे करने के लिए, कंप्यूटर आमतौर पर दो मुख्य तरकीबों पर निर्भर करते हैं। पहली तरकीब एक मानचित्रकार (mapmaker) की तरह है: यह रेखाएं खींचती है (जिसे "ऑप्टिकल फ्लो" कहा जाता है) ताकि यह ट्रैक किया जा सके कि हर एक पिक्सेल एक तस्वीर से दूसरी तस्वीर में कैसे घूमता है। यह यह जानने में बहुत अच्छी है कि चीजें कहाँ जा रही हैं, लेकिन यह अक्सर यह मान लेती है कि सब कुछ एक सीधी रेखा में और एक स्थिर गति से चलता है, जैसे हाईवे पर कोई कार। दूसरी तरकीब एक जनरेटिव एआई (generative AI) का उपयोग करने वाले एक रचनात्मक कलाकार की तरह है। यह एआई नए विवरणों की कल्पना कर सकता है और चीजों को अविश्वसनीय रूप से यथार्थवादी बना सकता है, लेकिन कभी-कभी यह कहानी को लेकर भ्रमित हो जाता है, जिससे वस्तुएं बिना किसी सख्त मानचित्र के पालन के झिलमिलाने लगती हैं या अपना आकार बदलने लगती हैं। बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं वह यह है: क्या हम वीडियो को स्मूथ और वास्तविक दिखने वाला बनाने के लिए मानचित्रकार की सटीकता को कलाकार की रचनात्मकता के साथ जोड़ सकते हैं?

यह शोध पत्र, जिसका शीर्षक SNM-VFI है, कहता है "हाँ, हम कर सकते हैं," लेकिन एक बहुत ही चतुर मोड़ के साथ। लेखक, जो क्वालकॉम एआई रिसर्च (Qualcomm AI Research) और गूगल की एक टीम है, एक नई विधि प्रस्तावित करते हैं जो एक सिमेट्रिकल, नॉनलीनियर मोशन गाइड (symmetrical, nonlinear motion guide) के रूप में कार्य करती है। केवल वीडियो के मध्य का अनुमान लगाने के बजाय, वे एक विशेष प्रकार के गणित का उपयोग करते हैं जो यह समझने के लिए अतीत और भविष्य दोनों को एक साथ देखता है कि चीजें वास्तव में कैसे घूम रही हैं, भले ही वे तेज हो रही हों, धीमी हो रही हों, या कोने काट रही हों।

यहाँ उनका "सिमेट्रिकल नॉनलीनियर मोशन" कैसे काम करता है, इसका एक सरल उदाहरण दिया गया है: कल्पना कीजिए कि आप अनुमान लगाने की कोशिश कर रहे हैं कि बास्केटबॉल फेंकने के बीच में गेंद कहाँ होगी। एक बुनियादी तरीका केवल खिलाड़ी के हाथ से बास्केट तक एक सीधी रेखा खींच सकता है। लेकिन यदि खिलाड़ी घूमता है या गेंद वक्र (arc) बनाती है, तो वह सीधी रेखा गलत होगी। SNM-VFI विधि दो दोस्तों की तरह है जो गेंद को देख रहे हैं: एक दोस्त शुरुआत से थ्रो को देखता है, और दूसरा अंत में कैच को देखता है। वे दोनों अपने अनुमान बताते हैं, और कंप्यूटर उनके दृश्यों को मिलाकर एक आदर्श, घुमावदार पथ बनाता है जो गेंद के त्वरण (acceleration) और किसी भी बाधा (जैसे डिफेंडर का हाथ) को ध्यान में रखता है जो दृश्य को रोकता है। यह "सिमेट्रिकल" दृष्टिकोण सुनिश्चित करता है कि जटिल गति होने पर भी पथ सटीक रहे।

एक बार जब यह सटीक मोशन मैप तैयार हो जाता है, तो शोध पत्र दूसरा चरण पेश करता है: एक जनरेटिव डिफ्यूजन मॉडल (generative diffusion model)। इसे एक उच्च श्रेणी के कलाकार के रूप में समझें जिसे मोशन मैप के रूप में एक स्केच दिया गया है। खाली कैनवास और रैंडम शोर (noise) से शुरू करने के बजाय (जिससे अक्सर अव्यवस्थित और असंगत परिणाम मिलते हैं), कलाकार कंप्यूटर के "स्केच" से शुरुआत करता है। कलाकार फिर इस स्केच को परिष्कृत करता है, इसमें यथार्थवादी बनावट और विवरण जोड़ता है, जबकि वह मोशन मैप का सख्ती से पालन करता है। यह सुनिश्चित करता है कि वीडियो न केवल अच्छा दिखे, बल्कि वह सुसंगत भी रहे, ताकि कार अचानक पेड़ में न बदल जाए या कोई व्यक्ति गायब होकर दूसरी जगह प्रकट न हो जाए।

शोध पत्र एक कठिन समस्या का भी समाधान करता है: क्या होता है जब कुछ छिप जाता है? यदि कोई व्यक्ति पेड़ के पीछे चलता है, तो कंप्यूटर बीच के फ्रेम में उसे नहीं देख पाता है। लेखकों की विधि एक "कॉन्फिडेंस मैप" (confidence map) का उपयोग करती है, जो एक विश्वास स्कोर की तरह है। उन क्षेत्रों में जहाँ मोशन मैप निश्चित है (जैसे साफ आकाश), यह मैप पर भरोसा करता है। उन क्षेत्रों में जहाँ मैप अनिश्चित है (जैसे पेड़ के पीछे छिपा व्यक्ति), यह विवरणों को भरने के लिए कलाकार के जनरेटिव एआई पर भरोसा करता है। अंत में, यह इन दोनों स्रोतों को सहजता से मिला देता है।

परिणाम प्रभावशाली हैं। टीम ने अपने तरीके का परीक्षण तीन प्रसिद्ध वीडियो डेटासेट्स पर किया: DAVIS, Sintel, और KITTI। उन्होंने पाया कि उनका दृष्टिकोण, जिसमें कोई अतिरिक्त प्रशिक्षण की आवश्यकता नहीं है (यह मौजूदा उपकरणों का उपयोग करता है), पिछले तरीकों की तुलना में अधिक शार्प और यथार्थवादी वीडियो बनाता है। उन परीक्षणों में जो पिक्सेल के मूल के करीब होने (PSNR और SSIM) और मानव आंख को चित्र कितने वास्तविक दिखते हैं (LPIPS और FID) को मापते हैं, SNM-VFI लगातार शीर्ष या शीर्ष के करीब रहा। उदाहरण के लिए, KITTI डेटासेट पर, इसने 22.8125 का PSNR और 0.1811 का LPIPS स्कोर प्राप्त किया, जो कई अन्य अत्याधुनिक मॉडलों को पीछे छोड़ देता है।

लेखकों ने "एब्लेशन स्टडीज" (ablation studies) भी चलाईं, जो एक प्रकार के प्रयोग हैं जहाँ वे यह देखने के लिए अपनी मशीन के हिस्सों को हटा देते हैं कि क्या टूट जाता है। उन्होंने पाया कि यदि वे अपने विशेष "सिमेट्रिकल" मोशन मॉडल का उपयोग नहीं करते, तो परिणाम धुंधले हो जाते। यदि वे दोनों विधियों को मिलाने के लिए कॉन्फिडेंस मैप का उपयोग नहीं करते, तो वीडियो कम यथार्थवादी दिखते। यह सिद्ध करता है कि उनके सिस्टम का हर हिस्सा उच्च गुणवत्ता प्राप्त करने के लिए आवश्यक है।

संक्षेप में, SNM-VFI एक शक्तिशाली एआई कलाकार को निर्देशित करने के लिए एक स्मार्ट, दो-तरफा मोशन गाइड का उपयोग करके वीडियो के अंतराल को भरने का एक नया तरीका है। यह केवल अनुमान नहीं लगाता है; यह गति के वक्र की गणना करता है और फिर विवरणों को चित्रित करता है, जिससे ऐसे वीडियो मिलते हैं जो स्मूथ, सटीक और उन अजीब ग्लिच से मुक्त होते हैं जो अक्सर कंप्यूटर-जनरेटेड फ्रेमों में देखे जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →