← नवीनतम पेपर
💻 computer science

Rhythm-Structured Predictive Learning for Remote Photoplethysmography

यह शोध पत्र RhythmJEPA का प्रस्ताव करता है, जो एक स्व-पर्यवेक्षित (self-supervised) रिमोट फोटोप्लेथिस्मोग्राफी फ्रेमवर्क है जो मास्क किए गए वीडियो से लेटेंट टीचर रिप्रेजेंटेशन्स का पूर्वानुमान लगाकर और पल्स सिग्नल्स की चक्रीय टेम्पोरल संरचना को स्पष्ट रूप से मॉडल करने के लिए ड्यूल ऑर्डर मंबा एनकोडर के साथ एक साइक्लिक रिदम-स्टेट प्लानर का उपयोग करके शारीरिक संकेत अनुमान में सुधार करता है।

मूल लेखक: Ba-Thinh Nguyen, Huu-Dung Nguyen, Thi-Duyen Ngo, Thanh-Ha Le

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ba-Thinh Nguyen, Huu-Dung Nguyen, Thi-Duyen Ngo, Thanh-Ha Le

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वीडियो कॉल के माध्यम से अपने दोस्त के दिल की धड़कन सुनने की कोशिश कर रहे हैं। समस्या यह है कि दिल की धड़कन की "आवाज़" वास्तव में कोई आवाज़ नहीं है; यह उनकी त्वचा के रंग में होने वाला एक सूक्ष्म, लगभग अदृश्य बदलाव है जो रक्त पंप होने के कारण होता है। अधिकांश कंप्यूटर प्रोग्राम जो इस सिग्नल को खोजने की कोशिश करते हैं, वे वीडियो के "शोर" से विचलित हो जाते हैं: जैसे व्यक्ति के बाल, उनके चेहरे के भाव, कमरे की रोशनी, या कैमरे की गुणवत्ता। वे पूरे चेहरे को फिर से बनाने (rebuild) की कोशिश करते हैं, जिससे वे गलत विवरणों पर ध्यान केंद्रित करने लगते हैं।

यह शोध पत्र RhythmJEPA पेश करता है, जो कंप्यूटर के लिए यह सीखने का एक नया तरीका है कि दिल की धड़कन के सिग्नल को कैसे खोजा जाए। यह कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से समझाया गया है:

1. "आंखों पर पट्टी बंधा संगीतकार" (मुख्य विचार)

पारंपरिक तरीके ऐसे हैं जैसे कोई संगीतकार संगीत के कागज़ (sheet music) को घूरकर और हर एक नोट को पूरी तरह से फिर से बनाने की कोशिश करके गाना सीखने का प्रयास कर रहा हो। यदि वे चित्र बनाने में कोई गलती करते हैं, तो उन्हें लगता है कि वे असफल हो गए।

RhythmJEवJEPA अलग है। यह एक आंखों पर पट्टी बंधे संगीतकार की तरह काम करता है।

  • चाल: कंप्यूटर एक चेहरे का वीडियो लेता है और कई फ्रेम्स (frames) को ढक देता है (masking), जैसे आंखों पर पट्टी बांध दी गई हो।
  • लक्ष्य: गायब हिस्से के चेहरे को फिर से बनाने के बजाय (जो बालों या मेकअप के कारण गलत होना आसान है), यह गायब हिस्सों के छिपे हुए अहसास या लय (rhythm) का अनुमान लगाने की कोशिश करता है।
  • परिणाम: खुद को पिक्सेल देखे बिना गायब क्षणों के "अहसास" (vibe) का अनुमान लगाने के लिए मजबूर करके, कंप्यूटर विचलित करने वाले विवरणों (जैसे मुस्कान या टोपी) को अनदेखा करना सीख जाता है और पूरी तरह से अंतर्निहित धड़कन पर ध्यान केंद्रित करता है।

2. "डांस इंस्ट्रक्टर" (साइक्लिक रिदम-स्टेट प्लानर)

दिल की धड़कन लयबद्ध होती है; यह धक्-धक्, धक्-धक् चलती है। लेकिन एक वीडियो में, फ्रेम्स समय की एक सीधी रेखा मात्र होते हैं (फ्रेम 1, फ्रेम 2, फ्रेम 3...)। केवल सीधी रेखा को देखने वाला कंप्यूटर उस पैटर्न को मिस कर सकता है कि फ्रेम 10, फ्रेम 1 के बहुत समान है क्योंकि वे दोनों दिल की धड़कन के चक्र के बिल्कुल एक ही बिंदु पर हैं।

RhythmJEPA एक डांस इंस्ट्रक्टर (जिसे साइक्लिक रिदम-स्टेट प्लानर कहा जाता है) पेश करता है।

  • यह इंस्ट्रक्टर वीडियो को देखता है और हर फ्रेम को एक "डांस स्टेप" नंबर असाइन करता है (जैसे, "स्टेप 1: हृदय का संकुचन," "स्टेप 2: हृदय का विश्राम")।
  • भले ही फ्रेम 100 समय में फ्रेम 1 से बहुत दूर हो, यदि वे दोनों "स्टेप 1" हैं, तो इंस्ट्रक्टर जानता है कि वे एक साथ संबंधित हैं।
  • यह कंप्यूटर को समझने में मदद करता है कि दिल की धड़कन एक चक्र (cycle) है, न कि केवल एक सीधी रेखा।

3. "दो-तरफा स्कैनर" (डुअल-ऑर्डर माम्बा एनकोडर)

अधिकांश कंप्यूटर वीडियो को एक किताब की तरह पढ़ते हैं: बाएं से दाएं, ऊपर से नीचे, फ्रेम दर फ्रेम।
RhythmJEPA एक डुअल-वे स्कैनर (जिसे DOM कहा जाता है) का उपयोग करता है।

  • तरीका 1: यह वीडियो को सामान्य रूप से पढ़ता है, ठीक एक किताब की तरह, यह देखने के लिए कि आगे क्या होता है।
  • तरीका 2: यह वीडियो को उस "डांस स्टेप" के आधार पर पुनर्गठित करता है जो इंस्ट्रक्टर ने असाइन किए हैं। यह सभी "स्टेप 1" वाले फ्रेम्स को एक साथ, फिर सभी "स्टेप 2" वाले फ्रेम्स को एक साथ, और इसी तरह समूहबद्ध करता है।
  • दोनों क्रमों में वीडियो को पढ़कर, कंप्यूटर एक पूर्ण तस्वीर प्राप्त करता है: वह समय के तत्काल प्रवाह को भी देखता है और दिल की दोहराई जाने वाली लय को भी।

4. "स्मार्ट स्पॉटलाइट" (स्पेशियल पल्स मिक्सर)

चेहरे को देखते समय, दिल की धड़कन का सिग्नल माथे, गालों और नाक पर सबसे मजबूत होता है। यह बालों या बैकग्राउंड में कमजोर या गैर-मौजूद होता है।
RhythmJEPA एक स्मार्ट स्पॉटलाइट (जिसे SPM कहा जाता है) का उपयोग करता है।

  • पूरे चेहरे का विश्लेषण करने के लिए एक भारी, जटिल मशीन का उपयोग करने के बजाय, यह स्पॉटलाइट हल्का और कुशल है।
  • यह स्वचालित रूप से गालों और माथे पर अपनी रोशनी तेज कर देता है (जहाँ रक्त प्रवाह दिखाई देता है) और बालों या बैकग्राउंड पर रोशनी कम कर देता है। यह सिस्टम को सुपरकंप्यूटर की आवश्यकता के बिना तेज़ और सटीक रखता है।

यह क्यों मायने रखता है?

लेखकों ने इस सिस्टम का परीक्षण तीन अलग-अलग वीडियो डेटासेट (PURE, UBFC-rPPG, और MMPD) पर किया।

  • परिणाम: RhythmJEPA ने सटीकता में लगभग हर अन्य विधि को पीछे छोड़ दिया। यह रोशनी बदलने, व्यक्ति के सिर हिलाने, या वीडियो की गुणवत्ता खराब होने पर भी धड़कन खोजने में बेहतर था।
  • दक्षता: इसने अन्य कई उन्नत तरीकों की तुलना में कम कंप्यूटर पावर का उपयोग करते हुए यह काम किया, जिससे यह एक "लीन एंड मीन" (कम संसाधनों में प्रभावी) समाधान बन गया।

संक्षेप में, RhythmJEPA "चेहरा बनाने" के बजाय "लय को समझने" पर ध्यान केंद्रित करता है, जो अंधे होकर अनुमान लगाने, डांस-स्टेप ग्रुपिंग और एक स्मार्ट स्पॉटलाइट के मिश्रण का उपयोग करके वीडियो में छिपी धड़कन को खोजता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →