← नवीनतम पेपर
🤖 AI

NeuroRVQ: Multi-Scale Biosignal Tokenization for Generative Foundation Models

यह शोध पत्र NeuroRVQ को प्रस्तुत करता है, जो एक मोडैलिटी-अनुकूलित (modality-adaptive) बायोसिग्नल टोकेनाइज़र है जो उच्च-निष्ठा सिग्नल पुनर्निर्माण प्राप्त करने के लिए मल्टी-स्केल टेम्पोरल कनवल्शन और पोज़-अवेयर लॉस (phase-aware loss) के साथ पदानुक्रमित अवशिष्ट वेक्टर क्वांटाइजेशन (hierarchical residual vector quantization) का उपयोग करता है, जिससे NeuroRVQ-FM फाउंडेशन मॉडल्स को डाउनस्ट्रीम कार्यों में मौजूदा विधियों से बेहतर प्रदर्शन करने में सक्षम बनाया जा सके।

मूल लेखक: Konstantinos Barmpas, Na Lee, Dimitrios Chalatsis, William Raftery, Yannis Panagakis, Dimitrios A. Adamos, Nikolaos Laskaris, Alexandros Koliousis, Dario Farina, Stefanos Zafeiriou

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Konstantinos Barmpas, Na Lee, Dimitrios Chalatsis, William Raftery, Yannis Panagakis, Dimitrios A. Adamos, Nikolaos Laskaris, Alexandros Koliousis, Dario Farina, Stefanos Zafeiriou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास आपके दिल की धड़कन, मस्तिष्क तरंगों (brainwaves), या मांसपेशियों की गतिविधियों की एक बहुत ही अव्यवस्थित, शोर भरी रिकॉर्डिंग है। ये संकेत एक ऐसे जटिल संगीत की तरह हैं जिसे थोड़े बेसुुरे वाद्ययंत्रों पर बजाया जा रहा है और जो शोर (static) से घिरा हुआ है। यदि आप चाहते हैं कि एक कंप्यूटर इन संकेतों को समझ सके—जैसे कि यह पहचान सके कि आप क्या सोच रहे हैं या आपका दिल अनियमित रूप से धड़क रहा है—तो कंप्यूटर को सबसे पहले उस संकेत को "पढ़ना" होगा।

समस्या यह है कि कंप्यूटर चिकनी, लहरदार रेखाओं को अच्छी तरह से नहीं पढ़ पाते। वे सूचना के अलग-अलग टुकड़ों (discrete chunks) को पढ़ना पसंद करते हैं, जैसे वाक्य में शब्द। इस चिकने वेव (wave) को अलग-अलग टुकड़ों में बदलने की प्रक्रिया को टोकनाइज़ेशन (tokenization) कहा जाता है। इसे एक उच्च-रिज़ॉल्यूशन वाली तस्वीर को रंगीन टाइलों से बने मोज़ेक (mosaic) में बदलने जैसा समझें। यदि टाइलें बहुत बड़ी या गलत तरीके से चुनी गई हैं, तो आप फोटो के बारीक विवरण खो देंगे।

यह शोध पत्र इन जैविक संकेतों (biological signals) के लिए उन "टाइलों" को बनाने का एक नया, स्मार्ट तरीका पेश करता है। वे इसे NeuroRVQ कहते हैं।

मुख्य समस्या: ऊंचे सुरों को खो देना

इन संकेतों को टाइलों में बदलने के पिछले तरीके थोड़े अनाड़ी थे। वे अक्सर संकेत को बहुत अधिक स्मूथ (smooth) कर देते थे, जिससे तेज़, उच्च-आवृत्ति (high-frequency) वाले विवरण (संगीत के "ऊंचे सुर") खो जाते थे। मेडिकल संकेतों में, वे तेज़ विवरण अत्यंत महत्वपूर्ण होते हैं। उदाहरण के लिए, एक ECG (हृदय संकेत) में, तीखे स्पाइक्स (spikes) हृदय के विद्युत स्वास्थ्य के बारे में बताते हैं। यदि आप उन स्पाइक्स को धुंधला कर देते हैं, तो कंप्यूटर निदान (diagnosis) करने में चूक जाएगा।

समाधान: एक बहु-स्तरीय अनुवादक (A Multi-Layered Translator)

NeuroRVQ एक परिष्कृत अनुवादक की तरह काम करता है जो एक साथ विभिन्न गति और पिच पर संकेत सुनता है। यह कैसे काम करता है, इसके लिए एक उपमा (analogy) यहाँ दी गई है:

1. मल्टी-स्केल कान (The Encoder)
एक गाना सुनने की कल्पना करें। आप ड्रम की धीमी बेस लाइन, मध्यम-रेंज की वोकल्स और तेज़ हाई-हैट ड्रम को अलग-अलग सुन सकते हैं। NeuroRVQ बायोसिग्नल्स के साथ भी यही करता है। यह विभिन्न गति से संकेत को देखने के लिए कई अलग-अलग "कानों" (temporal branches) का उपयोग करता है।

  • एक कान धीमे, व्यापक रुझानों (trends) को देखता है।
  • दूसरा कान मध्यम-गति वाले पैटर्न को देखता है।
  • तीसरा कान बहुत तेज़, झटकेदार (jittery) विवरणों को देखता है।

2. पदानुक्रमित टाइल बॉक्स (RVQ Codebooks)
एक बार जब संकेत को गति के आधार पर तोड़ दिया जाता है, तो NeuroRVQ को उन्हें टाइलों (tokens) में बदलने की आवश्यकता होती है। एक बड़े टाइल बॉक्स के बजाय, यह छोटे बॉक्सों का एक स्टैक (Residual Vector Quantization या RVQ) उपयोग करता है।

  • पहला बॉक्स: संकेत के सबसे स्पष्ट, सामान्य आकार को चुनता है।
  • दूसвरा बॉक्स: देखता है कि क्या बचा हुआ है (residual) और ऐसी टाइलें चुनता है जो सूक्ष्म विवरणों को पकड़ सकें।
  • तीसरा/चौथा बॉक्स: प्रक्रिया जारी रखता है, और भी बारीक बारीकियों को पकड़ता है।
    यह एक चेहरे का वर्णन करने जैसा है: पहले आप कहते हैं "यह एक मानव चेहरा है," फिर "इसके भूरे बाल हैं," और फिर "इसके बाएं गाल पर एक छोटा सा निशान है।" प्रत्येक चरण सटीकता जोड़ता है।

3. फेज-अवेयर लॉस (The Geometry Trick)
यह सबसे चतुर हिस्सा है। संकेतों में "फेज" (phase) होता है, जो वेव पीक्स (wave peaks) के समय की तरह है। गणितीय रूप से, फेज गोलाकार (circular) होता है (0 डिग्री 360 डिग्री के समान है)। पुराने तरीकों ने फेज को एक सीधी रेखा की तरह माना, जिससे भ्रम पैदा हुआ जब वेव 359° से 1° पर वापस घूमती थी।
NeuroRVQ फेज को एक दिशा सूचक यंत्र (compass needle) की तरह मानता है। यह केवल नंबर का अनुमान नहीं लगाता; यह सुई की दिशा का अनुमान लगाता है। यह सुनिश्चित करता है कि कंप्यूटर समय (timing) को पूरी तरह से समझे, भले ही वेव लूप के चारों ओर घूम रही हो।

यह क्यों मायने रखता है?

लेखकों ने केवल एक बेहतर अनुवादक नहीं बनाया; उन्होंने इसके ऊपर एक फाउंडेशन मॉडल (Foundation Model) (एक सामान्य-उद्देश्य वाला AI) बनाया है। उन्होंने अपने नए NeuroRVQ टाइल्स को एक साधारण AI मॉडल में डाला यह देखने के लिए कि क्या वह उपयोगी चीजें सीख सकता है।

परिणाम प्रभावशाली थे:

  • मस्तिष्क तरंगें (EEG): मॉडल पिछले शीर्ष-स्तरीय मॉडलों की तुलना में मानसिक अवस्थाओं (जैसे मोटर इमेजरी या नींद के चरणों) को पहचानने में बेहतर था।
  • हृदय की धड़कन (ECG): यह हृदय रोगों, विशेष रूप से दुर्लभ स्थितियों का निदान करने में काफी बेहतर था। इसने एक कठिन 43-क्लास कार्य पर अगले-सर्वश्रेष्ठ मॉडल की सटीकता को दोगुना कर दिया।
  • मांसपेशियों की गतिविधियाँ (EMG): यह मौजूदा मॉडलों की तुलना में मांसपेशियों के संकेतों से हाथ के इशारों को पहचानने में बहुत बेहतर था।

मुख्य निष्कर्ष

इस शोध पत्र का मुख्य दावा सरल है: टाइलों (tokens) की गुणवत्ता AI मॉडल के आकार से अधिक मायने रखती है।

एक ऐसा टोकेनाइज़र डिज़ाइन करके जो जैविक संकेतों की जटिल, बहु-गति और गोलाकार प्रकृति का सम्मान करता है, NeuroRVQ एक अपेक्षाकृत छोटे AI मॉडल को भी बहुत बड़े और जटिल मॉडलों से बेहतर प्रदर्शन करने की अनुमति देता है। यह एक बड़ा दिमाग रखने के बारे में नहीं है; यह सुनने का एक बेहतर तरीका रखने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →