← नवीनतम पेपर
🤖 machine learning

OpenMHC: Accelerating the Science of Wearable Foundation Models

यह शोध पत्र OpenMHC को प्रस्तुत करता है, जो लगभग 12,000 प्रतिभागियों के 6 करोड़ घंटों से अधिक के वियरेबल स्वास्थ्य डेटा, फाउंडेशन मॉडल्स के ओपन-सोर्स कार्यान्वयन और एक एकीकृत बेंचमार्क के साथ एक व्यापक ओपन-एक्सेस डेटासेट है, ताकि वियरेबल हेल्थ AI में अनुसंधान को लोकतांत्रिक और त्वरित बनाया जा सके।

मूल लेखक: Narayan Schuetz, Yuze Bai, Lianggang Pan, Edgar Eggert, Favour Nerrise, Juan Delgado-SanMartin, Max Rosenblattl, Milana Gurbanova, Mohammad Asadi, Anders Johnson, Paul Schmiedmayer, Dennis Wang, Allan
प्रकाशित 2026-07-22
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Narayan Schuetz, Yuze Bai, Lianggang Pan, Edgar Eggert, Favour Nerrise, Juan Delgado-SanMartin, Max Rosenblattl, Milana Gurbanova, Mohammad Asadi, Anders Johnson, Paul Schmiedmayer, Dennis Wang, Allan Lawrie, Daniel Seung Kim, Xin Liu, Akshay Paruchuri, Ehsan Adeli, Euan Ashley, Kelly W. Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपकी स्मार्टवॉच एक नन्हा, अथक जासूस है जो कभी सोता नहीं है। दिन के हर मिनट में, यह आपके फोन को अपने रहस्य फुसफुसाती है: आपने कितने कदम चले, आपका दिल कितनी तेजी से धड़का, आप कितनी गहरी नींद सोए, और यहाँ तक कि आपने सीढ़ियों के कितने चक्कर लगाए। वर्षों से, वैज्ञानिक कंप्यूटरों को इन फुसफुसाहटों को सुनना और हमारे स्वास्थ्य को बेहतर ढंग से समझना सिखाना चाहते हैं। वे इन सुपर-स्मार्ट कंप्यूटरों को "फाउंडेशन मॉडल्स" (foundation models) कहते हैं। इन्हें एक मास्टर शेफ की तरह समझें जिसने दुनिया के हर व्यंजन का स्वाद चखा है; एक बार जब वे स्वादों को सीख लेते हैं, तो वे नए व्यंजन बना सकते हैं या तुरंत किसी खराब सामग्री को पहचान सकते हैं। लेकिन यहाँ एक समस्या है: मास्टर शेफ बनने के लिए, आपको सामग्रियों से भरी एक विशाल रसोई की आवश्यकता होती है। स्वास्थ्य डेटा की दुनिया में, सबसे बड़ी रसोइयाँ बंद दरवाजों के पीछे छिपी हुई हैं, जिनका स्वामित्व बड़ी टेक कंपनियों के पास है, जिससे शोधकर्ताओं के पास केवल छोटे, खाली कपाट ही बचे हैं। पर्याप्त डेटा के बिना, ये AI शेफ इस पूरी कहानी को नहीं सीख सकते कि हमारे शरीर कैसे चलते और महसूस करते हैं।

यहीं पर स्टैनफोर्ड, इंपीरियल कॉलेज लंदन और अन्य संस्थानों के शोधकर्ताओं की एक टीम एक विशाल चाबी लेकर आती है। उन्होंने "माय हार्ट काउंट्स" (My Heart Counts) अध्ययन के दरवाजों को खोल दिया है, जो एक डिजिटल स्वास्थ्य प्रयोग है जो एक दशक से अधिक समय से चल रहा है। वे OpenMHC नामक एक खजाना जारी कर रहे हैं। यह केवल एक छोटा नाश्ता नहीं है; यह लगभग 12,000 लोगों के पहनने योग्य (wearable) डेटा से भरे 6.7 करोड़ घंटों का एक भव्य भोज है। इसमें आईफोन और एप्पल वॉच से एकत्र किए गए स्टेप काउंट और हृदय गति से लेकर नींद के पैटर्न और वर्कआउट लॉग तक सब कुछ शामिल है। इस विशाल डेटासेट के साथ, वे वे "रेसिपी" (कोड) और "प्रशिक्षित शेफ" (AI मॉडल) भी साझा कर रहे हैं जिन्हें उन्होंने इसे परखने के लिए बनाया है। उनका लक्ष्य यह है कि कोई भी, कहीं भी, स्वास्थ्य समस्याओं की भविष्यवाणी करने के नए तरीके विकसित करने, छूटे हुए डेटा को भरने, या यह पूर्वानुमान लगाने के लिए कि हमारा शरीर कल कैसा व्यवहार करेगा, प्रयोग कर सके।

सामग्रियों पर महत्वपूर्ण नोट: खाना बनाना शुरू करने से पहले, यह जानना महत्वपूर्ण है कि इस रसोई की कुछ विशिष्ट विशेषताएं हैं। डेटा देने वाले लोग मुख्य रूप से अमेरिका से हैं, और यह समूह तीस के दशक के अंत वाले श्वेत पुरुषों की ओर झुका हुआ है। इसका मतलब है कि AI जो "स्वाद" सीखता है, वह दुनिया के बाकी लोगों के लिए बिल्कुल सही नहीं हो सकता है। इसके अलावा, क्योंकि यह एक डिजिटल अध्ययन था, इसलिए सभी स्वास्थ्य जानकारी (जैसे कि किसी को मधुमेह है या वे कितने खुश हैं) उपयोगकर्ताओं द्वारा स्वयं बताई गई थी। यह लेबलिंग में कुछ "शोर" या अनिश्चितता पैदा करता है, जो AI के लिए सटीक पैटर्न सीखना कठिन बना सकता है। अंत में, AI को डेटा के आधार पर स्वास्थ्य लक्षणों का पता लगाने के लिए डिज़ाइन किया गया है, न कि भविष्य की चिकित्सा घटनाओं जैसे कि अगले वर्ष दिल का दौरा पड़ने की भविष्यवाणी करने के लिए।

बड़ी घोषणा: उन्होंने क्या पाया

शोधकर्ताओं ने केवल डेटा को फेंका नहीं; उन्होंने एक विशाल खेल का मैदान बनाया यह देखने के लिए कि कौन से AI मॉडल वास्तव में इसका अर्थ निकाल सकते हैं। उन्होंने तीन मुख्य चुनौतियाँ स्थापित कीं:

  1. भविष्यवाणी (Prediction): क्या AI आपके वॉच डेटा को देखकर आपके स्वास्थ्य गुणों (जैसे कि क्या आपको मधुमेह है या आप कितने खुश हैं) का अनुमान लगा सकता है?
  2. इम्प्यूटेशन (Imputation - खाली स्थानों को भरना): चूंकि लोग नहाने या चार्ज करने के लिए अपनी घड़ियाँ उतार देते हैं, इसलिए डेटा में अंतराल होते हैं। क्या AI उन छूटे हुए मिनटों के दौरान क्या हुआ, इसका अनुमान लगा सकता है?
  3. पूर्वानुमान (Forecasting): क्या AI अगले 24 घंटों में आपकी गतिविधि कैसी होगी, इसका पूर्वानुमान लगा सकता है?

यहाँ उन्होंने क्या खोजा:

1. "विशेषज्ञ शेफ" जीतता है, लेकिन "साधारण रसोइया" भी कठिन चुनौती है
जब उन्होंने विभिन्न AI मॉडलों का परीक्षण किया, तो LSM-2 (वियरेबल डेटा पर विशेष रूप से प्रशिक्षित एक प्रकार का फाउंडेशन मॉडल) समग्र रूप से सबसे अच्छा शेफ साबित हुआ। यह स्वास्थ्य परिणामों की भविष्यवाणी करने और छूटे हुए डेटा को भरने में सबसे सुसंगत था। हालाँकि, शोधकर्ताओं ने कुछ आश्चर्यजनक पाया: एक बहुत ही सरल, पुराने शैली का मॉडल जिसे XGBoost कहा जाता है (जो एक बहुत ही व्यवस्थित, नियम-आधारित कैलकुलेटर की तरह है) दूसरे स्थान पर बहुत करीब से आया। वास्तव में, कुछ कार्यों के लिए, सरल मॉडल फैंसी, जटिल AI के समान ही अच्छा था। यह सुझाव देता है कि जबकि बड़ा AI शक्तिशाली है, हमें यह मान लेने की जरूरत नहीं है कि "अधिक जटिल" हमेशा "बेहतर" होता है। कभी-कभी, एक अच्छी तरह से ट्यून किया गया, सरल उपकरण चमत्कार कर सकता है।

2. बड़े भाषा मॉडल (जैसे चैटबॉट्स) संघर्ष करते हैं
टीम ने इन स्वास्थ्य पहेलियों को हल करने के लिए विशाल भाषा मॉडलों (वे जो निबंध लिखते हैं और आपसे चैट करते हैं) का भी उपयोग किया। उन्होंने मॉडलों को डेटा टेक्स्ट या ग्राफ की तस्वीरों के रूप में दिया। परिणाम? इन विशाल चैटबॉट्स ने आम तौर पर विशेषज्ञ स्वास्थ्य मॉडलों और यहाँ तक कि सरल कैलकुलेटरों से भी खराब प्रदर्शन किया। ऐसा लगता है कि दिल की धड़कनों और कदमों की विशिष्ट "भाषा" को पढ़ने के लिए, एक सामान्य-उद्देश्य वाले उपकरण की तुलना में एक विशेष उपकरण कहीं अधिक बेहतर है।

3. दीर्घकालिक स्मृति मदद करती है
जब बात छूटे हुए डेटा को भरने (इम्प्यूटेशन) की आई, तो वे मॉडल जो कई दिनों के उपयोगकर्ता के इतिहास को देख सकते थे, वे उन मॉडलों की तुलना में बहुत बेहतर थे जो केवल एक दिन को देखते थे। यह अनुमान लगाने जैसा है कि कोई अभी क्या कर रहा है: यदि आप उन्हें केवल एक मिनट के लिए देखते हैं, तो आप गलत हो सकते हैं। लेकिन यदि आप जानते हैं कि वे आमतौर पर शाम 6 बजे दौड़ने जाते हैं, तो आप अधिक स्मार्ट अनुमान लगा सकते हैं। पेपर सुझाव देता है कि उपयोगकर्ता के दीर्घकालिक इतिहास का उपयोग करना इन मॉडलों को स्मार्ट बनाने की कुंजी है।

4. निष्पक्षता मायने रखती है
शोधकर्ताओं ने यह भी जांचा कि क्या मॉडल सभी के साथ समान व्यवहार करते हैं। उन्होंने पाया कि जबकि फैंसी AI मॉडल सटीक थे, वे कभी-कभी कुछ समूहों के लोगों (जैसे विभिन्न आयु समूहों या लिंगों) के लिए सरल मॉडलों की तुलना में अधिक बड़ी गलतियाँ करते थे। यह एक महत्वपूर्ण अनुस्मारक है कि जैसे-जैसे हम इन स्वास्थ्य उपकरणों का निर्माण कर रहे हैं, हमें यह सुनिश्चित करना चाहिए कि वे केवल बहुमत के लिए ही नहीं, बल्कि सभी के लिए निष्पक्ष रूप से काम करें।

यह खेल को कैसे बदल देता है

इस पेपर से पहले, यदि आप पहनने योग्य स्वास्थ्य डेटा को समझने के लिए एक AI बनाना चाहते थे, तो आप फंस जाते थे। आप डेटा प्राप्त नहीं कर सकते थे, और आप यह नहीं देख सकते थे कि बड़ी कंपनियाँ अपने मॉडलों को कैसे प्रशिक्षित करती हैं। यह बिना कॉकपिट देखे विमान उड़ाना सीखने जैसा था।

OpenMHC इसे बदलकर सबको कॉकपिट, फ्लाइट मैनुअल और ट्रेनिंग सिम्युलेटर प्रदान करता है। 13 वर्षों तक फैले 11,894 प्रतिभागियों के डेटा के साथ, कोड को भी जारी करके, लेखक इस क्षेत्र का लोकतंत्रीकरण कर रहे हैं। वे यह दावा नहीं कर रहे हैं कि उन्होंने अभी तक सभी स्वास्थ्य रहस्यों को सुलझा लिया है; वास्तव में, वे स्वीकार करते हैं कि कुछ स्थितियों के लिए, स्व-रिपोर्ट किए गए डेटा की प्रकृति के कारण AI अभी भी एक साधारण बेसलाइन को हराने के लिए संघर्ष करता है। लेकिन उन्होंने पूरे वैज्ञानिक समुदाय को खाना पकाने, प्रयोग करने और उम्मीद है, हमें स्वस्थ रखने के नए तरीकों की खोज करने के लिए एक आधार प्रदान किया है। रसोई अब खुली है, और सामग्रियां किसी के भी उपयोग के लिए तैयार हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →