Sense and Sensibility: Sensible Quality Control and Data Decision-Making in Passive Sensing Data for Adolescent Substance Use Risk Prediction
यह शोधपत्र किशोरों में मादक द्रव्य सेवन के जोखिम की भविष्यवाणी में सुधार के लिए स्मार्टफोन और वियरेबल्स से प्राप्त पैसिव सेंसिंग डेटा के प्रीप्रोसेसिंग हेतु सिद्धांतपूर्ण सिफारिशें प्रदान करता है, जिसमें ABCD अध्ययन का उपयोग यह दर्शाने के लिए किया गया है कि कैसे कठोर डेटा गुणवत्ता नियंत्रण और पारदर्शी फीचर इंजीनियरिंग आउटलियर हैंडलिंग, प्लेटफॉर्म अंतर और प्रोटोकॉल विचलन जैसी चुनौतियों का समाधान कर सकती है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक खिड़की से किशोरों को देखकर उनकी दैनिक आदतों को समझने की कोशिश कर रहे हैं। आप उन्हें सोते हुए, चलते हुए या अपने फोन को घूरते हुए देख सकते हैं, लेकिन जब तक आप उनके साथ कमरे के अंदर नहीं होते, आप पूरी तस्वीर नहीं देख सकते। दशकों से, वैज्ञानिक किशोरों पर अपनी ज़िंदगी के बारे में सर्वेक्षण (सर्वे) भरने के लिए निर्भर रहे हैं, उनसे यह याद रखने के लिए पूछा गया है कि उन्होंने कितने घंटे नींद ली या वे कितना चले। लेकिन स्मृति दोषपूर्ण होती है, और लोग अक्सर अपनी आदतों को भूल जाते हैं या गलत तरीके से रिपोर्ट करते हैं। एक नया दृष्टिकोण युवाओं को स्मार्टफोन और पहनने योग्य फिटनेस ट्रैकर देना है जो वास्तविक दुनिया में उनकी गतिविधियों, नींद के पैटर्न और फोन के उपयोग को चुपचाप रिकॉर्ड करते हैं। यह विधि, जिसे 'पैसिव सेंसिंग' (passive sensing) कहा जाता है, व्यवहार की एक निरंतर और वस्तुनिष्ठ खिड़की प्रदान करती है। हालाँकि, केवल इसलिए कि एक उपकरण डेटा रिकॉर्ड करता है, इसका मतलब यह नहीं है कि वह डेटा हमेशा सटीक या उपयोग में आसान होता है। उपकरण खराब हो सकते हैं, सॉफ्टवेयर में गड़बड़ी हो सकती है, और तकनीक के साथ किशोरों का व्यवहार बहुत भिन्न होता है। इससे पहले कि वैज्ञानिक इस सूचना के सैलाब का उपयोग स्वास्थ्य जोखिमों, जैसे कि किसी किशोर द्वारा नशीली दवाओं या शराब का सेवन शुरू करने की संभावना का अनुमान लगाने के लिए कर सकें, उन्हें पहले यह सीखना होगा कि डेटा को कैसे साफ किया जाए, यानी यह तय करना कि कौन से नंबर वास्तविक हैं और कौन से गलतियाँ हैं।
शोधकर्ताओं की एक टीम ने अमेरिकी युवाओं के एक विशाल, दीर्घकालिक अध्ययन, जिसे 'एडोलेसेंट ब्रेन कॉग्निटिव डेवलपमेंट स्टडी' कहा जाता है, के डेटा का उपयोग करके इन उलझी हुई समस्याओं को हल करने का लक्ष्य रखा। उन्होंने लगभग 5,000 किशोरों के एक समूह पर ध्यान केंद्रित किया जो लगभग 13 या 14 वर्ष के थे और जिन्होंने तीन सप्ताह के लिए एक फिटनेस ट्रैकर पहनने और अपने फोन पर एक विशेष ऐप का उपयोग करने की सहमति दी थी। लक्ष्य यह देखना था कि क्या इस डिजिटल डेटा के पैटर्न यह पहचानने में मदद कर सकते हैं कि किन युवाओं में नशीले पदार्थों के उपयोग का उच्च जोखिम है। लेकिन जैसे ही उन्होंने नंबरों को देखना शुरू किया, शोधकर्ताओं ने पाया कि डेटा पूर्ण नहीं था। कुछ किशोरों ने गतिविधि के केवल कुछ ही दिन रिकॉर्ड किए थे, जबकि अन्य के पास हफ्तों का डेटा था। कुछ के पास अजीब रीडिंग थी, जैसे 24 घंटे लगातार सोना या बिल्कुल भी न हिलना। टीम को यह तय करना था कि इन विसंगतियों को कैसे संभाला जाए बिना उन व्यवहारों को हटाए जो किसी समस्या का संकेत दे सकते हैं।
शोधकर्ताओं ने पाया कि सबसे चरम और अकल्पनीय नंबर आमतौर पर उन किशोरों से आते थे जिन्होंने अपने उपकरणों को सबसे कम पहना था। यदि कोई व्यक्ति केवल एक दिन के लिए अपना ट्रैकर पहनता है और उस दिन वह बहुत निष्क्रिय रहता है, तो कंप्यूटर यह गणना कर सकता है कि वह हमेशा निष्क्रिय रहता है। इससे यह संकेत मिला कि अजीब नंबर आवश्यक रूप से एक खतरनाक जीवनशैली के संकेत नहीं थे, बल्कि अधूरे डेटा के संकेत थे। हर उस डेटा पॉइंट को हटाने के बजाय जो अजीब दिखता था, टीम ने पहले व्यक्ति को देखने का निर्णय लिया। उन्होंने एक नियम बनाया कि किसी भी किशोर को अध्ययन में शामिल होने के लिए कम से कम पांच कार्यदिवस (weekdays) और दो सप्ताहांत (weekend) के डेटा की आवश्यकता होगी। इस दृष्टिकोण ने उन्हें उन किशोरों को बनाए रखने की अनुमति दी जिनका नींद या गतिविधि का पैटर्न अनियमित था, जब तक कि उनके पास पर्याप्त डेटा हो जिससे यह दिखाया जा सके कि वे पैटर्न वास्तविक थे न कि केवल एक खराब दिन का संयोग। ऐसा करके, उन्होंने किशोर जीवन की अव्यवस्थपूर्ण और अनियमित वास्तविकता को संरक्षित किया, जो अक्सर स्वास्थ्य जोखिमों के बारे में सबसे महत्वपूर्ण सुराग छिपे होते हैं।
टीम ने यह भी पाया कि एक किशोर जिस प्रकार का फोन उपयोग करता है, उससे डेटा आश्चर्यजनक तरीकों से बदल जाता है। अध्ययन ने यह रिकॉर्ड करने के लिए एक प्रणाली का उपयोग किया कि किशोरों ने अपने फोन पर कितना समय टाइप करने में बिताया। हालाँकि, यह प्रणाली आईफोन (iPhone) की तुलना में एंड्रॉइड (Android) फोन पर अलग तरह से काम करती थी। आईफोन पर, सिस्टम तब तक टाइपिंग रिकॉर्ड नहीं कर सकता था जब तक कि उपयोगकर्ता अध्ययन द्वारा प्रदान किए गए विशेष कीबोर्ड पर स्विच न करे। शोधकर्ताओं को संदेह था कि कई आईफोन उपयोगकर्ताओं को यह स्विच करना कष्टप्रायक लगा और वे अपने सामान्य कीबोर्ड पर वापस आ गए, जिसका अर्थ था कि अध्ययन में उनकी बहुत सारी टाइपिंग गतिविधि छूट गई। जब उन्होंने दर्ज किए गए डेटा की तुलना उन कार्यों से की जो किशोरों ने वास्तव में किए थे, तो उन्होंने पाया कि आईफोन उपयोगकर्ता वास्तव में जितना टाइप करते थे, उससे बहुत कम टाइप करते हुए दिखाई दिए, विशेष रूप से जब उनका उपयोग कम था। इसका मतलब था कि डेटा न केवल अलग था; यह एक समूह के खिलाफ व्यवस्थित रूप से पक्षपाती था। शोधकर्ताओं ने निष्कर्ष निकाला कि वे इस अंतर को ध्यान में रखे बिना दोनों प्रकार के फोन के डेटा को बस एक साथ नहीं मिला सकते हैं, और उन्हें फोन ऑपरेटिंग सिस्टम को विश्लेषण में एक प्रमुख कारक के रूप में मानना होगा।
एक अन्य चुनौती यह तय करना था कि किन दिनों को गिना जाए। अध्ययन में तीन सप्ताह की एक विशिष्ट अवधि थी जहाँ शोधकर्ता सक्रिय रूप से प्रतिभागियों की निगरानी कर रहे थे। हालाँकि, उपकरण अध्ययन शुरू होने से पहले और समाप्त होने के बाद भी डेटा रिकॉर्ड करते रहे। शोधकर्ताओं ने आधिकारिक अध्ययन सप्ताहों के दौरान के व्यवहार की तुलना अतिरिक्त दिनों के दौरान के व्यवहार से की। उन्होंने पाया कि जब किशोरों को पता होता है कि उन्हें देखा जा रहा है बनाम जब उन्हें नहीं देखा जा रहा होता है, तो वे अलग तरह से व्यवहार करते हैं। आधिकारिक सप्ताहों के दौरान, उनकी नींद और गतिविधि के पैटर्न एक-दूसरे के अनुरूप थे। लेकिन अध्ययन की अवधि के बाहर के दिनों में, पैटर्न अनियमित और अप्रत्याशित हो गए। इससे टीम ने यह निर्णय लिया कि केवल आधिकारिक तीन सप्ताह की अवधि के दौरान एकत्र किया गया डेटा ही उपयोग के लिए पर्याप्त विश्वसनीय था। उन्होंने अतिरिक्त दिनों को हटा दिया, यह महसूस करते हुए कि अधिक डेटा हमेशा बेहतर नहीं होता यदि वह डेटा एक अलग संदर्भ से आता है।
अंत में, शोधकर्ताओं को इन कच्चे नंबरों को ऐसे टूल में बदलने के लिए बनाना था जिसे कंप्यूटर समझ सके। उन्हें ऐसी विशेषताएं (features) बनानी थीं जो न केवल यह बताएं कि एक किशोर कितना सोया, बल्कि यह भी कि उसकी नींद कितनी सुसंगत थी। उन्हें आधी रात के आसपास घड़ी के घूमने के तरीके से भ्रमित हुए बिना रात 11:00 बजे और 1:00 बजे के बीच के अंतर को कैसे मापा जाए, यह भी समझना था। उन्हें डेटा में त्रुटियों को भी साफ करना था जिन्हें अध्ययन आयोजकों ने मिस कर दिया था, जैसे कि गायब मान (missing values) जिन्हें गलती से शून्य के रूप में चिह्नित किया गया था, जिससे एक किशोर ऐसा लग सकता था कि वह कभी हिला ही नहीं जबकि वास्तव में वह हिला था। इस सारी सावधानीपूर्वक सफाई और संगठन के बाद, टीम के पास 428 किशोरों का एक छोटा समूह बचा, लेकिन उन्हें विश्वास था कि इस समूह का डेटा भरोसेमंद है।
यह शोध पत्र यह दावा नहीं करता कि इसने नशीले पदार्थों के उपयोग की भविष्यवाणी करने का एक आदर्श तरीका खोज लिया है, न ही यह कहता है कि डिजिटल डेटा की समस्याएं हल हो गई हैं। इसके बजाय, यह अन्य वैज्ञानिकों के लिए नियमों का एक सेट प्रदान करता है जो इस प्रकार के डेटा का उपयोग करना चाहते हैं। मुख्य सबक यह है कि शोधकर्ताओं को इस बात के प्रति सावधान रहना चाहिए कि वे आउटलेयर्स (outliers) और छूटी हुई जानकारी को कैसे संभालते हैं। उन्हें केवल अजीब नंबरों को हटा नहीं देना चाहिए, क्योंकि वे नंबर सबसे महत्वपूर्ण हो सकते हैं। उन्हें यह भी जांचना चाहिए कि क्या डेटा उपयोग किए गए उपकरण या डेटा एकत्र किए जाने के समय के आधार पर बदलता है। इन चरणों का पालन करके, वैज्ञानिक यह सुनिश्चित कर सकते हैं कि उनके निष्कर्ष उन किशोरों के वास्तविक जीवन को दर्शाते हैं जिनका वे अध्ययन कर रहे हैं, न कि उन मशीनों की गलतियों को जिनका वे उपयोग कर रहे हैं। यह कार्य एक अराजक डिजिटल संकेतों की धारा को किशोर व्यवहार की स्पष्ट तस्वीर में बदलने के लिए एक रोडमैप प्रदान करता है, जो युवाओं को स्वस्थ रहने में मदद करने के लिए बेहतर उपकरण बनाने का मार्ग प्रशस्त करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।