Premarket transparency and postmarket observability in FDA-authorized AI-enabled medical devices: a source-linked cross-sectional study
FDA-अधिकृत AI-सक्षम चिकित्सा उपकरणों का यह क्रॉस-सेक्शनल अध्ययन यह प्रकट करता है कि हालांकि हाल के वर्षों में प्रीमार्केट रिपोर्टिंग की पूर्णता में महत्वपूर्ण सुधार हुआ है, फिर भी भविष्योन्मुखी साक्ष्य (प्रोस्पेक्टिव एविडेंस) का दस्तावेजीकरण विरल बना हुआ है और पोस्टमार्केट अवलोकन असमान है, जो डिवाइस रैंकिंग या असमर्थित सुरक्षा निष्कर्षों के बजाय साक्ष्य निगरानी का समर्थन करने के लिए पारदर्शिता उपायों की आवश्यकता को रेखांकित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
चिकित्सा तकनीक की दुनिया की कल्पना एक विशाल, हलचल भरी लाइब्रेरी के रूप में करें जहाँ हर नई खोज को एक विशेष आईडी कार्ड मिलता है। वर्षों से, इस लाइब्रेरी में सबसे रोमांचक नई किताबें "स्मार्ट" कंप्यूटरों द्वारा लिखी जा रही हैं—कृत्रिम बुद्धिमत्ता (AI) जो डॉक्टरों को बीमारियों का पता लगाने, एक्स-रे पढ़ने या दिल की धड़कन की निगरानी करने में मदद कर सकती है। लेकिन पेचीदा बात यह है कि सिर्फ इसलिए कि एक किताब का कवर चमकदार और नया है, इसका मतलब यह नहीं है कि हमें पता है कि उसके अंदर वास्तव में क्या लिखा है, या क्या वह कहानी तब भी सही रहती है जब रोशनी कम हो जाती है और वास्तविक दुनिया जटिल हो जाती है।
यह समझने के लिए कि क्या ये AI डॉक्टर काम के लिए तैयार हैं, हमें दो अलग-अलग चीजों को देखने की आवश्यकता है। पहला, "प्रीमार्केट" (बिक्री-पूर्व) जांच। यह वैसा ही है जैसे लेखक अपनी किताब बाजार में लाने से पहले एक सख्त लाइब्रेरियन (FDA) को अपना होमवर्क दिखाता है। हम जानना चाहते हैं: क्या उन्होंने इसे विभिन्न प्रकार के लोगों पर परखा? क्या उन्होंने इसे कई अलग-अलग अस्पतालों में आजमाया? क्या उन्होंने अपने जवाबों के पीछे के गणित को दिखाया? दूसरा, "पोस्टमार्केट" (बिक्री-पश्चात) जांच। यह तब होता है जब किताब बिक चुकी होती है। यह एक लाइब्रेरी के "रीडर फीडबैक" (पाठक प्रतिक्रिया) बॉक्स को देखने जैसा है। यदि किसी किताब में कोई टाइपिंग की गलती है या कोई भ्रमित करने वाला अध्याय है, तो क्या लोग शिकायत करने के लिए पत्र लिखते हैं? यदि लाइब्रेरी में पर्याप्त फीडबैक फॉर्म नहीं हैं, या यदि फॉर्म गायब हैं, तो हम वास्तव में यह नहीं बता पाएंगे कि वह किताब सभी के लिए सुरक्षित है या नहीं। बड़ा सवाल यह है: क्या नए AI मेडिकल डिवाइस हमें अपना होमवर्क दिखाने में बेहतर हो रहे हैं, और क्या हम वास्तव में देख सकते हैं कि उनके काम शुरू करने के बाद उनके फीडबैक फॉर्म कैसे दिखते हैं?
होमवर्क चेक: क्या लेखक अपना काम दिखा रहे हैं?
इस अध्ययन में, ओल्गा लाविंडा नामक एक शोधकर्ता ने एक बहुत ही गहन लाइब्रेरियन की भूमिका निभाने का निर्णय लिया। उन्होंने 2011 से मार्च 2026 के बीच लिए गए 1,491 विभिन्न निर्णयों को देखते हुए FDA की सार्वजनिक सूची की जांच की। वह यह नहीं देख रही थीं कि उपकरण दोषरहित थे या नहीं; वह केवल यह देख रही थीं कि क्या सार्वजनिक सारांश (लाइब्रेरियन को सौंपा गया "होमवर्क") वास्तव में महत्वपूर्ण बातें बताता है।
उन्होंने एक "रिपोर्ट कार्ड" बनाया जिसमें सात प्रमुख आइटम थे जिन्हें वह देखना चाहती थीं:
- क्या उन्होंने वास्तविक रोगी डेटा (patient data) का उपयोग करने का उल्लेख किया?
- क्या उन्होंने यह स्पष्ट स्कोर दिया कि AI ने कितनी अच्छी तरह काम किया?
- क्या उन्होंने रोगियों के विवरण दिए (जैसे आयु या लिंग)?
- क्या उन्होंने AI का परीक्षण एक से अधिक अस्पताल में किया?
- क्या उन्होंने इसे उस डेटा पर परखा जिसे AI ने पहले कभी नहीं देखा था?
- क्या उन्होंने विभिन्न प्रकार के स्कैनर या मशीनों का उपयोग किया?
- क्या उन्होंने लोगों के विशिष्ट समूहों पर अपने प्रदर्शन को दिखाया?
परिणाम अच्छे समाचार और "अभी भी काम चल रहा है" वाले समाचारों का मिश्रण थे। शुरुआती दिनों में (2011-2020), इन उपकरणों में से केवल लगभग 16.5% के पास ऐसे सारांश थे जिनमें इन सात में से पांच बॉक्स चेक किए गए थे। लेकिन जब तक हम 2024-2026 तक पहुँचे, वह संख्या बढ़कर 59.5% हो गई। ऐसा लगता है जैसे लेखकों ने अचानक अपनी कहानियों के बहुत विस्तृत परिचय लिखना शुरू कर दिया है। वे यह बताने के लिए बहुत अधिक इच्छुक थे कि, "हमने इसे तीन अस्पतालों में परखा," या "हमने सुनिश्चित किया कि यह विभिन्न आयु वर्ग के लोगों पर काम करे।"
हालाँकि, एक चीज़ ऐसी थी जिसमें बहुत सुधार नहीं हुआ: "प्रॉस्पेक्टिव या रीडर स्टडी" (Prospective or Reader Study)। यह एक फैंसी तरीका है यह कहने का कि, "क्या हमने इसे वास्तविक मरीजों पर परखा, जो चलते हुए आए, या क्या हमने डॉक्टरों के एक समूह को AI के जवाबों को देखने दिया ताकि वे देख सकें कि क्या वे सहमत हैं?" यह पूरे वर्षों में लगभग 16-18% पर स्थिर रहा, जो कि बहुत दुर्लभ बना रहा। यह ऐसा है जैसे लेखक अभी भी हमें अपने अभ्यास टेस्ट (practice tests) दिखा रहे हैं, न कि वास्तविक समय में ली गई अंतिम परीक्षा।
फीडबैक बॉक्स: इसके बाद क्या होता है, क्या हम देख सकते हैं?
एक बार जब ये उपकरण दुनिया में आ जाते हैं, तो शोधकर्ता ने "पोस्टमार्केट" पक्ष को देखा। उन्होंने प्रत्येक उपकरण को उसके सार्वजनिक फीडबैक इतिहास से जोड़ने का प्रयास किया, विशेष रूप रूप से MAUDE डेटाबेस (एक प्रणाली जहाँ डॉक्टर और अस्पताल समस्याओं की रिपोर्ट करते हैं) को देखा।
यहाँ, कहानी थोड़ी जटिल हो जाती है। 1,477 उपकरणों में से जिन्हें वह फीडबैक रिकॉर्ड से जोड़ सकीं, उनमें से केवल लगभग 54% के पास इतना इतिहास था कि एक ट्रेंड (रुझान) की गणना की जा सके। इसे एक नए रेस्टोरेंट को आंकने जैसा समझें। यदि रेस्टोरेंट पिछले सप्ताह खुला है, तो आप वास्तव में यह नहीं बता सकते कि खाना अच्छा है या बुरा क्योंकि अभी तक पर्याप्त लोगों ने वहां खाना नहीं खाया है ताकि वे समीक्षा छोड़ सकें। अध्ययन में पाया गया कि नवीनतम उपकरणों (2024-2026) के लिए, केवल लगभग 45% के पास विश्लेषण के लिए पर्याप्त सार्वजनिक फीडबैक इतिहास था। पुराने उपकरणों (2011-2020) के लिए, यह संख्या 71.7% अधिक थी।
शोधकर्ता ने "रिकॉल" (जब किसी उपकरण को शेल्फ से वापस ले लिया जाता है) को भी देखा। उन्होंने पाया कि पिछले दो वर्षों में लगभग 47.7% उपकरणों के लिए उनके उत्पाद श्रेणी में कहीं न कहीं रिकॉल नोटिस था। लेकिन वह बहुत सावधानी से यह कहती हैं कि इसका मतलब यह नहीं है कि उस विशिष्ट उपकरण को वापस लिया गया था। यह पूरे ब्रांड की कारों के लिए "चेतावनी: अपने टायर चेक करें" नोटिस देखने जैसा है; इसका मतलब यह नहीं है कि आपकी विशिष्ट कार का टायर पंचर है, बल्कि यह है कि उस श्रेणी में कुछ समस्याएं हैं।
बड़ी तस्वीर
तो, इस सब का क्या अर्थ है? अध्ययन बताता है कि AI मेडिकल उपकरणों के लिए सार्वजनिक "होमवर्क" बहुत अधिक पूर्ण होता जा रहा है। निर्माता हमें यह बताने में बेहतर काम कर रहे हैं कि उन्होंने अपने उपकरणों का परीक्षण कहाँ किया और उन्होंने किन लोगों पर परीक्षण किया। हालाँकि, "अंतिम परीक्षा" जहाँ वे वास्तविक मरीजों पर होते समय परीक्षण करते हैं, अभी भी दुर्लभ है।
इसके अलावा, भले ही होमवर्क बेहतर हो रहा है, लेकिन नवीनतम उपकरणों के लिए "फीडबैक बॉक्स" अक्सर खाली होता है क्योंकि वे समीक्षा करने वालों की भीड़ जुटाने के लिए पर्याप्त समय से बाहर नहीं आए हैं। शोधकर्ता इस बात पर जोर देती हैं कि सिर्फ इसलिए कि एक सारांश विस्तृत है इसका मतलब यह नहीं है कि उपकरण पूर्ण है, और सिर्फ इसलिए कि हमें सार्वजनिक फीडबैक बॉक्स में कोई समस्या नहीं दिख रही है, इसका मतलब यह नहीं है कि कोई समस्या नहीं है—हो सकता है कि अभी बताना बहुत जल्दी हो।
संक्षेप में, लाइब्रेरी किताबों को व्यवस्थित करने और स्पष्ट सारांश लिखने में बेहतर हो रही है, लेकिन हमें अभी थोड़ा और इंतजार करना होगा यह देखने के लिए कि क्या वास्तविक दुनिया में सबके पढ़ने पर ये कहानियाँ टिक पाती हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।