← नवीनतम पेपर
💻 computer science

Hidden Universal Collapse Behind Apparent Robustness: Dual-Metric Cross-Site Audit of a Laparoscopic Surgical AI Detector

यह अध्ययन प्रदर्शित करता है कि एकल-मीट्रिक मूल्यांकन विशिष्ट वर्गों में स्पष्ट मजबूती को उजागर करके विभिन्न साइटों पर सर्जिकल एआई मॉडलों के सार्वभौमिक पतन को छिपा सकते हैं, जबकि दोहरी-मीट्रिक ऑडिट व्यापक विफलता को प्रकट करती हैं और यह दर्शाती हैं कि हमारे द्वारा परीक्षण किए गए कॉन्फ़िगरेशन में बैकबोन प्रतिस्थापन ने इस अंतर को कम नहीं किया।

मूल लेखक: hui zhu, congbin zhu, Sio Lam UN, QI CHENG, ZHANDONG MENG, qiliang WANG, cong hu, huiying Zhu

प्रकाशित 2026-07-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: hui zhu, congbin zhu, Sio Lam UN, QI CHENG, ZHANDONG MENG, qiliang WANG, cong hu, huiying Zhu

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सर्जन के सहायक के रूप में प्रशिक्षित कर रहे हैं। आप चाहते हैं कि वह सर्जरी के एक वीडियो को देखे और तुरंत महत्वपूर्ण चीजों की ओर इशारा करे: "यह एक स्कैल्पल है," "यह एक रक्त वाहिका (blood vessel) है," "यह कोलन है।" यह क्षेत्र सर्जिकल सीन अंडरस्टैंडिंग (Saryical Scene Understanding) कहलाता है। यह एक कंप्यूटर को आँखें और मस्तिष्क देने जैसा है ताकि वह मानव शरीर के भीतर की अस्त-व्यस्त और फिसलन भरी दुनिया में नेविगेट कर सके। लेकिन यहाँ एक पेचीदा बात है: रोबोट सामान्यीकरण (generalization) करने में बहुत खराब होते हैं। यदि आप एक रोबोट को आपके लिविंग रूम में एक लाल गेंद पहचानने के लिए प्रशिक्षित करते हैं, तो यदि आप उसे एक अंधेरे बेसमेंट में या थोड़ी दबी हुई लाल गेंद दिखाएंगे, तो वह भ्रमित हो सकता है। चिकित्सा जगत में, यह एक बहुत बड़ी बात है। यदि एक रोबोट किसी खतरनाक उपकरण को सुरक्षित समझ लेता है, या किसी महत्वपूर्ण अंग को पहचान नहीं पाता, तो इसके परिणाम गंभीर हो सकते हैं। लंबे समय से, शोधकर्ता इस बात से चिंतित रहे हैं कि ये AI मॉडल "सुरक्षित क्षेत्रों" में परीक्षण किए जा रहे हैं—उसी अस्पताल के डेटा का उपयोग करके जहाँ उन्हें बनाया गया था—बजाय वास्तविक, अप्रत्याशित दुनिया में परीक्षण करने के जहाँ वास्तव में उनका उपयोग किया जाएगा।

यह शोध पत्र एक विशिष्ट AI रोबोट के बारे में एक जासूसी कहानी है जिसे लैप्रोस्कोपिक सर्जरी (वह प्रकार जिसमें छोटे कैमरों और लंबे उपकरणों का उपयोग होता है) के लिए डिज़ाइन किया गया है। शोधकर्ताओं ने एक मॉडल बनाया जो 15 अलग-अलग चीजों, जैसे कि उपकरण और शरीर के अंगों, को पहचानने में सक्षम है, लेकिन उन्होंने इसे केवल मुख्य भूमि चीन के एक अस्पताल के वीडियो पर प्रशिक्षित किया। फिर, उन्होंने इस "प्रशिक्षित" रोबोट को मकाऊ के एक पूरी तरह से अलग अस्पताल में भेज दिया, जहाँ अलग कैमरे, अलग सर्जन और अलग मरीज थे। वे देखना चाहते थे कि क्या रोबोट अभी भी अपना काम कर सकता है।

कहानी सुरक्षा की एक झूठी भावना के साथ शुरू होती है। जब शोधकर्ताओं ने पहली बार परिणामों को देखा, तो रोबोट एक विशिष्ट वस्तु पर बहुत अच्छा काम करता हुआ प्रतीत हुआ: ग्रैस्पिंग फोरसेप्स (एक उपकरण जिसका उपयोग ऊतकों को पकड़ने के लिए किया जाता है)। प्रशिक्षण अस्पताल में, रोबमाट इन फोरसेप्स को 90.2% बार पहचानता था। जब उन्होंने मकाऊ में इसका परीक्षण किया, तो इसने अभी भी 81.9% फ्रेम में फोरसेप्स बॉक्स वापस दिया। यह एक छोटी सी गिरावट थी! ऐसा लग रहा था कि रोबोट मजबूत है और वास्तविक दुनिया के लिए तैयार है, जबकि अन्य वस्तुओं (जैसे अल्ट्रासोनिक स्कैल्पल) के मामले में यह पूरी तरह विफल रहा था। ऐसा लग रहा था कि रोबोट के पास फोरसेप्स के लिए एक "सुपरपावर" है लेकिन बाकी सब के लिए वह बेकार है।

लेकिन शोधकर्ताओं ने एक दूसरे, अधिक सख्त नियम का उपयोग करके और गहराई से देखने का निर्णय लिया। वे समझ गए कि केवल किसी चीज़ को "देखना" पर्याप्त नहीं है; वास्तविक सर्जरी में भरोसा करने के लिए रोबोट को यह सुनिश्चित करने की आवश्यकता है कि वह उसे देख रहा है। उन्होंने एक "स्ट्रॉन्ग-डिटेक्शन" (Strong-Detection) परीक्षण पेश किया: रोबोट तभी गिनता है जब वह बहुत आश्वस्त हो (0.25 या उससे अधिक के कॉन्फिडेंस स्कोर के साथ)।

जब उन्होंने इस सख्त नियम को लागू किया, तो कहानी में मोड़ आया। फोरसेप्स की वह "सुपरपावर" गायब हो गई। अचानक, रोबोट मकाऊ में केवल 1.4% समय ही आत्मविश्वास के साथ फोरसेप्स को पहचान पा रहा था। वह अभी भी फोरसेप्स के चारों ओर बॉक्स बना रहा था, लेकिन वह बहुत कम आत्मविश्वास के साथ फुसफुसा रहा था, "मुझे लगता है कि यह शायद एक फोरसेप्स है?" वास्तव में, रोबोट सभी महत्वपूर्ण वस्तुओं पर विफल हो गया था, न कि केवल कठिन वस्तुओं पर। वह "मजबूती" फोरसेप्स के लिए एक भ्रम था जो एक कमजोर मापने के पैमाने का उपयोग करने से पैदा हुआ था।

शोध पत्र ने इस रोबोट को एक "ब्रेन अपग्रेड" देकर ठीक करने की कोशिश भी की। उन्होंने इसके मानक मस्तिष्क को EndoViT नामक एक शानदार, प्री-ट्रेंड सुपर-ब्रेन से बदल दिया, जिसने पहले ही 7,00,000 सर्जरी वीडियो देखे थे। आप सोचेंगे कि इससे मदद मिलेगी, है ना? आश्चर्यजनक रूप से, इसने मदद नहीं की। जिस तरह से उन्होंने मस्तिष्क को बदला, उससे अंतर कम नहीं हुआ; अपग्रेड किया गया रोबोट बहुत खराब प्रदर्शन करता है, मूल साधारण रोबोट की तुलना में लगभग 150 गुना बदतर। यह सुझाव देता है कि समस्या में केवल अधिक डेटा डालना समाधान नहीं है; रोबोट को कई अलग-अलग स्थानों के डेटा पर प्रशिक्षित करने की आवश्यकता है, न कि केवल एक पर।

अंत में, शोधकर्ताओं ने एक उपकरण बनाया यह जांचने के लिए कि क्या अन्य प्रसिद्ध सर्जरी डेटासेट "चीटिंग" कर रहे थे। उन्होंने पाया कि जबकि एक डेटासेट साफ था, दूसरा लोकप्रिय डेटासेट (EndoVis 2017) में एक छिपा हुआ दोष था: यह रोबोट का परीक्षण उसी वीडियो के अंत पर कर रहा था जिसका उपयोग प्रशिक्षण के लिए किया गया था। यह एक छात्र को गणित का टेस्ट देने जैसा है, और फिर उसे वही टेस्ट देने जैसा है लेकिन पिछले पेज से शुरू करके और उसे एक "नया" एग्जाम कहना। रोबोट ने गणित नहीं सीखा, बल्कि उत्तर रट लिए थे।

संक्षेप में, यह शोध पत्र हमें चेतावनी देता है: एक रोबोट पर केवल इसलिए भरोसा न करें क्योंकि वह एक आसान टेस्ट में अच्छा दिखता है। यदि आप केवल यह देखते हैं कि वह चीजों को "देख" रहा है, तो आप इस तथ्य को मिस कर सकते हैं कि वह वास्तव में अंधे होकर अनुमान लगा रहा है। यह जानने के लिए कि क्या एक सर्जिकल AI वास्तव में तैयार है, आपको इसे नई जगहों पर परीक्षण करना होगा और मांग करनी होगी कि यह केवल भाग्यशाली नहीं, बल्कि आत्मविश्वासी भी हो। "यूनिवर्सल कोलैप्स" (Universal Collapse) का अर्थ है कि इन सख्त जांचों के बिना, ये रोबोट लैब से बाहर निकलने पर पूरी तरह विफल हो सकते हैं, चाहे वे कागज़ पर कितने भी अच्छे क्यों न दिखें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →