← नवीनतम पेपर
🤖 AI

EgoMAGIC- An Egocentric Video Field Medicine Dataset for Training Perception Algorithms

यह शोध पत्र EgoMAGIC को प्रस्तुत करता है, जो एक बड़े पैमाने का एर्गोसेंट्रिक (egocentric) मेडिकल वीडियो डेटासेट है जिसे एक्शन डिटेक्शन, ऑब्जेक्ट आइडेंटिफिकेशन और एरर करेक्शन जैसे कार्यों के माध्यम से AR-एकीकृत वर्चुअल असिस्टेंट के विकास को समर्थन देने के लिए डिज़ाइन किया गया है।

मूल लेखक: Brian VanVoorst, Nicholas Walczak, Christopher Gilleo, Charles Meissner, Fabio Felix, Iran Roman, Bea Steers, Claudio Silva, Yuhan Shen, Zijia Lu, Shih-Po Lee, Ehsan Elhamifar

प्रकाशित 2026-04-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Brian VanVoorst, Nicholas Walczak, Christopher Gilleo, Charles Meissner, Fabio Felix, Iran Roman, Bea Steers, Claudio Silva, Yuhan Shen, Zijia Lu, Shih-Po Lee, Ehsan Elhamifar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप युद्ध के मैदान के बीचों-बीच एक मेडिक (चिकित्सक) हैं। आप थके हुए हैं, वातावरण शोर-शराबे वाला और अस्त-व्यस्त है, और आपको एक जीवन रक्षक प्रक्रिया करनी है—जैसे कि टूर्निकेट लगाना या वायुमार्ग (airway) साफ करना—लेकिन आप खुद पर संदेह कर रहे हैं। आप चाहते हैं कि आपके कान में एक "डिजिटल को-पायलट" फुसफुसा रहा हो, जो कह रहा हो, "बहुत अच्छे, आपने दबाव डाल दिया है; अब, चेस्ट सील (chest seal) उठाएं।"

यह शोध पत्र EgoMAGIC को पेश करता है, जो एक विशाल डिजिटल प्रशिक्षण मैदान है जिसे ठीक इसी तरह के "डिजिटल को-पायलट" को बनाने के लिए डिज़ाइन किया गया है।

यह कैसे काम करता है, इसका विवरण यहाँ दिया गया है, जिसमें कुछ सरल उपमाओं का उपयोग किया गया है:

1. "फर्स्ट-पर्सन" परिप्रेक्ष्य (गोप्रो व्यू)

अधिकांश AI को "थर्ड-पर्सन" वीडियो (जैसे कोई फिल्म देखना) देखकर प्रशिक्षित किया जाता है। लेकिन यदि आप चाहते हैं कि कोई AI एक मेडिक की मदद करे, तो उसे वह देखना होगा जो मेडिक देख रहा है।

इसे एक वीडियो गेम खेलने के रूप में समझें। आप कमरे के दूसरी ओर से टीवी स्क्रीन पर एक पेशेवर खिलाड़ी को देखते हुए नहीं सीखते; आप चरित्र की आँखों से देखकर सीखते हैं। EgoMAGIC एक संग्रह है जिसमें 3,300 से अधिक वीडियो शामिल हैं जिन्हें हेड-माउंटेड कैमरा से रिकॉर्ड किया गया है। यह मेडिक की "आँखें" हैं, जो ठीक वही कैप्चर करती हैं जो उनके हाथ कर रहे हैं और वे कौन से उपकरण उठा रहे हैं।

2. डेटासेट (अल्टीमेट मेडिकल टेक्स्टबुक)

यदि आप किसी बच्चे को जानवरों को पहचानना सिखाना चाहते हैं, तो आप उसे केवल एक कुत्ते की तस्वीर नहीं दिखाते; आप उसे हजारों कुत्ते दिखाते हैं—बड़े कुत्ते, छोटे कुत्ते, रोएँदार कुत्ते और बारिश में भीगते कुत्ते।

EgoMAGIC एक विशाल, हाई-टेक टेक्स्टबुक की तरह है। इसमें शामिल हैं:

  • 50 अलग-अलग चिकित्सा कार्य (भारी रक्तस्राव रोकने से लेकर किसी को सांस लेने में मदद करने तक)।
  • लाखों लेबल। कल्पना कीजिए कि यदि टेक्स्टबुक के हर एक ऑब्जेक्ट पर एक चमकता हुआ स्टिकर लगा हो जो ठीक से बता रहा हो कि वह क्या है (जैसे, "यह एक बैंडेज है," "यह एक स्कैल्पल है")। शोधकर्ताओं ने AI के लिए बिल्कुल यही किया।

3. चुनौती (द "फास्ट एंड मैसी" प्रॉब्लम)

AI को बिल्ली पहचानना सिखाना आसान है क्योंकि बिल्ली आमतौर पर स्थिर रहती है। चिकित्सा चरणों को पहचानना AI को सिखाना ऐसा है जैसे एक अंधेरे कमरे में रोलर कोस्टर की सवारी करते समय एक किताब पढ़ने की कोशिश करना।

शोधकर्ता बताते हैं कि चिकित्सा कार्य AI के लिए बहुत कठिन क्यों हैं क्योंकि:

  • "पलक झपकते ही छूट जाने वाले" चरण: कुछ चिकित्सा क्रियाएं एक सेकंड से भी कम समय में होती हैं।
  • "दोहरा काम करना" (Double-tasking): एक मेडिक एक साथ दो चीजें कर सकता है (जैसे घाव को बंद रखने के साथ-साथ किसी उपकरण की ओर हाथ बढ़ाना)।
  • "अव्यवस्था" (Clutter): वातावरण अस्त-व्यस्त होता है, हाथ फ्रेम के अंदर-बाहर होते रहते हैं, और चीजें इधर-उधर टकराती रहती हैं।

4. "ब्रेन" मॉडल्स (छात्र)

यह पेपर तीन अलग-अलग "छात्र" AI मॉडल्स का परीक्षण करता है ताकि यह देखा जा सके कि कौन सा मॉडल चिकित्सा चरणों को सबसे अच्छी तरह सीखता है:

  • RNN (द स्टोरीटेलर): यह मॉडल यह अनुमान लगाने के लिए कि अभी क्या हो रहा है, यह याद रखने की कोशिश करता है कि एक क्षण पहले क्या हुआ था। यह उस व्यक्ति की तरह है जो कहता है, "चूंकि उसने अभी गॉज (gauze) उठाया है, इसलिए वह शायद अब घाव को लपेटने वाला है।"
  • ट्रांसफॉर्मर (द पैटर्न मैचर): यह मॉडल पूरे दृश्य को एक साथ देखता है, जटिल पैटर्न की तलाश करता है। यह एक मास्टर शेफ की तरह है जो एक बिखरी हुई रसोई को देखकर तुरंत जान जाता है कि रेसिपी का कौन सा चरण चल रहा है।
  • TAS (द सेगमेंटर): यह मॉडल क्रियाओं का एक "टाइमलाइन" बनाने की कोशिश करता है।

परिणाम? "स्टोरीटेलर" और "पैटर्न मैचर" ने सबसे अच्छा प्रदर्शन किया, जिससे यह सिद्ध हुआ कि एक मेडिक की मदद करने के लिए, AI को केवल एकल चित्रों को देखने के बजाय समय के प्रवाह (flow) को समझने की आवश्यकता है।

यह क्यों मायने रखता है?

भविष्य में, यह शोध डॉक्टरों और कॉम्बैट मेडिक्स के लिए ऑगमेंटेड रियलिटी (AR) चश्मे का मार्ग प्रशस्त कर सकता है। काम करते समय, चश्मे अगले आवश्यक उपकरण को हाइलाइट कर सकते हैं या यदि वे कोई महत्वपूर्ण चरण छोड़ देते हैं, तो लाल चेतावनी फ्लैश कर सकते हैं। EgoMAGIC आज वह आधार तैयार कर रहा है ताकि कल के "डिजिटल को-पायलट" जीवन बचा सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →