← नवीनतम पेपर
💻 computer science

Surgical Visual Understanding (SurgVU) Dataset

यह शोध पत्र सर्जिकल विजुअल अंडरस्टैंडिंग (SurgVU) डेटासेट प्रस्तुत करता है, जो रोबोटिक-असिस्टेड सर्जरी वीडियो का एक बड़े पैमाने पर संग्रह है और इसके साथ संलग्न लेबल सर्जिकल डेटा साइंस के भीतर मौलिक अनुसंधान को आगे बढ़ाने और विविध मशीन लर्निंग चुनौतियों को संबोधित करने के लिए डिज़ाइन किए गए हैं।

मूल लेखक: Aneeq Zia, Max Berniker, Rogerio Nespolo, Xiaorui Zhang, Conor Perreault, Ziheng Wang, Benjamin Mueller, Ryan Schmidt, Kiran Bhattacharyya, Xi Liu, Anthony Jarc

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aneeq Zia, Max Berniker, Rogerio Nespolo, Xiaorui Zhang, Conor Perreault, Ziheng Wang, Benjamin Mueller, Ryan Schmidt, Kiran Bhattacharyya, Xi Liu, Anthony Jarc

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखाने की कोशिश कर रहे हैं, लेकिन इसके बजाय आप उसे किसी रेसिपी के बजाय, एक मास्टर शेफ के काटने, चलाने और प्लेटिंग करने के हज़ार घंटों के वीडियो फुटेज दे देते हैं। मूल रूप से यह पेपर यही कर रहा है, लेकिन सर्जरी के लिए।

लेखक, जो 'इंट्यूटिव सर्जिकल' (Intuitive Surgical) की एक टीम है, ने एक विशाल नई "लाइब्रेरी" जारी की है जिसे SurgVU Dataset कहा जाता है। इसे केवल वीडियो के संग्रह के रूप में नहीं, बल्कि एक विशाल, व्यवस्थित पाठ्यपुस्तक के रूप में समझें जो उन कंप्यूटरों के लिए है जो यह सीखने की कोशिश कर रहे हैं कि रोबोटिक सर्जरी के दौरान मानव शरीर के भीतर क्या होता है।

यहाँ उन्होंने जो बनाया है उसका विवरण, सरल उपमाओं का उपयोग करते हुए दिया गया है:

1. "कच्ची सामग्री" (डेटा)

टीम ने 840 घंटे से अधिक का वीडियो रिकॉर्ड किया। इसे समझने के लिए, यदि आप इसे बिना रुके देखेंगे, तो इसमें आपको लगातार लगभग दो महीने लगेंगे।

  • सेटिंग: ये मरीजों पर की जाने वाली वास्तविक सर्जरी नहीं हैं। ये प्रशिक्षण सत्र हैं जहाँ सर्जन 'da Vinci' रोबिकल सिस्टम का उपयोग करके सूअर के ऊतकों (porcine models) पर अभ्यास करते हैं।
  • गुणवत्ता: वीडियो हाई-डेफिनिशन हैं और 60 फ्रेम प्रति सेकंड की दर से रिकॉर्ड किए गए हैं। इसके परिणामस्वरूप लगभग 18 मिलियन व्यक्तिगत चित्र (फ्रेम) मिलते हैं जिन्हें कंप्यूटर का अध्ययन कर सकता है।
  • स्रोत: यह सर्जरी के लिए एक "फ्लाइट सिम्युलेटर" की तरह है, लेकिन केवल पायलट के दृश्य को रिकॉर्ड करने के बजाय, उन्होंने यह भी रिकॉर्ड किया कि पायलट कौन से उपकरण पकड़े हुए था और वह किन युद्धाभ्यासों (maneuvers) का प्रयास कर रहा था।

2. "लेबल" (एनोटेशन)

कच्चा वीडियो कंप्यूटर के लिए समझना कठिन होता है। इसे यह जानने के लिए "लेबल" या टैग की आवश्यकता होती है कि वह क्या देख रहा है। लेखकों ने तीन मुख्य प्रकार के टैग जोड़े हैं:

  • टूल टैग (बर्तन): जैसे रसोई में चम्मच, चाकू और व्हिस्क होते हैं, वैसे ही सर्जिकल रोबोट के पास नीडल ड्राइवर, कैंची और ग्रैस्पर्स जैसे उपकरण होते हैं। डेटासेट कंप्यूटर को बताता है कि फ्रेम में कौन सा टूल है और कब है।
    • चुनौती: कभी-कभी एक टूल ऊतक या रोबोट के हाथ के पीछे छिपा होता है, जिससे कंप्यूटर भ्रमित हो सकता है। लेखक स्वीकार करते हैं कि ये लेबल थोड़े "नॉइजी" (अपूर्ण) हो सकते हैं, जो वास्तव में शोधकर्ताओं के लिए हल करने के लिए एक बेहतरीन चुनौती है।
  • स्टेप टैग (रेसिपी के चरण): डेटा को विशिष्ट "मूव्स" में विभाजित किया गया है, जैसे "सूटिंग" (टांके लगाना) या "रिट्रैक्टिंग" (ऊतक को एक तरफ खींचना)। इन चरणों की आठ मुख्य श्रेणियां हैं।
  • स्टोरी टैग (कमेंट्री): यह नवीनतम जोड़ है। प्रत्येक चरण के लिए, एक लिखित विवरण दिया गया है जो बताता है कि वास्तव में क्या हो रहा है। यह एक कथावाचक (narrator) होने जैसा है जो कहता है, "सर्जन अब 30-डिग्री कैमरा बदल रहा है और कोलन को पकड़ रहा है।" यह कंप्यूटर को यह सीखने में मदद करता है कि वे जो देखते हैं उसे जो वे पढ़ते हैं उससे कैसे जोड़ें।

3. "अभ्यास परीक्षण" (वैलिडेशन सेट)

यह सुनिश्चित करने के लिए कि कंप्यूटर वास्तव में सीख रहे हैं और केवल अनुमान नहीं लगा रहे हैं, टीम ने एक अलग "क्विज़" प्रदान किया है। यह वीडियो का एक छोटा सेट है जहाँ उपकरणों को बक्सों (एक "Where's Waldo?" खेल की तरह) के साथ चिह्नित किया गया है। यह शोधकर्ताओं को अपने एल्गोरिदम का परीक्षण करने की अनुमति देता है कि क्या वे वीडियो में उपकरणों को सही ढंग से पहचान सकते हैं।

4. "क्यों" (लक्ष्य)

लेखक केवल डेटा नहीं डाल रहे हैं; वे पूरी दुनिया के कंप्यूटर विज्ञान को खेलने के लिए आमंत्रित कर रहे हैं। वे विशिष्ट पहेलियों को हल करना चाहते हैं, जैसे कि:

  • रियल-टाइम मार्गदर्शन: क्या एक कंप्यूटर सर्जरी देख सकता है और सर्जन को बता सकता है, "हे, आप एक नस काटने वाले हैं"?
  • बिना शिक्षक के सीखना: क्या कंप्यूटर चरणों को खुद समझ सकता है, भले ही लेबल पूर्ण न हों?
  • कौशल स्कोरिंग: क्या कंप्यूटर एक सर्जन को देख सकता है और उन्हें उनके हाथों की स्थिरता पर ग्रेड दे सकता है?
  • वीडियो-टू-टेक्स्ट: क्या कंप्यूटर एक क्लिप देख सकता है और लिख सकता है कि क्या हुआ था?

निचोड़

SurgVU डेटासेट को एक विशाल, साझा खेल के मैदान के रूप में समझें। इससे पहले, केवल इंट्यूटिव सर्जिकल के पास ही इतने बड़े डेटा तक पहुंच थी। अब, उन्होंने द्वार खोल दिए हैं। उन्हें उम्मीद है कि शोधकर्ताओं को अभ्यास करने के लिए एक सामान्य स्थान देकर, वे स्मार्ट, सुरक्षित और अधिक सहायक रोबोटिक सर्जरी उपकरणों के आविष्कार को तेज कर सकते हैं।

वे स्पष्ट रूप से कहते हैं कि यह अब तक का सबसे बड़ा सार्वजनिक रूप से उपलब्ध सर्जिकल वीडियो डेटासेट है, और वे आशा करते हैं कि यह भविष्य के सभी शोधों के लिए "गोल्ड स्टैंडर्ड" या "मानदंड" बनेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →