← नवीनतम पेपर
💻 computer science

From Phase Grounding to Intelligent Surgical Narratives

यह शोध पत्र एक CLIP-आधारित मल्टी-मोडल फ्रेमवर्क प्रस्तावित करता है जो वीडियो फ्रेम को टेक्स्टुअल जेस्चर विवरणों के साथ संरेखित करके स्वचालित रूप से संरचित सर्जिकल टाइमलाइन और नैरेटिव उत्पन्न करता है, जिससे समय लेने वाले मैनुअल एनोटेशन या अस्पष्ट पोस्ट-ऑपरेटिव रिपोर्ट की आवश्यकता समाप्त हो जाती है।

मूल लेखक: Ethan Peterson, Huixin Zhan

प्रकाशित 2026-03-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ethan Peterson, Huixin Zhan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सर्जन द्वारा किए जा रहे एक बहुत ही सूक्ष्म ऑपरेशन की एक बहुत लंबी, जटिल फिल्म देख रहे हैं। यह एक 45 मिनट की फिल्म की तरह है जहाँ कैमरा शरीर के अंदर ज़ूम करके दिखाया गया है। यदि आप उस हिस्से को ढूँढना चाहते जहाँ सर्जन गांठ बाँध रहा है या किसी विशिष्ट वाहिका (vessel) को काट रहा है, तो आपको पूरी चीज़ को फ्रेम-दर-फ्रेम स्क्रब करना होगा। यह उबाऊ और थका देने वाला है।

वर्तमान में, सर्जनों के पास इसमें मदद करने के लिए दो बुरे विकल्प हैं:

  1. "त्वरित नोट" (Quick Note) विधि: ऑपरेशन के बाद वे कुछ अस्पष्ट वाक्य लिख देते हैं जैसे "हमने सर्जरी की।" यह तेज़ है, लेकिन यह नहीं बताता कि क्या हुआ या कब हुआ।
  2. "मैनुअल एडिटर" (Manual Editor) विधि: वे पूरे वीडियो को देखते हैं और मैन्युअल रूप से एक टाइमलाइन टाइप करते हैं, जैसे "00:05: गांठ बाँधना, 00:12: ऊतक (tissue) काटना।" यह बहुत सटीक है, लेकिन इसमें सर्जन के कीमती समय के कई घंटे लग जाते हैं।

इस शोध पत्र के लेखक एक "स्मार्ट ऑटो-एडिटर" बनाना चाहते हैं। उन्होंने एक सिस्टम बनाया जो सर्जरी के वीडियो को देखता है और स्वचालित रूप से एक स्पष्ट, पठनीय कहानी (कथा) एक टाइमलाइन के साथ लिखता है, ताकि आप सीधे महत्वपूर्ण हिस्सों पर जा सकें।

उन्होंने इसे कैसे किया, इसके लिए कुछ रचनात्मक उपमाओं (analogies) का उपयोग किया गया है:

1. "यूनिवर्सल ट्रांसलेटर" (CLIP)

टीम ने CLIP नामक एक शक्तिशाली AI मॉडल का उपयोग किया। CLIP को एक अत्यंत बुद्धिमान लाइब्रेरियन (पुस्तकालयाध्यक्ष) के रूप में समझें जिसने लाखों किताबें पढ़ी हैं और लाखों तस्वीरें देखी हैं। यह लाइब्रेरियन जानता है कि "कुत्ता" की तस्वीर "कुत्ता" शब्द से मेल खाती है, और "नारंगी आकाश" के वाक्यांश से "सूर्यास्त" की तस्वीर मेल खाती है।

हालाँकि, इस लाइब्रेरियन ने पहले कभी सर्जरी नहीं देखी है। यदि आप उन्हें सुई का उपयोग करते हुए सर्जन का वीडियो दिखाते हैं, तो वे शायद केवल इतना सोचेंगे, "ओह, यह एक व्यक्ति को छड़ी पकड़े हुए जैसा दिखता है।" वे "सूटिंग" (suturing) या "नीडल पासिंग" (needle passing) जैसे चिकित्सा शब्दों को नहीं जानते।

2. पहला चरण: लाइब्रेरियन को "हाथों की हरकतें" (Gestures) सिखाना

इसे ठीक करने के लिए, टीम ने सबसे पहले JIGSAWS नामक एक डेटासेट का उपयोग करके लाइब्रेरियन को सर्जरी की बुनियादी बातें सिखाईं।

  • उपमा: कल्पना कीजिए कि लाइब्रेरियन को उपन्यास लिखने के लिए कहने से पहले उन्हें वर्णमाला (alphabet) सिखा रहे हैं।
  • प्रक्रिया: उन्होंने AI को विशिष्ट हाथ की गतिविधियों (जैसे "सुई के लिए हाथ बढ़ाना" या "धागा खींचना") के हजारों छोटे क्लिप दिखाए। उन्होंने केवल चित्र नहीं दिखाया; उन्होंने हर चित्र के लिए एक टेक्स्ट विवरण भी दिया।
  • परिणाम: AI ने हाथ की हरकत के दृश्य को "सुई के लिए हाथ बढ़ाना" जैसे टेक्स्ट के साथ मिलाना सीख लिया। वह सर्जरी के बारे में कुछ न जानने से लेकर हाथ की गतिविधियों के "शब्दों" को समझने तक पहुँच गया।

3. दूसरा चरण: लाइब्रेरियन को "अध्याय" (Phases) सिखाना

एक बार जब AI "अक्षर" (gestures) समझ गया, तो वे बड़े परिदृश्य की ओर बढ़े, जिसके लिए उन्होंने Cholec80 (जिसमें पित्ताशय हटाने की पूरी सर्जरी शामिल है) नामक डेटासेट का उपयोग किया।

  • उपमा: अब जब लाइब्रेरियन वर्णमाला जानता है, तो वह अध्याय लिखने के लिए तैयार है।
  • प्रक्रिया: उन्होंने उस AI को लिया जो हाथ की गतिविधियों को समझता था और उसे सर्जरी के बड़े "चरणों" (जैसे "त्रिकोण का विच्छेदन करना" या "साइट की सफाई करना") में कैसे फिट होता है, यह सिखाया।
  • जादू: क्योंकि AI पहले से ही छोटी गतिविधियों को समझता था, इसलिए वह बड़ी कहानी को आसानी से समझ सका। यदि आप पहले से व्याकरण जानते हैं, तो एक नई भाषा सीखना बहुत आसान होता है बजाय इसके कि आप शून्य से शुरुआत करें।

4. "स्मार्ट टाइमलाइन"

प्रशिक्षित होने के बाद, यह सिस्टम इस प्रकार कार्य करता है:

  1. आप एक कच्चा (raw) सर्जरी वीडियो फीड करते हैं।
  2. AI वीडियो को फ्रेम-दर-फ्रेम देखता है।
  3. यह कहता है, "आह, मैं सुई के लिए हाथ बढ़ते हुए देख रहा हूँ (Gesture), जिसका अर्थ है कि हम 'नीडल पासिंग' चरण में हैं।"
  4. यह स्वचालित रूप से एक टाइमलाइन बनाता है: "00:00 - सेटअप, 00:15 - काटना, 00:45 - गांठ बांधना।"

यह एक बड़ी बात क्यों है?

शोध पत्र में उनके "दो-चरणीय" तरीके (पहले जेस्चर सीखना, फिर चरण सीखना) का परीक्षण "एक-चरणीय" तरीके (केवल चरणों को तुरंत सीखने की कोशिश करना) के विरुद्ध किया गया।

  • एक-चरणीय विधि: जैसे बिना वर्णमाला जाने उपन्यास लिखने की कोशिश करना। यह संघर्ष करता था और भ्रमित हो जाता था।
  • दो-चरणीय विधि: पहले वर्णमाला सीखने जैसा। यह बहुत अधिक स्मार्ट, अधिक सटीक था, और यह समान दिखने वाली क्रियाओं (जैसे घाव साफ करना बनाम अंग को पीछे खींचना) के बीच अंतर कर सकता था।

निष्कर्ष

लेखकों ने एक ऐसा टूल बनाया है जो एक स्मार्ट, स्वचालित लिपिक (scribe) की तरह कार्य करता है। एक सर्जन द्वारा वीडियो को मैन्युअल रूप से टैग करने में घंटों बिताने के बजाय, यह AI सर्जरी को देखता है, दृश्य क्रियाओं को समझता है, और जो हुआ उसकी एक स्पष्ट, टेक्स्ट-आधारित कहानी लिखता है। यह समय बचाता है, नए सर्जनों को प्रशिक्षित करने में मदद करता है, और रोगी की देखभाल का बेहतर रिकॉर्ड रखता है, और यह सब कंप्यूटर को सर्जरी की भाषा "बोलना" सिखाकर संभव हुआ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →