← नवीनतम पेपर
💻 computer science

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark

यह शोध पत्र SurgCoT को प्रस्तुत करता है, जो पांच मुख्य तर्क आयामों और एक संरचित एनोटेशन प्रोटोकॉल को परिभाषित करके विभिन्न शल्य चिकित्सा प्रक्रियाओं में मल्टी-मॉडल लार्ज लैंग्वेज मॉडल्स की सूक्ष्म स्थानिक-कालिक चेन-ऑफ-थॉट तर्क क्षमताओं का मूल्यांकन करने और उन्हें उन्नत करने के लिए डिज़ाइन किया गया एक व्यापक बेंचमार्क है।

मूल लेखक: Gui Wang, YongSong Zhou, Kaijun Deng, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gui Wang, YongSong Zhou, Kaijun Deng, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को सर्जन बनने के लिए सिखाने की कोशिश कर रहे हैं। आप उसे सर्जरी के हजारों घंटों के वीडियो दिखाते हैं। रोबोट आसानी से आपको बता सकता है, "यह एक स्कैल्पल (scalpel) है," या "यह एक किडनी है।" लेकिन क्या वह यह समझ सकता है कि सर्जन जो कर रहा है, वह ऐसा क्यों कर रहा है? क्या वह अनुमान लगा सकता है कि आगे क्या होने वाला है? क्या वह किसी बड़ी आपदा बनने से पहले एक छोटी सी गलती को पकड़ सकता है?

अभी, अधिकांश AI मॉडल सर्जरी वीडियो को देखने वाले पर्यटकों (tourists) की तरह हैं: वे नज़ारे तो देखते हैं लेकिन कहानी नहीं समझते। वे सूक्ष्म संकेतों, समय (timing), और कारण-और-प्रभाव (cause-and-effect) के संबंधों को मिस कर देते हैं जिन्हें एक असली सर्जन सहजता से समझ लेता है।

यह पेपर SurgCoT पेश करता है, जो एक नया "प्रशिक्षण मैदान" (training ground) और "परीक्षा" है जिसे इस समस्या को ठीक करने के लिए बनाया गया है। यहाँ इसका सरल विवरण दिया गया है:

1. समस्या: "पर्यटक" बनाम "जासूस"

वर्तमान AI मॉडल सरल प्रश्न पूछने में माहिर हैं जैसे "यह कौन सा उपकरण है?" (टूरिस्ट मोड)। लेकिन सर्जरी जटिल है। इसके लिए स्पैटियोटेम्पोरल रीजनिंग (spatiotemporal reasoning) की आवश्यकता होती है—जो एक फैंसी शब्द है जिसका अर्थ है: यह समझना कि चीजें स्थान और समय में कैसे चलती हैं ताकि यह पता लगाया जा सके कि क्या हो रहा है।

एक असली सर्जन एक जासूस की तरह काम करता है। वे केवल एक कट (cut) को नहीं देखते; वे देखते हैं कि कट क्यों लगाया गया था, वह कब हुआ था, और इसके अगले कदम के लिए क्या निहितार्थ हैं। वे सर्जरी की कहानी को ट्रैक करते हैं, न कि केवल चित्रों को।

2. समाधान: SurgCoT ("जासूसी अकादमी")

लेखकों ने 35 अलग-अलग प्रकार के ऑपरेशनों (आंख की सर्जरी से लेकर हृदय की सर्जरी तक) को कवर करने वाले 2,841 सर्जरी वीडियो का एक विशाल पुस्तकालय बनाया। लेकिन उन्होंने केवल वीडियो AI पर नहीं डाले। उन्होंने एक विशेष परीक्षा प्रारूप बनाया जिसे चेन-ऑफ-थॉट (Chain-of-Thought - CoT) कहा जाता है।

इसे एक छात्र को गणित का सवाल हल करना सिखाने जैसा समझें:

  • पुराना तरीका: सवाल दिखाएं, उत्तर मांगें। (क्या छात्र ने सही अनुमान लगाया या उसने वास्तव में सीखा?)
  • SurgCoT तरीका: छात्र को अपना काम चरण-दर-चरण दिखाने के लिए मजबूर करें।

3. गुप्त मंत्र: "तीन-स्तरीय जासूसी सीढ़ी"

यह परीक्षण करने के लिए कि क्या AI एक सर्जन की तरह सोच रहा है, SurgCoT हर प्रश्न को तीन स्तरों में तोड़ देता है, जैसे एक सीढ़ी चढ़ना:

  • चरण 1 (बड़ी तस्वीर): "क्या कोई समस्या है?" (जैसे, "क्या रक्तस्राव हो रहा है?")
    • उपमा: एक जासूस जो अपराध स्थल को देख रहा है और पूछ रहा है, "क्या कोई अपराध हुआ?"
  • चरण 2 (समयरेखा और स्थान): "यह कब शुरू हुआ और ठीक कहाँ?" (जैसे, "रक्तस्राव शाम 4:05 बजे धमनी के पास शुरू हुआ।")
    • उपमा: जासूस मामले को सीमित कर रहा है: "यह तब हुआ जब संदिग्ध ने खिड़की के पास चाकू गिराया था।"
  • चरण 3 (सूक्ष्म विवरण): "मुझे सटीक फ्रेम और पिक्सेल दिखाएं।" (जैसे, "यहाँ वह सटीक क्षण है जब रक्त वाहिका फट गई।")
    • उपमा: जासूस चाकू के हैंडल पर उंगली के निशान (fingerprint) पर ज़ूम कर रहा है।

4. "फाइव-टुपल" (Five-Tuple) चीट शीट

AI की मदद करने के लिए, शोधकर्ताओं ने केवल प्रश्न नहीं पूछे। उन्होंने प्रत्येक प्रश्न के लिए एक विशेष पांच-भाग की संकेत प्रणाली प्रदान की:

  1. प्रश्न (Question): हम क्या पूछ रहे हैं?
  2. विकल्प (Options): संभावित उत्तर (गलत अनुमानों को खारिज करने के लिए)।
  3. ज्ञान (Knowledge): "पाठ्यपुस्तक" की जानकारी (जैसे, "आमतौर पर, धमनियां चमकीले लाल रंग में रक्तस्राव करती हैं")।
  4. सुराग (Clue): "वीडियो साक्ष्य" (जैसे, "4:05 PM पर लाल धब्बे को देखें")।
  5. उत्तर (Answer): अंतिम निर्णय।

यह AI को जो वह जानता है (ज्ञान) को जो वह देखता है (सुराग) के साथ जोड़ने के लिए मजबूर करता है। यह एक छात्र को रहस्य सुलझाने के लिए एक पाठ्यपुस्तक और एक आवर्धक लेंस (magnifying glass) देने जैसा है।

5. उन्होंने क्या पाया (परिणाम)

उन्होंने दुनिया के 10 सबसे स्मार्ट AI मॉडलों का परीक्षण किया (GPT-5 जैसे बड़े व्यावसायिक मॉडलों और ओपन-सोर्स मॉडलों सहित)।

  • अच्छी खबर: "बड़े दिमाग" वाले व्यावसायिक मॉडल वर्तमान में सबसे अच्छे जासूस हैं। जैसे-जैसे आप उन्हें अधिक संकेत (ज्ञान और सुराग) देते हैं, वे बेहतर होते जाते हैं।
  • बुरी खबर: यहाँ तक कि सबसे अच्छे मॉडल भी अभी भी संघर्ष कर रहे हैं। वे अक्सर सही उत्तर तक पहुँचने के लिए अनुमान लगाते हैं, लेकिन वे "मध्यवर्ती चरणों" में विफल हो जाते हैं।
    • उपमा: कल्पना कीजिए कि एक छात्र गणित का उत्तर "42" सही बताता है, लेकिन उसका काम दिखाता है कि उसने 5 + 5 करके 42 प्राप्त किया। वह भाग्यशाली था, लेकिन वह वास्तव में तर्क (logic) नहीं समझता।
  • अंतराल (Gap): आज AI जो कर सकता है और एक वास्तविक मानव सर्जन को सुरक्षा के लिए जिसकी आवश्यकता होती है, उसके बीच एक बड़ा अंतर है। AI वर्तमान में सही उत्तर होने पर भी तर्क को "हैलुसिनेट" (hallucinate) कर रहा है।

6. यह क्यों महत्वपूर्ण है

SurgCoT केवल एक परीक्षण नहीं है; यह भविष्य का ब्लूप्रिंट है।

  • यह साबित करता है कि AI को केवल अनुमान लगाने के बजाय चरणों में सोचने के लिए सिखाने की आवश्यकता है।
  • यह दिखाता है कि AI को "सुराग" देना (जैसे वीडियो में सटीक समय और स्थान बताना) उन्हें बहुत बेहतर तरीके से तर्क करने में मदद करता है।
  • यह एक नया मानक स्थापित करता है ताकि हम ऐसा AI बना सकें जो केवल सर्जरी को देखता ही नहीं, बल्कि वास्तव में उसे समझता है, जिससे भविष्य में मरीजों को सुरक्षित रखने में मदद मिल सके।

संक्षेप में: लेखकों ने सर्जरी वीडियो का उपयोग करके AI के लिए एक "जासूसी अकादमी" बनाई। उन्होंने AI को छोटे, तार्किक चरणों में तोड़कर रहस्य सुलझाना सिखाया। हालांकि AI अभी भी थोड़ा अनाड़ी है और उसे अधिक प्रशिक्षण की आवश्यकता है, यह नई प्रणाली हमें स्पष्ट रूप से दिखाती है कि इसे मानव सर्जन की तरह सोचने के लिए कैसे सिखाया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →