← नवीनतम पेपर
💻 computer science

MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives

यह शोधपत्र MedicalNarratives को प्रस्तुत करता है, जो 4.7 मिलियन मेडिकल इमेज-टेक्स्ट पेयर्स का एक बड़े पैमाने का डेटासेट है जो यूट्यूब शैक्षणिक वीडियो से प्राप्त किया गया है जिनमें स्पैटियोटेम्पोरल ग्राउंडिंग के लिए स्थानीयकृत माउस ट्रेस (localized mouse traces) मौजूद हैं, जिसका उपयोग GenMedClip मॉडल को प्रशिक्षित करने के लिए किया जाता है जो 12 मेडिकल डोमेन में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Wisdom O. Ikezogwo, Kevin Zhang, Mehmet Saygin Seyfioglu, Fatemeh Ghezloo, Linda Shapiro, Ranjay Krishna

प्रकाशित 2026-01-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wisdom O. Ikezogwo, Kevin Zhang, Mehmet Saygin Seyfioglu, Fatemeh Ghezloo, Linda Shapiro, Ranjay Krishna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मेडिकल इमेज (जैसे एक्स-रे या एमआरआई स्कैन) समझना सिखाने की कोशिश कर रहे हैं। समस्या यह है कि रोबोट "डेटा के भूखे" होते हैं। उन्हें सीखने के लिए लाखों उदाहरणों की आवश्यकता होती है, लेकिन बिल्लियों या कारों की तस्वीरों की तरह, पर्याप्त लेबल वाली मेडिकल तस्वीरें उपलब्ध नहीं हैं। आमतौर पर, किसी इमेज के एक विशिष्ट हिस्से को समझने के लिए, एक इंसान को बहुत मेहनत से उसके चारों ओर एक बॉक्स बनाना पड़ता है या माउस से एक रेखा खींचनी पड़ती है। लाखों इमेज के लिए ऐसा करना धीमा, महंगा और उबाऊ है।

यह पेपर एक चतुर समाधान पेश करता है जिसे MEDICALNARRATIVES कहा जाता है। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. "बात करते हुए इशारा करने" वाली ट्रिक

सोचिए कि एक शिक्षक व्हाइटबोर्ड पर डायग्राम समझाते समय कैसे समझाता है। वे केवल बोलते नहीं हैं; वे उस विशिष्ट भाग की ओर इशारा भी करते हैं जिसका वे वर्णन कर रहे हैं। "यहाँ देखिए टूटी हुई हड्डी," वे कहते हैं, जबकि उनकी उंगली टूट की जगह के ऊपर होती है।

शोधकर्ताओं ने महसूस किया कि मेडिकल एक्सपर्ट्स यूट्यूब पर बिल्कुल यही करते हैं। वे शैक्षिक वीडियो रिकॉर्ड करते हैं जहाँ वे मरीज के स्कैन के बारे में बात करते हुए कंप्यूटर माउस कर्सर को उस विशिष्ट क्षेत्र पर घुमाते हैं जिसके बारे में वे चर्चा कर रहे होते हैं।

हर इमेज के चारों ओर मैन्युअल रूप से बॉक्स बनाने के लिए हजारों लोगों को काम पर रखने के बजाय, टीम ने यूट्यूब पर जाकर इन वीडियो को इकट्ठा किया। उन्होंने माउस कर्सर की गति को एक "डिजिटल उंगली" के रूप में माना। जब शिक्षक कहता है, "क्या आप यह ट्यूमर देख रहे हैं?" और माउस उस पर रुकता है, तो कंप्यूटर उस संबंध को रिकॉर्ड कर लेता है।

2. चिकित्सा की "कहानी की किताब" (Storybook) बनाना

टीम ने 4.7 मिलियन इमेज और टेक्स्ट के जोड़ों (pairs) वाला एक विशाल पुस्तकालय (डेटासेट) बनाया।

  • टेक्स्ट (Text): उन्होंने वीडियो को सुनने, डॉक्टरों द्वारा कही गई बातों को ट्रांसक्राइब करने और मेडिकल शब्दावली को साफ करने के लिए AI का उपयोग किया।
  • इमेज (Image): उन्होंने वे विशिष्ट फ्रेम्स लिए जिन्हें डॉक्टर देख रहे थे।
  • "ट्रेस" (Trace): उन्होंने ठीक से रिकॉर्ड किया कि जब डॉक्टर ने विशिष्ट शब्दों का उपयोग किया, तब माउस कर्सर कहाँ था।

इनमें से लगभग 1 मिलियन जोड़ों में ये "माउस ट्रेस" हैं, जो एक मानचित्र (map) की तरह काम करते हैं जो दिखाते हैं कि इमेज का कौन सा हिस्सा उस टेक्स्ट के बारे में बात कर रहा है। यह एक ऐसी किताब होने जैसा है जहाँ, केवल "लाल कार" पढ़ने के बजाय, आपके पास एक हाइलाइटर है जो चित्र में वास्तव में लाल कार की ओर इशारा करता है।

3. "रोबोट छात्र" (GENMEDCLIP)

यह परीक्षण करने के लिए कि क्या यह तरीका वास्तव में काम करता है, शोधकर्ताओं ने एक नया AI मॉडल प्रशिक्षित किया जिसे GENMEDCLIP कहा जाता है। आप इस मॉडल को एक मेडिकल छात्र के रूप में समझ सकते हैं।

  • प्रशिक्षण (Training): उन्होंने इस छात्र को 4.7 मिलियन "पॉइंटिंग और टॉकिंग" (इशारा करते हुए बात करने वाले) उदाहरण दिए।
  • परीक्षण (Test): उन्होंने इस छात्र को हृदय स्कैन से लेकर त्वचा की स्थितियों तक, 12 विभिन्न क्षेत्रों को कवर करने वाली मेडिकल परीक्षाओं (benchmarks) की एक श्रृंखला दी।

परिणाम: इस "पॉइंटिंग" वीडियो पर प्रशिक्षित छात्र ने सभी पिछले टॉप-टियर मॉडल्स को पछाड़ दिया। यह बीमारियों की पहचान करने और विवरण दिए जाने पर सही इमेज खोजने में बेहतर था। पेपर बताता है कि वीडियो डेटा (पॉइंटिंग ट्रेसेस) जोड़ने से मॉडल केवल टेक्स्ट और स्थिर इमेज (static images) के उपयोग की तुलना में काफी अधिक स्मार्ट हो गया।

4. यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का दावा है कि यह दृष्टिकोण एक बड़ी बाधा को हल करता है: ग्राउंडिंग (Grounding)।

  • पुराना तरीका: एक रोबोट एक तस्वीर देखता है और एक वाक्य पढ़ता है, लेकिन उसे यह नहीं पता होता कि वाक्य चित्र के किस हिस्से के बारे में है। यह बिना यह जाने रेसिपी पढ़ने जैसा है कि कौन सी सामग्री कौन सी है।
  • नया तरीका: क्योंकि माउस ट्रेस यह संबंध दिखाते हैं, इसलिए रोबм यह सीख जाता है कि शब्द "फ्रैक्चर" विशेष रूप से हड्डी की इमेज में टेढ़ी-मेढ़ी रेखा से जुड़ा है।

शोधकर्ताओं ने यह भी दिखाया कि इन माउस ट्रेसेस को अन्य मौजूदा टूल्स का उपयोग करके "मास्क्स" (वस्तुओं को रेखांकित करने वाले आकार) में बदला जा सकता है। इसका मतलब है कि इस डेटा का उपयोग रोबोट को अधिक जटिल कार्य करने के लिए सिखाने में किया जा सकता है, जैसे कि ट्यूमर या अंगों को स्वचालित रूप से रेखांकित करना, बिना मनुष्यों द्वारा हर एक आउटलाइन को मैन्युअल रूप से बनाए।

संक्षेप में

पेपर कहता है: "हमें यूट्यूब पर मुफ्त, उच्च-गुणवत्ता वाले शिक्षण डेटा का खजाना मिला जहाँ डॉक्टर मेडिकल इमेजेस की ओर इशारा करते हुए उन्हें समझाते हैं। हमने इन वीडियो को एक विशाल डेटासेट में बदल दिया जहाँ टेक्स्ट को इमेज के विशिष्ट हिस्सों के साथ पूरी तरह से जोड़ा गया है। जब हमने एक नए AI मॉडल को इस डेटा का उपयोग करके सिखाया, तो यह अब तक का सबसे बेहतरीन मेडिकल इमेज समझने वाला मॉडल बन गया, जिससे यह सिद्ध होता है कि 'बात करते हुए इशारा करना' कंप्यूटर को सिखाने का एक अत्यंत कुशल तरीका है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →