← नवीनतम पेपर
💻 computer science

Towards Selection of Large Multimodal Models as Engines for Burned-in Protected Health Information Detection in Medical Images

यह शोध पत्र चिकित्सा छवियों में संरक्षित स्वास्थ्य जानकारी (Protected Health Information) का पता लगाने के लिए तीन लार्ज मल्टीमॉडल मॉडल्स (GPT-4o, Gemini 2.5 Flash, और Qwen 2.5 7B) का बेंचमार्किंग करता है, जिसमें यह पाया गया है कि हालांकि वे टेक्स्ट निष्कर्षण (text extraction) में पारंपरिक OCR से बेहतर प्रदर्शन करते हैं, लेकिन उनकी समग्र पहचान सटीकता में लाभ स्पष्ट रूप से पठनीय टेक्स्ट के बजाय जटिल इम्प्रिंट पैटर्न के लिए सबसे महत्वपूर्ण है, जो अनुकूलित चयन अनुशंसाओं और एक स्केलेबल परिनियोजन रणनीति की ओर ले जाता है।

मूल लेखक: Tuan Truong, Guillermo Jimenez Perez, Pedro Osorio, Matthias Lenga

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tuan Truong, Guillermo Jimenez Perez, Pedro Osorio, Matthias Lenga

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास पुराने मेडिकल एक्स-रे या स्कैन का एक ढेर है। इन छवियों के भीतर छोटे "स्टैम्प" या "वॉटरमार्क" (जैसे तारीखें, मरीज के नाम, या आईडी नंबर) छिपे हुए हैं जो सीधे तस्वीर पर अंकित हैं। यदि आप शोध या शिक्षण के लिए इन छवियों को साझा करना चाहते हैं, तो आपको मरीज की गोपनीयता की रक्षा के लिए पहले उन स्टैम्प्स को मिटाना होगा। इसे PHI (प्रोटेक्टेड हेल्थ इंफॉर्मेशन) को खोजना और हटाना कहा जाता है।

लंबे समय तक, डॉक्टरों और तकनीकी टीमों ने दो-चरणीय रोबोट प्रक्रिया का उपयोग किया:

  1. स्कैनर (The Scanner): एक विशेष उपकरण (जिसे OCR कहा जाता है) जो छवि को देखता है और एक बहुत तेज़ टाइपिस्ट की तरह टेक्स्ट को पढ़ने की कोशिश करता है।
  2. संपादक (The Editor): एक स्मार्ट कंप्यूटर प्रोग्राम जो टाइपिस्ट द्वारा लिखे गए टेक्स्ट को पढ़ता है और निर्णय लेता है, "क्या यह कोई गुप्त मरीज का नाम है? हाँ, इसे मिटा दो। क्या यह केवल अस्पताल के लिए एक तारीख है? नहीं, इसे रहने दो।"

नया विचार: "सुपर-रीडर" (The Super-Reader)

इस पेपर के लेखकों ने पूछा: क्या होगा अगर हम "संपादक" को एक सुपर-रीडर से बदल दें?

ये सुपर-रीडर्स लार्ज मल्टीमॉडल मॉडल्स (LMMs) हैं—इन्हें अविश्वसनीय रूप से स्मार्ट AI असिस्टेंट (जैसे GPT-4o, Gemini, या Qwen) के रूप में समझें जो एक तस्वीर को देख सकते हैं, संदर्भ को समझ सकते हैं, और एक साथ टेक्स्ट को पढ़ सकते हैं। वे एक मानव विशेषज्ञ की तरह हैं जो एक धुंधले नोट को देख सकते हैं और कह सकते हैं, "आह, यह 'जॉन डो' है, और यह निश्चित रूप से एक मरीज का नाम है।"

शोधकर्ताओं ने यह देखने के लिए तीन अलग-अलग सुपर-रीडर्स का परीक्षण किया कि क्या वे पुराने "स्कैनर + एडिटर" टीम से बेहतर काम कर सकते हैं। उन्होंने परीक्षण चलाने के दो अलग-अलग तरीके निर्धारित किए:

  • सेटअप A (पारंपरिक टीम): टेक्स्ट को पढ़ने के लिए पुराने, तेज़ "स्कैनर" का उपयोग करें, फिर उस टेक्स्ट को सुपर-रीडर को भेजें ताकि वह तय कर सके कि क्या मिटाना है।
  • सेटअप B (ऑल-इन-वन टीम): कच्ची इमेज क्रॉप्स (raw image crops) को सीधे सुपर-रीडर को भेजें और उससे पढ़ने और निर्णय लेने, दोनों कार्य करने को कहें।

उन्हें क्या पता चला (परिणाम)

1. सुपर-रीडर्स पढ़ने में माहिर हैं (कभी-कभी)
जब छवियों पर मौजूद टेक्स्ट गंदा, धुंधला या देखने में कठिन था, तो सुपर-रीडर्स (विशेष रूप से बड़े और शक्तिशाली मॉडल) पुराने स्कैनर की तुलना में टेक्स्ट को पढ़ने में बहुत बेहतर थे। यह बिल्कुल वैसा ही है जैसे एक इंसान अक्सर एक साधारण टाइपराइटर की तुलना में हाथ से लिखे गए धुंधले नोट को बेहतर ढंग से समझ सकता है।

2. लेकिन स्मार्ट होने का मतलब हमेशा तेज़ होना नहीं होता
यहाँ एक पेंच है: सुपर-रीडर्स भारी और धीमे होते हैं।

  • स्पीड ट्रैप (The Speed Trap): जब सुपर-रीडर ने पढ़ने और निर्णय लेने, दोनों काम करने की कोशिश की (सेटअप B), तो प्रक्रिया काफी धीमी हो गई—पारंपरिक टीम की तुलना में कभी-कभी 30% से 70% तक धीमी।
  • "काफी अच्छा है" वाली वास्तविकता (The "Good Enough" Reality): उन छवियों पर जहाँ टेक्स्ट पहले से ही स्पष्ट और पढ़ने में आसान था, सुपर-रीडर ने पुराने स्कैनर की तुलना में रहस्यों को खोजने में वास्तव में बहुत बेहतर काम नहीं किया। वास्तव में, कुछ डेटासेट्स के लिए, पारंपरिक टीम वास्तव में अधिक सटीक थी क्योंकि सुपर-रीडर बहुत अधिक टेक्स्ट देखकर भ्रमित हो गया या पढ़ने में छोटी गलतियाँ कर गया।

3. "गोल्डीलॉक्स" मॉडल्स (The "Goldilocks" Models)
शोधकर्ताओं ने तीन विशिष्ट सुपर-रीडर्स का परीक्षण किया:

  • GPT-4o: "हेवीवेट चैंपियन"। यह रहस्यों को खोजने में सबसे सटीक था, लेकिन यह सबसे धीमा और चलाने में सबसे महंगा भी था। यह एक विश्व स्तरीय जासूस को काम पर रखने जैसा है जो केस सुलझाने में बहुत समय लेता है।
  • Gemini 1.5 Flash: "स्पीडस्टर"। यह चैंपियन के लगभग बराबर था लेकिन बहुत तेज़ और सस्ता था। यह एक बहुत ही तेज़ काम करने वाले जासूस जैसा है।
  • Qwen2.5-VL 7B: "ओपन-सोर्स लोकल guy"। इसे अपने स्वयं के कंप्यूटरों पर चलाना मुफ्त है (जो गोपनीयता के लिए बहुत अच्छा है)। यह अच्छा था, लेकिन यह जटिल स्थितियों में भ्रमित हो जाता था, जैसे कि मरीज की आईडी और स्टडी आईडी के बीच अंतर करने में।

मुख्य निष्कर्ष (The Big Takeaway)

पेपर यह निष्कर्ष निकालता है कि आपको बिना सोचे-समझे अपने पुराने सिस्टम को सुपर-रीडर से नहीं बदल देना चाहिए। यह आपकी स्थिति पर निर्भर करता है:

  • यदि आपके पास गंदी, पढ़ने में कठिन छवियां हैं: तो सुपर-रीडर का इंतज़ार करना सार्थक है क्योंकि वह उन चीजों को देख सकता है जिन्हें पुराना स्कैनर मिस कर देता है।
  • यदि आपके पास स्पष्ट, आसानी से पढ़ी जाने वाली छवियां हैं: तो पुराना, तेज़ स्कैनर अक्सर उतना ही अच्छा होता है और बहुत तेज़ भी होता है।
  • यदि आपको डेटा को निजी रखना है: तो आप "लोकल गाय" (Qwen) का उपयोग करना चाह सकते जिसे आप अपने स्वयं के सर्वर पर चला सकते हैं, भले ही वह थोड़ा कम सटीक हो, क्योंकि आपको डेटा क्लाउड पर भेजने की आवश्यकता नहीं है।

संक्षेप में: नए AI उपकरण शक्तिशाली हैं, लेकिन वे कोई जादुई बटन नहीं हैं जो सब कुछ तुरंत ठीक कर दे। कभी-कभी, पुराने, सरल उपकरण ही सबसे अच्छे विकल्प होते हैं, और सबसे अच्छा समाधान अक्सर दोनों का मिश्रण होता है, जो इस बात पर निर्भर करता है कि आपकी छवियां कितनी कठिन हैं और आपको परिणामों की कितनी जल्दी आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →