← नवीनतम पेपर
💻 computer science

Histopathology Multi-modal Embedding for Pathology Composed Retrieval

इंटरलीव्ड पैथोलॉजी छवियों और टेक्स्ट की प्रभावी रिट्रीवल में बाधा डालने वाले आर्किटेक्चरल, टास्क और डोमेन मिसमैच को संबोधित करने के लिए, यह शोध पत्र HOMIE पेश करता है, जो एक मॉडल-अज्ञेगर फ्रेमवर्क है जो जेनेरेटिव मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को विशिष्ट रिट्रीवल विशेषज्ञों में अनुकूलित करता है, जिससे नए प्रस्तावित 'पैथोलॉजी कंपोज्ड रिट्रीवल' बेंचमार्क पर अत्याधुनिक (state-of-the-art) प्रदर्शन प्राप्त होता है।

मूल लेखक: Qifeng Zhou, Wenliang Zhong, Thao M. Dang, Hehuan Ma, Saiyang Na, Yuzhi Guo, Junzhou Huang

प्रकाशित 2026-07-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qifeng Zhou, Wenliang Zhong, Thao M. Dang, Hehuan Ma, Saiyang Na, Yuzhi Guo, Junzhou Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक पैथोलॉजिस्ट (एक डॉक्टर जो ऊतकों के नमूनों को सूक्ष्मदर्शी/माइक्रोस्कोप के नीचे देखकर बीमारियों का निदान करता है) को एक जटिल मामले को सुलझाने वाले जासूस के रूप में देखा जा रहा है। आमतौर पर, इस जासूस को वर्तमान रहस्य के समान दिखने वाले मामले खोजने के लिए लाखों अन्य मामलों के एक विशाल पुस्तकालय में खोज करनी पड़ती है।

समस्या यह है कि जासूस के प्रश्न शायद ही कभी सरल होते हैं। वे केवल यह नहीं पूछते, "मुझे एक ट्यूमर की तस्वीर दिखाओ।" इसके बजाय, वे कह सकते हैं, "मुझे एक ऐसा ट्यूमर दिखाओ जो इस विशिष्ट छवि की तरह दिखता हो, लेकिन जिसका टेक्स्ट विवरण यह कहता हो कि यह तेज़ बुखार वाले रोगी से संबंधित है।"

वर्तमान AI उपकरण इसमें खराब हैं। वे ऐसे पुस्तकालयाध्यक्षों (librarians) की तरह हैं जो केवल एक समय में एक ही प्रकार के अनुरोध को संभाल सकते हैं: या तो "एक तस्वीर खोजें" या "एक वाक्य खोजें," लेकिन कभी भी "एक तस्वीर प्लस एक वाक्य एक साथ" नहीं।

यहाँ बताया गया है कि कैसे "HOMIE" नामक पेपर इस समस्या को हल करता है, जिसे सरल भाषा में समझाया गया है:

1. समस्या: "दो सिर वाला" पुस्तकालयाध्यक्ष बनाम "एक सिर वाला" जिनी (Genie)

पेपर तीन मुख्य कारणों की पहचान करता है कि वर्तमान AI इन जटिल, मिश्रित प्रश्नों पर क्यों विफल रहता है:

  • आर्किटेक्चरल मिसमैच (दो सिर वाला पुस्तकालयाध्यक्ष): पुराने AI मॉडल दो अलग-अलग "मस्तिष्क" (एनकोडर्स) का उपयोग करते हैं। एक मस्तिष्क टेक्स्ट पढ़ता है, और दूसरा छवियों को देखता है। जब आप उन्हें एक मिश्रित प्रश्न देते हैं, तो वे वास्तव में एक-दूसरे से बात नहीं कर पाते। वे केवल टेक्स्ट या इमेज के आधार पर अलग-अलग अनुमान लगाते हैं, जिससे उनके बीच का संबंध छूट जाता है। यह एक पुस्तकालयाध्यक्ष से कवर फोटो और प्लॉट सारांश के आधार पर एक किताब खोजने के लिए कहने जैसा है, लेकिन फोटो-पढ़ने वाला और टेक्स्ट-पढ़ने वाला अलग-अलग कमरों में हैं और कभी भी आपस में नोट्स साझा नहीं करते।
  • टास्क मिसमैच (रचनात्मक लेखक): नए, शक्तिशाली AI मॉडल (जिन्हें MLLM कहा जाता है) कहानियाँ लिखने या छवियाँ बनाने में माहिर हैं। वे रचनात्मक लेखकों की तरह हैं। लेकिन एक रिट्रीवल सिस्टम (retrieval system) को एक 'सर्च इंजन' होने की आवश्यकता है जो समानता के आधार पर चीजों को रैंक करता है, न कि एक ऐसे लेखक की तरह जो नई चीजें बनाता है। एक रचनात्मक लेखक को पुस्तकालयाध्यक्ष का काम करने के लिए उपयोग करने से अक्सर "हैलुसिनेशन" (चीजों को मनगढ़ंत बनाना) या खराब खोज परिणाम मिलते हैं।
  • डोमेन मिसमैच (सामान्य विशेषज्ञ): अधिकांश शक्तिशाली AI मॉडल सामान्य इंटरनेट डेटा (बिल्लियाँ, कारें, फिल्में) पर प्रशिक्षित होते हैं। वे नहीं जानते कि एक "सेलुलर न्यूक्लियस" या "स्टेनिंग आर्टिफैक्ट" कैसा दिखता है। यदि आप एक सामान्य AI को एक विशिष्ट प्रकार की कैंसर कोशिका खोजने के लिए कहते हैं, तो वह भ्रमित हो सकता है क्योंकि वह कुत्तों की तस्वीरें देखने का अभ्यस्त है, न कि सूक्ष्म जीव विज्ञान का।

2. समाधान: HOMIE (विशेषज्ञ जासूसी सहायक)

लेखक HOMIE का प्रस्ताव करते हैं, जो कोई बिल्कुल नया AI मॉडल नहीं है। इसके बजाय, यह एक ट्रेनिंग फ्रेमवर्क है—निर्देशों और अभ्यासों का एक विशेष सेट जिसे एक सामान्य, रचनात्मक AI लेखक को एक विशेषज्ञ पैथोलॉजी खोज विशेषज्ञ में बदलने के लिए डिज़ाइन किया गया है।

HOMIE को एक स्मार्ट लेकिन अप्रशिक्षित AI के लिए दो-चरणीय बूट कैंप के रूप में समझें:

  • चरण 1: खोजना सीखना (टास्क फिक्स)
    सबसे पहले, AI को केवल टेक्स्ट पर प्रशिक्षित किया जाता है। यह "कहानियां लिखना" बंद करने और "उत्तरों को रैंक करना" सीखने के लिए प्रशिक्षित होता है। यह सीखता है कि जब आप एक प्रश्न पूछते हैं, तो लक्ष्य एक नया वाक्य बनाना नहीं है, बल्कि उस सटीक मौजूदा दस्तावेज़ को खोजना है जो अर्थ के साथ मेल खाता हो। यह "टास्क मिसमैच" को ठीक करता है।
  • चरण 2: पैथोलॉजी सीखना (डोमेन फिक्स)
    इसके बाद, AI को हजारों पैथोलॉजी छवियों और टेक्स्ट विवरणों पर प्रशिक्षित किया जाता है। लेकिन यह प्रशिक्षण बहुत विशिष्ट है:
    • नेटिव रेजोल्यूशन (Native Resolution): छवियों को छोटे, धुंधले वर्गों में कुचलने (जैसा कि पुराने AI करते हैं) के बजाय, HOMIE AI को उनकी पूर्ण, हाई-डेफिनिशन साइज में देखने देता है। यह महत्वपूर्ण है क्योंकि कोशिकाओं के सूक्ष्म विवरण मायने रखते हैं।
    • स्टेन ट्रेनिंग (Stain Training): पैथोलॉजी स्लाइड्स को विभिन्न रंगों (स्टेन्स) से रंगा जाता है। HOMIE AI को रंगों के अंतर को अनदेखा करने और कोशिकाओं के आकार पर ध्यान केंद्रित करने के लिए सिखाता है, ताकि यदि एक स्लाइड गुलाबी है और दूसरी बैंगनी, तो वह भ्रमित न हो।
    • करिकुलम लर्निंग (Curriculum Learning): AI चरणों में सीखता है। पहले, वह कोशिकाओं के बुनियादी आकार सीखता है। फिर, वह सीखता है कि उन आकारों को जटिल चिकित्सा विवरणों के साथ कैसे जोड़ा जाए।

3. परिणाम: "ओम्नी-एम्बेडिंग" (Omni-Embedding)

इस बूट कैंप के बाद, HOMIE एक "मिश्रित" क्वेरी (जैसे, "एक ग्रैंड की यह छवि + बुखार के बारे में यह टेक्स्ट") ले सकता है और उसे एक एकल, एकीकृत खोज कोड (एक एम्बेडिंग) में बदल सकता है।

एक यूनिवर्सल ट्रांसलेटर की कल्पना करें जो एक तस्वीर, एक वाक्य और एक वीडियो ले सकता है, और उन सभी को एक एकल "ID कार्ड" में संकुचित कर सकता है। जब पैथोलॉजिस्ट एक प्रश्न पूछता है, तो HOMIE इस ID कार्ड को बनाता है और तुरंत डेटाबेस में मिलान वाले मामलों को ढूंढ लेता है, जिससे वह संयोजन को पूरी तरह से समझ लेता है।

4. यह क्यों मायने रखता है (पेपर के अनुसार)

पेपर ने PCR (पैथोलॉजी कंपोज्ड रिट्रीवल) नामक एक नया बेंचमार्क बनाया जिस पर HOMIE का परीक्षण किया गया।

  • विजेता: HOMIE (यहाँ तक कि एक छोटा, हल्का संस्करण भी) प्रतियोगिता को पछाड़ देता है। इसने मौजूदा "दो सिर वाले" मॉडलों और सर्वश्रेष्ठ "रचनात्मक लेखक" मॉडलों को भारी अंतर से हराया।
  • दक्षता (Efficiency): इसने यह काम एक बहुत छोटे मॉडल (2 बिलियन पैरामीटर्स) के साथ किया, जिसे इसने हराया था (7-बिलियन पैरामीटर्स वाले विशेष मॉडल)। यह साबित करता है कि ट्रेनिंग मेथड (बूट कैंप) ही कुंजी थी, न कि केवल AI को बड़ा बनाना।
  • सुरक्षा: क्योंकि यह एक रिट्रीवल सिस्टम है (यह मौजूदा, वास्तविक मेडिकल रिकॉर्ड खोजता है) न कि एक जेनरेटिव सिस्टम (यह नए निदान आविष्कार नहीं करता है), यह डॉक्टरों के लिए अधिक सुरक्षित और भरोसेमंद है। यह एक "कंप्यूटेशनल कंसल्टेंट" के रूप में कार्य करता है जो डॉक्टर द्वारा समीक्षा के लिए साक्ष्य प्रदान करता है, न कि अंतिम निर्णय लेने के लिए।

संक्षेप में: HOMIE एक स्मार्ट लेकिन अप्रशिक्षित AI को लेता है, उसे लिखने के बजाय खोजने के लिए सिखाता है, और फिर उसे सूक्ष्म विवरण देखना सिखाता है, जिससे वह एक सुपर-पावर्ड असिस्टेंट बन जाता है जो किसी भी पिछले टूल की तुलना में जटिल, मिश्रित चिकित्सा प्रश्नों को बेहतर ढंग से समझ सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →