← नवीनतम पेपर
💻 computer science

LoC-Path: Learning to Compress for Pathology Multimodal Large Language Models

LoC-Path एक संसाधन-कुशल पैथोलॉजी मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जो एक कंप्रेसन-बिफोर-फ्यूजन रणनीति को नियोजित करके गीगापिक्सेल होल स्लाइड इमेजेस को प्रोसेस करने की कम्प्यूटेशनल चुनौतियों का समाधान करता है, जिसमें एक स्पार्स टोकन मर्जर, MAE-प्रीट्रेन रिसैम्प्लर, टोकन इम्पोर्टेंस स्कोरर और क्रॉस-अटेंशन रूटिंग अडैप्टर का उपयोग किया गया है ताकि प्रतिस्पर्धी डायग्नोस्टिक प्रदर्शन को बनाए रखते हुए प्रशिक्षण लागत और इन्फरेंस लेटेंसी को महत्वपूर्ण रूप से कम किया जा सके।

मूल लेखक: Qingqiao Hu, Weimin Lyu, Meilong Xu, Kehan Qi, Xiaoling Hu, Saumya Gupta, Jiawei Zhou, Chao Chen

प्रकाशित 2026-03-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qingqiao Hu, Weimin Lyu, Meilong Xu, Kehan Qi, Xiaoling Hu, Saumya Gupta, Jiawei Zhou, Chao Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कुशल जासूस हैं जो किसी अपराध को सुलझाने की कोशिश कर रहे हैं, लेकिन अपराध स्थल के बजाय, आप एक मरीज के ऊतक (tissue) की होल स्लाइड इमेज (WSI) देख रहे हैं।

यहाँ समस्या यह है: एक सिंगल स्लाइड एक शहर की गिगैपिक्सेल फोटो की तरह है। यह इतनी विशाल है कि यदि आप ज़ूम करेंगे, तो आपको लाखों छोटे ईंटें (कोशिकाएं) दिखाई देंगी। यदि आप उस एक सुराग को खोजने के लिए हर एक ईंट को पढ़ने की कोशिश करेंगे जो यह साबित करे कि अपराधी कौन है, तो आपको एक ऐसे सुपरकंप्यूटर की आवश्यकता होगी जिसकी कीमत दस लाख डॉलर हो और जिसे काम पूरा करने में कई दिन लग जाएं।

वर्तमान के अधिकांश AI मॉडल बिल्कुल यही करने की कोशिश करते हैं: वे शहर की हर एक ईंट को, एक-एक करके, देखने की कोशिश करते हैं, इससे पहले कि वे कोई निर्णय ले सकें। यह धीमा, महंगा और अक्षम है क्योंकि 9% ईंटें केवल सामान्य फुटपाथ या घास हैं—उनका कोई महत्व नहीं है।

LoC-Path एक नया, अधिक स्मार्ट जासूस है। पूरे शहर को पढ़ने के बजाय, यह सुरागों को जल्दी और सस्ते में खोजने के लिए एक चतुर तीन-चरणीय रणनीति का उपयोग करता है।

तीन-चरणीय रणनीति (The Three-Step Strategy of LoC-Path)

1. "ग्रुप हग" (स्पार्स टोकन मर्जर - Sparse Token Merger)

समस्या: एक शहर के ब्लॉक में, पास की ईंटें आमतौर पर बिल्कुल एक जैसी दिखती हैं। "लाल ईंट, लाल ईंट, लाल ईdt ईंट" को 100 बार पढ़ना अनावश्यक है।
LoC-Path का समाधान: कल्पना कीजिए कि एक जासूस सड़क पर चलता है और कहता है, "ठीक है, लाल ईंटों का यह पूरा ब्लॉक 100 लाल ईंटों का सिर्फ एक 'लाल ब्लॉक' है।"
LoC-Path पास के टाइल्स (ईंटों) को एक एकल, प्रतिनिधि सारांश में समूहित करता है। यह जानकारी को फेंकता नहीं है; यह बस खुद को दोहराना बंद कर देता है। यह विशाल शहर को एक प्रबंधनीय पड़ोस के मानचित्र में सिकोड़ देता है।

2. "एक नज़र और सारांश" (MAE-प्रशिक्षित रीसैम्प्लर - MAE-Pretrained Resampler)

समस्या: ब्लॉक्स को समूहित करने के बाद भी, आपके पास एक विशाल मानचित्र होता है। आप हर सड़क का नाम नहीं पढ़ सकते।
LoC-Path का समाधान: कल्पना कीजिए कि एक बहुत ही अनुभवी जासूस जिसने पहले लाखों अपराध स्थल देखे हैं। वे मानचित्र को पढ़ते नहीं हैं; वे उस पर एक नज़र डालते हैं।
LoC-Path एक विशेष प्रशिक्षण पद्धति (जिसे MAE कहा जाता है) का उपयोग करता है जहाँ AI को एक तस्वीर देखने, उसके 75% हिस्से को ढकने और यह अनुमान लगाने के लिए सिखाया जाता है कि क्या गायब है। यह AI को ऊतक के "बड़ी तस्वीर" वाले लेआउट को सीखने के लिए मजबूर करता है।
हजारों डेटा पॉइंट्स को मुख्य मस्तिष्क (Large Language Model) तक भेजने के बजाय, यह पूरे स्लाइड को केवल 256 "लेटेंट" (latent) सारांशों में संकुचित कर देता है। इन्हें 256 उच्च-गुणवत्ता वाले "पोस्टकार्ड" के रूप में सोचें जो पूरे शहर के सार को पकड़ते हैं।

3. "स्मार्ट फ़िल्टर" (टोकन इम्पॉर्टेंस स्कोरर और रूटिंग - Token Importance Scorer & Routing)

समस्या: अब आपके पास 256 पोस्टकार्ड हैं। लेकिन यदि जासूस "चोरी की घड़ी" की तलाश में है, तो उसे "पार्क" या "स्कूलों" के बारे में पोस्टकार्ड पढ़ने की आवश्यकता नहीं है। उसे केवल उन्हीं की आवश्यकता है जो "आभूषण की दुकानों" के बारे में हैं।
LoC-Path का समाधान: यह सबसे महत्वपूर्ण हिस्सा है।

  • फ़िल्टर (TIS): AI के सोचने शुरू करने से पहले, यह प्रश्न (जैसे, "क्या यह कैंसर है?") को देखता है और तुरंत उन 256 पोस्टकार्डों को फ़िल्टर करता है जो वास्तव में प्रासंगिक हैं, यानी शीर्ष 96 तक।
  • राउटर (CARA): सभी 256 पोस्टकार्डों को मुख्य मस्तिष्क की मेमोरी में डालने के बजाय, जो इसे जाम कर सकता है, LoC-Path केवल उन 96 प्रासंगिक पोस्टकार्डों को मस्तिष्क के "सोचने वाले परतों" (thinking layers) में भेजता है।

यह एक बड़ी बात क्यों है?

पुराना तरीका (LLaVA-शैली):
कल्पना कीजिए कि आप एक रहस्य को सुलझाने के लिए 1,000 पन्नों की किताब पढ़ने की कोशिश कर रहे हैं, जबकि उत्तर पेज संख्या 42 पर है। आपको हर पन्ना पढ़ना होगा, जिसमें बहुत समय लगता है और बहुत ऊर्जा खर्च होती है।

LoC-Path का तरीका:
आप विषय-सूची को सरसरी तौर से देखते हैं, समान अध्यायों को समूहित करते हैं, और फिर केवल उन 3 पन्नों को पढ़ते हैं जिनमें वास्तव में उत्तर है।

परिणाम:

  • गति: यह बहुत तेज़ है क्योंकि यह उबाऊ हिस्सों को छोड़ देता है।
  • लागत: यह बहुत सस्ते कंप्यूटरों (जैसे मानक अस्पताल सर्वर) पर चलता है जिसके लिए सुपरकंप्यूटर की आवश्यकता नहीं होती।
  • सटीकता: आश्चर्यजनक रूप से, यह धीमे और महंगे मॉडलों के समान ही अच्छा है। केवल "नैदानिक रूप से प्रासंगिक" सुरागों पर ध्यान केंद्रित करके, यह शोर (noise) से भ्रमित होने से बच जाता है।

निष्कर्ष (The Bottom Line)

LoC-Path एक AI को एक स्मार्ट पैथोलॉजिस्ट बनाने जैसा है, न कि एक बेजान फोटोकॉपी मशीन। यह जानता है कि एक विशाल ऊतक स्लाइड में, अधिकांश छवि केवल बैकग्राउंड शोर है। शोर को संकुचित करने और केवल महत्वपूर्ण साक्ष्य को अपने मस्तिष्क तक पहुँचाने की सीखकर, यह उन्नत मेडिकल AI को केवल बड़ी टेक कंपनियों के लिए ही नहीं, बल्कि दुनिया भर के अस्पतालों के लिए सुलभ बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →