← नवीनतम पेपर
🤖 AI

AnatomiX, an Anatomy-Aware Grounded Multimodal Large Language Model for Chest X-Ray Interpretation

AnatomiX एक नवीन टू-स्टेज मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जो शारीरिक संरचना की पहचान को डाउनस्ट्रीम कार्यों के साथ एकीकृत करके चेस्ट एक्स-रे व्याख्या को महत्वपूर्ण रूप से बढ़ाता है, और मौजूदा दृष्टिकोणों की तुलना में शारीरिक तर्क (anatomical reasoning) और ग्राउंडिंग में 25% से अधिक प्रदर्शन सुधार प्राप्त करता है।

मूल लेखक: Anees Ur Rehman Hashmi, Numan Saeed, Christoph Lippert

प्रकाशित 2026-03-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anees Ur Rehman Hashmi, Numan Saeed, Christoph Lippert

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट सहायक को चेस्ट एक्स-रे (छाती का एक्स-रे) पढ़ना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि यह रोबोट न केवल आपको यह बताए कि क्या गलत है (जैसे कि "निमोनिया है"), बल्कि यह भी बताए कि वह ठीक कहाँ है और बाएं फेफड़े और दाएं फेफड़े के बीच अंतर को समझे।

समस्या यह है कि अधिकांश वर्तमान AI मॉडल ऐसे छात्रों की तरह हैं जिन्होंने उत्तर तो रट लिए लेकिन नक्शा नहीं समझा। यदि आप उन्हें एक सामान्य एक्स-रे दिखाते हैं, तो वे निदान सही कर देते हैं। लेकिन यदि आप छवि को उल्टा कर देते हैं या बाएं और दाएं पक्षों को बदल देते हैं, तो वे भ्रमित हो जाते हैं। वे कह सकते हैं, "ओह, निमोनिया बाईं ओर है," जबकि वास्तव में वह दाईं ओर होता है, क्योंकि वे केवल पैटर्न के आधार पर अनुमान लगा रहे होते हैं न कि वास्तव में शरीर रचना (anatomy) को "देखकर"।

यह पेपर AnatomiX नामक एक नए AI मॉडल का परिचय देता है, जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है ताकि यह एक असली रेडियोलॉजिस्ट की तरह काम कर सके।

यहाँ बताया गया है कि AnatomiX कैसे काम करता है, जिसे सरल उपमाओं (analogies) में विभाजित किया गया है:

1. पुराना तरीका: "अनुमान लगाने का खेल"

अधिकांश AI मॉडल एक एक्स-रे देखते हैं और एक ही बड़ी छलांग में उत्तर का अनुमान लगाने की कोशिश करते हैं। वे एक काला धब्बा देखते हैं और कहते हैं, "यह निमोनिया है।" लेकिन वे वास्तव में यह नहीं जानते कि वह धब्बा किस फेफड़े में है। यह पूरे मोहल्ले की एक धुंधली फोटो देखकर किसी विशिष्ट घर को खोजने की कोशिश करने जैसा है। यदि फोटो को पलट दिया जाए, तो आप गलत घर की ओर इशारा कर सकते हैं।

2. AnatomiX का तरीका: "दो-चरणीय जासूस"

AnatomiX इस खेल को बदल देता है और काम को दो अलग-अलग चरणों में विभाजित करता है, ठीक वैसे ही जैसे एक मानव डॉक्टर करता है।

चरण 1: "नक्शा बनाने वाला" (Anatomy Perception Module)
निदान करने की कोशिश करने से पहले, AnatomiX के पास एक विशेष आंतरिक उपकरण है जिसे Anatomy Perception Module (APM) कहा जाता है। इसे एक GPS सिस्टम के रूप में समझें जो पहले एक्स-रे को स्कैन करता है।

  • यह केवल पूरी तस्वीर को नहीं देखता; यह विशेष रूप से 36 अलग-अलग शरीर के अंगों (जैसे हृदय, बायां फेफड़ा, दायां फेफड़ा, कॉलरबोन आदि) की तलाश करता है।
  • यह उनके चारों ओर अदृश्य बॉक्स बनाता है और कहता है, "ठीक है, मैंने यहाँ बायां फेफड़ा पाया है, और दायां फेफड़ा वहाँ है।"
  • यह किसी भी प्रश्न का उत्तर देने से पहले शरीर के अंगों का एक विस्तृत "नक्शा" तैयार करता है।

चरण 2: "डॉक्टर" (The Large Language Model)
एक बार जब "नक्शा बनाने वाले" ने सभी शरीर के अंगों की पहचान कर ली है और उन्हें लेबल कर दिया है, तो वह इस व्यवस्थित जानकारी को "डॉक्टर" (मुख्य AI मस्तिष्क) को सौंप देता है।

  • अब डॉक्टर को यह अनुमान लगाने की आवश्यकता नहीं है कि चीजें कहाँ हैं। वह नक्शे को देखता है और कहता है, "आह, मैं देख सकता हूँ कि उपयोगकर्ता ने बाएं फेफड़े के बारे में पूछा है। नक्शा मुझे बताता है कि बायां फेफड़ा यहाँ है। मुझे देखने दें कि उस विशिष्ट बॉक्स में क्या हो रहा है।"
  • क्योंकि डॉक्टर के पास एक स्पष्ट नक्शा है, वह कभी भ्रमित नहीं होता कि चित्र को पलटा गया है। वह जानता है कि "बायां" हमेशा "बायां" ही रहेगा, चाहे चित्र का ओरिएंटेशन कैसा भी हो।

3. "फ्लैशकार्ड" का तरीका (Contrastive Retrieval)

AnatomiX का सबसे दिलचस्प हिस्सा यह है कि यह प्रत्येक शरीर के अंग के बारे में क्या कहना है, यह कैसे सीखता है।

  • कल्पना कीजिए कि AI के पास फ्लैशकार्ड की एक विशाल लाइब्रेरी है। प्रत्येक कार्ड के एक तरफ एक विशिष्ट शरीर के अंग की तस्वीर (जैसे कि "दायां निचला फेफड़ा") होती है और दूसरी तरफ एक चिकित्सा विवरण (जैसे कि "तरल पदार्थ के संकेत दिखाता है") होता है।
  • जब AnatomiX एक नया एक्स-रे देखता है, तो वह अपने नक्शे पर "दायां निचला फेफड़ा" ढूंढता है, अपनी लाइब्रेरी से मिलान करने वाला फ्लैशकार्ड उठाता है, और डॉक्टर को रिपोर्ट लिखने में मदद करने के लिए उस विवरण का उपयोग करता है। यह सुनिश्चित करता है कि AI सही शरीर के अंग के लिए सही चिकित्सा शब्दों का उपयोग करे।

यह क्यों मायने रखता है?

शोधकर्ताओं ने इस नए मॉडल का परीक्षण मौजूदा सर्वश्रेष्ठ AI मॉडलों के विरुद्ध किया। परिणाम यह रहा:

  • "उल्टी छवि" का परीक्षण: जब उन्होंने एक्स-रे को बाएं-से-दाएं पलटा, तो पुराने मॉडल बुरी तरह विफल रहे, और बाएं और दाएं को मिला दिया। हालाँकि, AnatomiX ने लगभग हर बार इसे सही किया क्योंकि उसने वास्तव में शरीर रचना को समझा, न कि केवल दृश्य पैटर्न को।
  • "पॉइंटिंग" का परीक्षण: जब किसी विशिष्ट बीमारी के चारों ओर बॉक्स बनाने के लिए कहा गया, तो AnatomiX अन्य मॉडलों की तुलना में 25% अधिक सटीक था।
  • "रिपोर्ट" का परीक्षण: इसने बेहतर चिकित्सा रिपोर्ट लिखी जो अधिक सटीक थी और डॉक्टरों के लिए अधिक विश्वसनीय थी।

मुख्य बात (The Bottom Line)

AnatomiX एक रोबोट को तोते (जो वही दोहराता है जो वह सुनता है) से अपग्रेड करके एक सर्जन (जो शरीर की संरचना को समझता है) बनाने जैसा है। शरीर के अंगों के कहाँ होने की पहचान करने के लिए AI को मजबूर करके, यह चिकित्सा AI की सबसे बड़ी समस्या को हल करता है: स्थानिक भ्रम (spatial confusion)

इसका अर्थ यह है कि भविष्य में, AI सहायक केवल टेक्स्ट पढ़ने में "स्मार्ट" नहीं होंगे; वे मानव शरीर को समझने में स्मार्ट होंगे, जिससे वे डॉक्टरों के लिए बहुत अधिक सुरक्षित और विश्वसनीय उपकरण बन जाएंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →