← नवीनतम पेपर
💻 computer science

Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space

यह शोध पत्र एक एजेंटिक पाइपलाइन पेश करके मेडिकल मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में 3D स्थानिक तर्क (spatial reasoning) की कमी को संबोधित करता है, जिसके परिणामस्वरूप 'SpatialMed' बेंचमार्क तैयार हुआ है जो यह प्रकट करता है कि वर्तमान मॉडल मेडिकल स्थानिक बुद्धिमत्ता के साथ काफी संघर्ष करते हैं।

मूल लेखक: Quoc-Huy Trinh, Xi Ding, Yang Liu, Zhenyue Qin, Xingjian Li, Gorkem Durak, Halil Ertugrul Aktas, Elif Keles, Ulas Bagci, Min Xu

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Quoc-Huy Trinh, Xi Ding, Yang Liu, Zhenyue Qin, Xingjian Li, Gorkem Durak, Halil Ertugrul Aktas, Elif Keles, Ulas Bagci, Min Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक डॉक्टर हैं जो मरीज के शरीर का एक 3D मैप देख रहे हैं, जैसे कि कोई हाई-टेक वीडियो गेम लेवल हो। आपका काम सिर्फ यह कहना नहीं है कि, "यहाँ एक ट्यूमर है।" आपको ठीक-ठीक पता होना चाहिए कि वह कितना बड़ा है, वह किसी प्रमुख रक्त वाहिका (blood vessel) से कितनी दूर है, और उसका मुख (orientation) किस दिशा में है। यदि ट्यूमर एक नस से 3 सेंटीमीटर दूर है, तो सर्जरी सुरक्षित हो सकती है। यदि वह नस को छू रहा है, तो यह एक आपदा है।

लंबे समय से, आर्टिफिशियल इंटेलिजेंस (AI) 2D तस्वीरों (जैसे कि एक सपाट फोटो) को देखने और यह कहने में बहुत अच्छा रहा है कि, "यह एक बिल्ली है" या "यह एक टूटी हुई हड्डी है।" लेकिन जब बात 3D मेडिकल स्कैन और दूरियों तथा आयतन (volume) को मापने के गणित की आती है, तो AI संघर्ष कर रहा है। यह ऐसा है जैसे किसी पायलट को पहाड़ का 2D नक्शा दे दिया जाए और उससे बिना टकराए विमान उड़ाने के लिए कहा जाए।

यह पेपर इस समस्या को ठीक करने के लिए SpatialMed नामक एक नया प्रोजेक्ट पेश करता है। यहाँ इसका सरल विवरण दिया गया है:

1. समस्या: AI "स्थानिक रूप से अंधा" (Spatially Blind) है

वर्तमान मेडिकल AI मॉडल उन छात्रों की तरह हैं जिन्होंने पाठ्यपुस्तक तो रट ली है लेकिन वे वास्तव में कभी शहर में गए ही नहीं हैं। वे तथ्यों को सुना सकते हैं, लेकिन यदि आप उनसे पूछें, "लाइब्रेरी पार्क से कितनी दूर है?" तो वे या तो अंदाज़ा लगा सकते हैं या कोई भी उत्तर बना सकते हैं।

चिकित्सा में, यह खतरनाक है। यदि कोई AI ट्यूमर के आकार या अंगों के बीच की दूरी का अनुमान लगाता है, तो एक सर्जन घातक गलती कर सकता है। शोधकर्ताओं ने पाया कि आज के सबसे स्मार्ट AI मॉडल भी इस "3D स्थानिक गणित" (3D spatial math) में बहुत खराब हैं। वे अक्सर भ्रमित (hallucinate) होते हैं या गलत नंबर देते हैं।

2. समाधान: AI के लिए एक "ट्रेनिंग जिम" बनाना

AI को 3D में सोचना सिखाने के लिए, आपको सही उत्तरों के साथ अभ्यास प्रश्नों की एक विशाल लाइब्रेरी की आवश्यकता होती है। लेकिन यहाँ एक पेंच है: वास्तविक डॉक्टर अपनी रिपोर्ट में यह नहीं लिखते कि किडनी और लिवर के बीच की सटीक दूरी क्या है; वे बस कहते हैं, "किडनी सामान्य दिख रही है।"

इसलिए, शोधकर्ताओं ने इस डेटा को बनाने के लिए एक रोबोटिक फैक्ट्री (एक "एजेंटिक पाइपलाइन") बनाई:

  • टूल्स (Tools): उन्होंने हजारों CT स्कैन में अंगों के सटीक आयतन और दूरी को स्वचालित रूप से मापने के लिए कंप्यूटर टूल्स का उपयोग किया।
  • लेखक (Writers): उन्होंने उन मापों के आधार पर, "लिवर और दाहिनी किडनी के बीच की दूरी क्या है?" जैसे प्रश्न लिखने के लिए AI एजेंटों का उपयोग किया।
  • शिक्षक (Teachers): वास्तविक, बोर्ड-प्रमाणित रेडियोलॉजिस्ट (मानव डॉक्टर) अंतिम परीक्षकों के रूप में कार्य करते थे। उन्होंने AI के प्रश्नों की समीक्षा की ताकि यह सुनिश्चित हो सके कि वे चिकित्सकीय रूप से तार्किक हैं और उनके उत्तर वास्तव में सही हैं।

परिणाम स्वरूप SpatialMed प्राप्त हुआ, जो लगभग 10,000 प्रश्नों का एक विशाल टेस्ट बैंक है, जो मानव शरीर के 2,375 अलग-अलग 3D स्कैन को कवर करता है।

3. बड़ा परीक्षण: AI को परीक्षा में उतारना

शोधकर्ताओं ने दुनिया के 14 सबसे उन्नत AI मॉडलों (सबसे "स्मार्ट छात्रों") को लिया और उन्हें SpatialMed की परीक्षा दी।

परिणाम चौंकाने वाले थे:

  • "रैंडम गेस" (Random Guess) की समस्या: कई मॉडलों का प्रदर्शन केवल थोड़ा बेहतर था, जितना कि तब होता यदि उन्होंने आँखें बंद करके कोई भी रैंडम उत्तर चुन लिया होता।
  • "दूरी" की बाधा (Distance Bottleneck): मॉडल दूरियों को मापने में विशेष रूप से खराब थे। वे विश्वसनीय रूप से यह नहीं बता सके कि एक वस्तु दूसरी से अधिक करीब है या नहीं।
  • "आयतन" की विफलता (Volume Failure): जब किसी अंग के आकार का अनुमान लगाने के लिए पूछा गया (जैसे, "क्या यह लिवर 1,000 क्यूबिक सेंटीमीटर है या 2,000?"), तो मॉडलों ने अक्सर हार मान ली, "NaN" (नंबर नहीं) वापस किया, या बिल्कुल गलत नंबर दिए।
  • "भ्रम" का जाल (Hallucination Trap): भले ही मॉडल सही उत्तर तक पहुँच गए, लेकिन वे अक्सर एक फर्जी तर्क पथ (reasoning path) बनाकर वहाँ पहुँचे। यह एक ऐसे छात्र की तरह है जो गणित की परीक्षा में सही उत्तर तो देता है लेकिन वहां तक पहुँचने के लिए पूरी तरह से गलत फॉर्मूला लिख देता है।

4. यह क्यों महत्वपूर्ण है

वर्तमान मेडिकल AI को एक ऐसे नेविगेटर के रूप में सोचें जो नक्शा तो पढ़ सकता है लेकिन गणित नहीं कर सकता। वह आपको बता सकता है "अस्पताल पर बाएं मुड़ें," लेकिन वह यह नहीं बता सकता कि "आगे का पुल आपके ट्रक के लिए 2 मीटर बहुत कम है।"

सर्जरी और कैंसर के उपचार में, वे 2 मीटर बहुत मायने रखते हैं। यदि AI सटीक रूप से स्थान को नहीं माप सकता, तो सर्जरी की योजना बनाने या जटिल बीमारियों का निदान करने में उस पर भरोसा नहीं किया जा सकता।

मुख्य निष्कर्ष (The Takeaway)

यह पेपर एक चेतावनी है। यह कहता है: "यह मान लेना बंद करें कि AI 3D स्पेस को समझता है सिर्फ इसलिए क्योंकि वह एक तस्वीर का वर्णन कर सकता है।"

लेखकों ने AI को 3D स्थानिक तर्क (spatial reasoning) पर प्रशिक्षित और परीक्षण करने के लिए पहला वास्तविक "जिम" (SpatialMed) बनाया है। उनके निष्कर्ष बताते हैं कि AI वास्तव में ऑपरेटिंग रूम में एक विश्वसनीय साथी के रूप में कार्य कर सके, इसके लिए हमें अभी लंबा रास्ता तय करना है। हमें इन मॉडल्स को न केवल देखना, बल्कि एक मानव सर्जन की सटीकता के साथ मापना और गणना करना सिखाने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →