← नवीनतम पेपर
💻 computer science

Mr3D-VL: A generalist vision language foundation model for Multiparametric 3D Magnetic Resonance Imaging

Mr3D-VL एक 4-बिलियन-पैरामीटर वाला विजुअल-लैंग्वेज फाउंडेशन मॉडल है जिसे अनसुपरवाइज्ड 3D एनकोडिंग को 4D रोटेशनल पोजीशनल एम्बेडिंग्स के साथ एकीकृत करके मल्टी-पैरामेट्रिक 3D MRI में मौजूदा AI की सीमाओं को दूर करने के लिए डिज़ाइन किया गया है ताकि ब्रेन ट्यूमर निदान के लिए बेहतर क्रॉस-मोडल रीजनिंग, स्थानिक संरेखण और नैदानिक व्याख्यात्मकता सक्षम की जा सके।

मूल लेखक: Zhi Qiao, Xintong Wu, Yichu He, Feng Shi

प्रकाशित 2026-08-14
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zhi Qiao, Xintong Wu, Yichu He, Feng Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर किसी तस्वीर को देख सकते हैं और उसके बारे में आपको एक कहानी सुना सकते हैं। यह "विज़न-लैंग्वेज मॉडल्स" का जादू है, जो आर्टिफिशियल इंटेलिजेंस की एक ऐसी शाखा है जो जो हम देखते हैं और जो हम कहते हैं, उसके बीच एक सुपर-स्मार्ट अनुवादक की तरह काम करती है। लंबे समय तक, ये एआई सहायक सपाट, दो-आयामी (2D) तस्वीरों को देखने में माहिर थे, जैसे कि एक बिल्ली या सूर्यास्त का एक स्नैपशॉट। लेकिन मानव शरीर सपाट नहीं है; यह एक जटिल, तीन-आयामी (3D) पहेली है। डॉक्टर हमारे शरीर के अंदर के हिस्से के गहरे, 3D "स्लाइस" लेने के लिए एमआरआई (MRI) नामक एक विशेष प्रकार के कैमरे का उपयोग करते हैं, जो हमारे मस्तिष्क और अंगों का एक वॉल्यूमेट्रिक मैप तैयार करता है। चुनौती कंप्यूटर को न केवल इन 3D आकारों को देखना सिखाने की थी, बल्कि स्कैन के विभिन्न "फ्लेवर्स" (जैसे कि पानी वसा से कैसे अलग दिखता है) को समझना और फिर डॉक्टरों के साथ सरल अंग्रेजी में बातचीत करना भी था। यदि हम इस कोड को क्रैक कर सकें, तो इसका अर्थ मरीजों के लिए तेज़, स्पष्ट निदान और थके हुए डॉक्टरों के लिए एक शक्तिशाली नए सहायक के रूप में हो सकता है।

यहाँ प्रवेश होता है Mr3D-VL का, एक नया एआई मॉडल जिसे विशेष रूप से 3D ब्रेन स्कैन के लिए परम जासूस बनने के लिए डिज़ाइन किया गया है। इसे एक मेडिकल इंटर्न की तरह समझें जिसने हर पाठ्यपुस्तक पढ़ ली है, हर 3D ब्रेन मैप को याद कर लिया है, और एक सर्जन के साथ बातचीत कर सकता है। पुराने मॉडलों के विपरीत, जिन्होंने 3D स्कैन को 2D चित्रों के ढेर में बदलने की कोशिश की (जैसे कि ब्रेड के पूरे आकार का अनुमान लगाने के लिए ब्रेड के एक लोफ को एक बार में एक स्लाइस करके देखना), Mr3D-VL उस लोफ को एक संपूर्ण, 3D वस्तु के रूप में समझता है। इसे "मल्टीपैरामेट्रिक" एमआरआई को संभालने के लिए बनाया गया था, जिसका अर्थ है कि यह एक साथ कई अलग-अलग प्रकार के ब्रेन स्कैन देख सकता है—प्रत्येक प्रकार अलग-अलग ऊतकों (टिश्यू) को उजागर करता है, जैसे कि एक अलग रंग की टॉर्च।

शोधकर्ताओं ने पाया कि Mr3D-VL एक गेम-चेंजर है। 4 बिलियन पैरामीटर्स (एआई की मस्तिष्क कोशिकाओं) के साथ, इसने विभिन्न स्कैन प्रकारों के बीच के बिंदुओं को जोड़ने और उन्हें स्पष्ट, प्राकृतिक भाषा की रिपोर्ट में बदलने में महारत हासिल की। परीक्षणों में, इसने केवल अनुमान नहीं लगाया; इसने 0.856 के उच्च स्कोर (एक ऐसे पैमाने पर जहाँ उच्च स्कोर बेहतर है) के साथ मेडिकल रिपोर्ट तैयार की और बहुविकल्पीय परिदृश्यों में ब्रेन ट्यूमर के बारे में कठिन सवालों के 91.2% सटीकता के साथ जवाब दिए। इसने यह सब काफी कम कंप्यूटर पावर और मेमोरी का उपयोग करते हुए भी करने में सक्षम दिखाया, जिससे इसे छोटे, अधिक सुलभ हार्डवेयर पर चलाना संभव हो गया।

यह पेपर तर्क देता है कि पुराना तरीका—3D स्कैन को 2D स्लाइस के ढेर के रूप में मानना या मॉडल को एक बार में केवल एक ही प्रकार के स्कैन से सीखने के लिए मजबूर करना—बड़ी तस्वीर को मिस कर देता है। एआई को डेटा की "गहराई" देखने और यह समझने के लिए प्रशिक्षित करके कि विभिन्न स्कैन प्रकार 3D स्पेस में एक-दूसरे से कैसे संबंधित हैं, Mr3D-VL सुझाव देता है कि हम अंततः एआई को डॉक्टरों की भाषा धाराप्रवाह बोलने में सक्षम बना सकते हैं। यह केवल समस्या को पहचानने के बारे में नहीं है; यह समझाने के बारे में है कि वह कहाँ है, 3D में वह कैसी दिखती है, और वह क्यों महत्वपूर्ण है, और यह सब एक ही, सुसंगत बातचीत में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →