← नवीनतम पेपर
🤖 AI

MMIR-TCM: Memory-Integrated Multimodal Inference and Retrieval for TCM Clinical Decision Support

यह शोध पत्र MMIR-TCM प्रस्तुत करता है, जो पारंपरिक चीनी चिकित्सा निदान में व्यक्तिपरकता और डेटा की कमी की चुनौतियों से निपटने के लिए मेमोरी-ऑगमेंटेड सेगमेंटेशन, फाइन-ट्यून्ड मल्टीमॉडल विजन-लैंग्वेज मॉडल और रिट्रीवल-ऑगमेंटेड जनरेशन को संयोजित करने वाला एक नवीन ढांचा है, जिसे एक नए बड़े पैमाने के डेटासेट (MedTCM) और एक विशेष मूल्यांकन मीट्रिक (TDEU) पर मान्य किया गया है जो अग्रणी एआई मॉडलों से बेहतर प्रदर्शन करता है।

मूल लेखक: Lihui Luo, Joongwon Chae, Ziyan Chen, Yang Liu, Siyi Cheng, Weihan Gao, Zelin Zeng, Xiaoming Yin, Samaneh Beheshti Kashi, Dongmei Yu, Lian Zhang, Jing Sui, Zeming Liang, Jiansong Ji, Peter E. Lobie, P
प्रकाशित 2026-07-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lihui Luo, Joongwon Chae, Ziyan Chen, Yang Liu, Siyi Cheng, Weihan Gao, Zelin Zeng, Xiaoming Yin, Samaneh Beheshti Kashi, Dongmei Yu, Lian Zhang, Jing Sui, Zeming Liang, Jiansong Ji, Peter E. Lobie, Peiwu Qin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: एक रोबोट को टीसीएम (TCM) जासूस बनाना सिखाना

कल्पना कीजिए कि ट्रेडिशनल चाइनीज मेडिसिन (TCM) निदान एक रहस्य सुलझाने वाले मास्टर डिटेक्टिव की तरह है। डिटेक्टिव संदिग्ध की जीभ (विजुअल सुराग), उनकी कहानी (इतिहास) को सुनता है और उनकी पल्स (स्पर्श संबंधी सुराग) को महसूस करता है ताकि यह पता लगाया जा सके कि क्या गलत है और सही हर्बल उपचार निर्धारित किया जा सके।

लंबे समय से, कंप्यूटर इस काम में बहुत खराब रहे हैं। वे फोटो के अव्यवस्थित बैकग्राउंड से भ्रमित हो जाते हैं, वे "हल्के लाल" और "थोड़ा लाल" के बीच के सूक्ष्म अंतर को नहीं समझ पाते हैं, और वे अक्सर चिकित्सा सलाह बना लेते हैं (हैलुसिनेशन) क्योंकि उन्होंने पर्याप्त वास्तविक डॉक्टर के नोट्स नहीं पढ़े होते हैं।

इस पेपर के लेखकों ने एक नया AI सिस्टम बनाया है जिसे MMIR-TCM कहा जाता है। इसे एक डिजिटल विशेषज्ञों की तीन-सदस्यीय टीम के रूप में समझें जो मानव टीसीएम डॉक्टर की तरह मिलकर मेडिकल मिस्ट्री को सुलझाने का काम करती है।


तीन-चरणीय टीम

यह सिस्टम तीन अलग-अलग चरणों में काम करता है, जो एक केस फाइल को एक विशेषज्ञ से दूसरे विशेषज्ञ तक पहुँचाता है:

1. "क्लीन-अप क्रू" (मेमोरी-SAM)

समस्या: जब आप क्लिनिक में जीभ की फोटो लेते हैं, तो वह अव्यवस्थित होती है। वहां दांत, होंठ, छाया या बैकग्राउंड में कोई नीला शर्ट हो सकता है। पुराने AI मॉडल इस शोर-शराबे से विचलित हो जाते हैं।
समाधान: टीम का पहला हिस्सा एक "क्लीन-अप क्रू" है। इसे हजारों नई तस्वीरों पर फिर से प्रशिक्षित होने की आवश्यकता नहीं है। इसके बजाय, यह "मेमोरी बैंक" के आदर्श उदाहरणों का उपयोग करता है। यह एक अव्यवस्थित फोटो को देखता है, अपनी मेमोरी में सबसे अच्छा मिलान ढूंढता है, और तुरंत केवल जीभ के चारों ओर एक सटीक रूपरेखा खींच देता है, जिससे होंठ और बैकग्राउंड कट जाते हैं।
उपमा: कल्पना कीजिए कि एक फोटो एडिटर तुरंत एक तस्वीर को क्रॉप कर देता है ताकि केवल चेहरा दिखाई दे, पीछे के बिखरे हुए कमरे को हटा दिया जाए, ताकि अगला व्यक्ति पूरी तरह से चेहरे पर ध्यान केंद्रित कर सके।

2. "डिस्क्रिप्टिव स्क्राइब" (Qwen3-VL)

समस्या: मानव डॉक्टर जीभ का वर्णन कई अलग-अलग तरीकों से करते हैं। कोई कह सकता है "लाल टिप," दूसरा कह सकता है "जलता हुआ लाल टिप।" यह विसंगति उन कंप्यूटरों को भ्रमित करती है जो पैटर्न खोजने की कोशिश कर रहे हैं।
समाधान: दूसरा विशेषज्ञ एक "डिस्क्रिप्टिव स्क्राइब" (वर्णन करने वाला लेखक) है। यह साफ जीभ की फोटो को देखता है और एक बहुत ही विशिष्ट, एक-वाक्य की रिपोर्ट लिखता है। यह खुद को एक मानक प्रारूप का उपयोग करने के लिए मजबूर करता है: "जीभ का शरीर [रंग] है, आकार [आकार] है, और कोटिंग [रंग/मोटाई] है।"
उपमा: एक छात्र को अव्यवस्थित निबंध लिखने देने के बजाय, यह स्क्राइब उन्हें एक मानकीकृत फॉर्म भरने के लिए मजबूर करता है जिसमें चेकबॉक्स होते हैं। यह सुनिश्चित करता है कि प्रत्येक विवरण एक ही तरह से लिखा जाए, जिससे अगले चरण के लिए इसे पढ़ना आसान हो जाता है।

3. "रिसर्च लाइब्रेरियन" (RAG + Qwen3)

समस्या: भले ही AI जीभ का वर्णन पूरी तरह से कर दे, लेकिन उसे यह नहीं पता होगा कि कौन सी दवा निर्धारित करनी है। यदि वह केवल अपने सामान्य प्रशिक्षण के आधार पर अनुमान लगाता है, तो वह एक नकली जड़ी-बूटी या खतरनाक खुराक बना सकता है।
समाधान: तीसरा विशेषज्ञ एक "रिसर्च लाइब्रेरियन" है। उत्तर देने से पहले, यह लाइब्रेरियन चार अस्पतालों के 124,593 वास्तविक, गुमनाम रोगी रिकॉर्ड्स वाले एक विशाल डिजिटल पुस्तकालय में जाता है।

  • यह रोगी के जीभ के विवरण और इतिहास को देखता है।
  • यह लाइब्रेरी में ऐसे 124,593 वास्तविक मामलों की खोज करता है जो समान दिखते हैं।
  • यह पढ़ता है कि उन पिछले मामलों में वास्तविक डॉक्टरों ने क्या किया था।
  • इसके बाद, यह केवल उन्हीं रिकॉर्ड्स के आधार पर नुस्खा लिखता है जो उसने पाया है, और साक्ष्य का हवाला भी देता है।
    उपमा: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है। अपनी याददाश्त से अनुमान लगाने के बजाय, छात्र को पिछले परीक्षाओं और समाधानों की एक किताब खोलने की अनुमति है। AI उत्तर "बनाता" नहीं है; यह वास्तविक दुनिया के प्रमाण की किताब में उत्तर ढूंढता है।

नया टूल: एक बेहतर स्कोरकार्ड (TDEU)

लेखकों ने महसूस किया कि मानक AI स्कोरकार्ड (जैसे BLEU या ROUGE) चिकित्सा सलाह का न्याय करने में खराब हैं।

  • पुराना तरीका: यदि AI कहता है "लाल जीभ" और डॉक्टर ने "थोड़ा लाल" कहा, तो एक मानक कंप्यूटर कहेगा "गलत!" क्योंकि शब्द बिल्कुल मेल नहीं खाते।
  • नया तरीका (TDEU): लेखकों ने TDEU नामक एक नया स्कोर बनाया है। यह एक TCM विशेषज्ञ जज की तरह कार्य करता है। यह जानता है कि "लाल" और "थोड़ा लाल" अर्थ में बहुत समान हैं, लेकिन "लाल" और "पीला" पूरी तरह से अलग हैं। यह यह भी जानता है कि जीभ का रंग गलत होना एक मामूली विवरण चूकने की तुलना में बड़ी गलती है।
  • परिणाम: यह नया स्कोरकार्ड AI की चिकित्सा समझ को अधिक निष्पक्ष ग्रेड देता है।

उन्होंने क्या पाया? (परिणाम)

टीम ने अपने नए डेटासेट, MedTCM, और अपने नए स्कोरकार्ड, TDEU का उपयोग करके शीर्ष-स्तरीय AI मॉडल (जैसे GPT-4o और Gemini) के विरुद्ध अपने सिस्टम का परीक्षण किया।

  1. दिग्गजों से बेहतर: MMIR-TCM अग्रणी सामान्य AI मॉडल से काफी बेहतर प्रदर्शन करता है। यह जीभ का वर्णन करने और नुस्खे सुझाने में बहुत बेहतर था।
  2. "क्लीन-अप" मदद करता है: भले ही "क्लीन-अप क्रू" (चरण 1) ने AI को जीनियस नहीं बनाया, लेकिन इसने सिस्टम को अधिक स्थिर और सुसंगत बना दिया, जैसे कैमरे पर एक साफ लेंस लगाना।
  3. लाइब्रेरी महत्वपूर्ण है: जब उन्होंने "रिसर्च लाइब्रेरियन" (वह हिस्सा जो वास्तविक रोगी रिकॉर्ड खोजता है) को हटा दिया, तो AI का प्रदर्शन नाटकीय रूप से गिर गया। यह साबित करता है कि AI को वास्तविक चिकित्सा इतिहास में स्थापित करना इसे सुरक्षित और सटीक बनाने का सबसे महत्वपूर्ण हिस्सा है।
  4. डॉक्टरों की स्वीकृति: जब 12 वास्तविक TCM डॉक्टरों ने AI के सुझावों की तुलना एक शीर्ष वाणिज्यिक AI (GPT-4o) से की, तो उन्होंने MM-IR-TCM को प्राथमिकता दी। उन्हें लगा कि यह सुरक्षित है और TCM तर्क का बेहतर पालन करता है, भले ही यह पूर्ण न हो।

निचोड़ (Bottom Line)

पेपर का दावा है कि MMIR-TCM एक नया, तीन-चरणीय सिस्टम है जो:

  1. जीभ की तस्वीरों को स्वचालित रूप से साफ करता है।
  2. उन्हें एक मानक, कंप्यूटर-अनुकूल तरीके से वर्णित करता है।
  3. एक विशाल डेटाबेस में वास्तविक पिछले मामलों को देखकर चिकित्सा सलाह लिखता है।

इसे डॉक्टरों के सहायक के रूप में डिज़ाइन किया गया है, न कि उनके विकल्प के रूप में। यह सिस्टम पारदर्शी (अपने साक्ष्य दिखाना) और सुरक्षित (वास्तविक डेटा पर आधारित) है, जो कंप्यूटर-सहायता प्राप्त पारंपरिक चीनी चिकित्सा के भविष्य के लिए एक आशाजनक उपकरण बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →