← नवीनतम पेपर
⚡ electrical engineering

INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT

यह शोध पत्र INFORM-CT को प्रस्तुत करता है, जो एक नवीन 'प्लान-एंड-एग्जीक्यूट' एजेंटिक फ्रेमवर्क है जो पेट के सीटी स्कैन में आकस्मिक निष्कर्षों (incidental findings) का पता लगाने, वर्गीकरण करने और रिपोर्ट करने को स्वचालित करने के लिए लार्ज लैंग्वेज मॉडल्स (LLMs) और विजन-लैंग्वेज मॉडल्स (VLMs) को एकीकृत करता है, जो मौजूदा शुद्ध VLM-आधारित दृष्टिकोणों की तुलना में बेहतर सटीकता और दक्षता प्रदर्शित करता है।

मूल लेखक: Idan Tankel, Nir Mazor, Rafi Brada, Christina LeBedis, Guy ben-Yosef

प्रकाशित 2026-04-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Idan Tankel, Nir Mazor, Rafi Brada, Christina LeBedis, Guy ben-Yosef

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक डॉक्टर हैं जो मरीज के पेट का सीटी स्कैन (CT scan) देख रहे हैं। यह उनके शरीर के अंदर के बहुत विस्तृत, 3D मानचित्र को देखने जैसा है। अक्सर, मुख्य समस्या (जैसे टूटी हुई हड्डी या विशिष्ट दर्द) की तलाश करते समय, डॉक्टर कुछ अन्य, अप्रत्याशित चीजें भी ढूंढ लेते हैं—जैसे लीवर में एक छोटी सी सिस्ट (cyst) या किडनी में एक छोटा सा धब्बा। इन्हें "इन्सिडेंटल फाइंडिंग्स" (incidental findings) कहा जाता है।

ज्यादातर समय, ये हानिरहित होते हैं। लेकिन कभी-कभी, ये गंभीर भी हो सकते हैं। समस्या यह है कि ऐसी बहुत सारी चीजें होती हैं, और यह तय करने के नियम कि किन पर आगे की जांच की जरूरत है, अविश्वसनीय रूप से जटिल हैं, जो मोटे मैनुअल्स (गाइडलाइन्स) में लिखे होते हैं और अक्सर बदलते रहते हैं। हर एक चीज़ की हाथ से जांच करना धीमा, थका देने वाला है और कभी-कभी इससे अलग-अलग डॉक्टरों के निर्णय भी अलग हो सकते हैं।

यह शोध पत्र एक नए रोबोटिक सहायक INFORM-CT को पेश करता है जो इस काम में मदद करने के लिए बनाया गया है। यह कैसे काम करता है, इसे रोजमर्रा के उदाहरणों के साथ समझाया गया है:

1. दिमाग और हाथ (एक "प्लान-एंड-एक्जीक्यूट" टीम)

INFORM-CT को एक साथ काम करने वाली दो लोगों की टीम के रूप में समझें:

  • दिमाग (द प्लानर/योजना बनाने वाला): यह एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) है जो जटिल मेडिकल नियमपुस्तिकाओं को पढ़ता है। यह खुद एक्स-रे नहीं देखता; इसके बजाय, यह एक प्रोजेक्ट मैनेजर की तरह काम करता है। यह नियमों को पढ़ता है और कहता है, "ठीक है, लीवर की जांच करने के लिए, हमें स्टेप A करना होगा, फिर स्टेप B करना होगा, फिर इस विशिष्ट चीज़ को मापना होगा।"
  • हाथ (द एक्जीक्यूटर/कार्य करने वाला): यह वह हिस्सा है जो वास्तव में काम करता है। यह दिमाग के निर्देशों को लेता है और काम करने के लिए एक कंप्यूटर प्रोग्राम (पायथन कोड) लिखता है। यह "विशेष उपकरणों" (जैसे कि एक स्केल, आवर्धक लेंस, या रंग पहचानने वाला टूल) का उपयोग करके स्कैन पर मौजूद धब्बों को मापता है।

उपमा: कल्पना कीजिए कि आप एक बहुत ही सख्त और जटिल रेसिपी के आधार पर केक बना रहे हैं।

  • दिमाग मुख्य शेफ है जो रेसिपी पढ़ता है और आपको बताता है कि क्या करना है: "पहले आटा छानें। फिर, जांचें कि अंडे ताजे हैं या नहीं। यदि अंडे पुराने हैं, तो रुक जाएं। यदि वे ताजे हैं, तो 5 मिनट तक मिलाएं।"
  • हाथ सहायक शेफ (sous-chefs) हैं जो वास्तव में छननी पकड़ते हैं, अंडे फोड़ते हैं और मिक्सर चालू करते हैं। वे यह तय नहीं करते कि क्या करना है; वे बस सटीक निर्देशों का पालन करते हैं ताकि काम पूरी तरह से हो सके।

2. टूलकिट (बेस फंक्शन्स)

"हाथों" के पास केवल अनुमान लगाने की शक्ति नहीं है। उनके पास पहले से बने कौशल का एक टूलबॉक्स है:

  • सेगमेंटेशन (Segmentation): एक डिजिटल हाइलाइटर की तरह जो लीवर या किडनी की रूपरेखा को पूरी तरह से ट्रेस कर सकता है।
  • मापन (Measurement): एक डिजिटल स्केल जो मिलीमीटर में किसी धब्बे के आकार को मापता है।
  • इंटेंसिटी चेक (Intensity Check): एक टूल जो यह जांचता है कि कोई धब्बा कितना "चमकीला" या "गहरा" है (जैसे यह देखना कि चोट का निशान नया है या पुराना)।
  • लेबलर (The Labeler): एक स्मार्ट असिस्टेंट जो किसी धब्बे को देखता है और कहता है, "यह एक हानिरहित सिस्ट लग रहा है" या "यह संदिग्ध लग रहा है," जैसा कि उसने हजारों अन्य स्कैन से सीखा है।

3. "कोशिश करो, विफल हो, ठीक करो" लूप (The "Try, Fail, Fix" Loop)

इस सिस्टम का सबसे शानदार हिस्सा यह है कि यह केवल एक बार नहीं चलता और सफल होने की उम्मीद नहीं करता।

  1. दिमाग एक योजना लिखता है।
  2. हाथ उस योजना को चलाने की कोशिश करते हैं।
  3. यदि योजना में कोई गलती होती है (जैसे कि ऐसी किडनी को मापने की कोशिश करना जो मिली ही नहीं), तो सिस्टम त्रुटि को पकड़ लेता है।
  4. दिमाग को एरर मैसेज मिलता है, वह सोचता है, "ओह, मैं इसके लिए जांच करना भूल गया था," और योजना को फिर से लिखता है।
  5. यह तब तक चलता रहता है जब तक कि योजना पूरी तरह से काम न करने लगे।

यह एक प्रोग्रामर द्वारा कोड को डीबग करने जैसा है, लेकिन यहाँ AI स्वचालित रूप से यह सुनिश्चित करने के लिए ऐसा करता है कि मेडिकल नियमों का सटीक रूप से पालन हो।

4. यह सिर्फ "देखने" से बेहतर क्यों है?

पिछले AI टूल्स ने स्कैन को देखा और एक ही बार में उत्तर का अनुमान लगाने की कोशिश की (जैसे बिना अपना काम दिखाए टेस्ट देने वाला छात्र)। वे अक्सर भ्रमित हो जाते थे या विवरण चूक जाते थे।

INFORM-CT अलग है क्योंकि यह अपना काम दिखाता है। यह समस्या को छोटे, तार्किक चरणों में तोड़ देता है, ठीक वैसे ही जैसे एक मानव डॉक्टर करता है।

  • पुराना तरीका: "मुझे लगता है कि यह धब्बा बुरा है।" (अनुमान)
  • INFORM-CT का तरीका: "मुझे एक धब्बा मिला। यह 15 मिमी चौड़ा है। यह लीवर पर है। नियम कहते हैं कि 10 मिमी से ऊपर की किसी भी चीज़ के लिए फॉलो-अप की आवश्यकता होती है। इसलिए, मैं फॉलो-अप की सिफारिश करता हूँ।" (तर्क)

परिणाम

शोधकर्ताओं ने इसका परीक्षण लीवर, किडनी और अग्न्याशय (pancreas) के हजारों वास्तविक सीटी स्कैन पर किया। उन्होंने पाया कि:

  • यह अधिक सटीक है: इसने पिछले AI मॉडलों की तुलना में नियमों का बहुत बेहतर पालन किया।
  • यह व्याख्या योग्य (explainable) है: आप देख सकते हैं कि इसने निर्णय क्यों लिया क्योंकि यह चरण-दर-चरण योजना का पालन करता है।
  • यह लचीला है: यदि मेडिकल नियम बदलते हैं (जैसे कि किसी मेडिकल एसोसिएशन से नया गाइडलाइन आता है), तो आप बस नियम पुस्तिका को अपडेट करते हैं, और दिमाग स्वचालित रूप से एक नई योजना लिख देता है। पूरे सिस्टम को फिर से प्रशिक्षित करने की आवश्यकता नहीं है।

संक्षेप में: INFORM-CT एक स्मार्ट, नियम का पालन करने वाला रोबोटिक सहायक है जो डॉक्टरों को सीटी स्कैन में मिलने वाली "ओह, मुझे कुछ और भी मिल गया" जैसी अत्यधिक स्थितियों को संभालने में मदद करता है, जिससे यह सुनिश्चित होता है कि कोई भी खतरनाक चीज़ छूटे नहीं और कोई भी हानिरहित चीज़ अनावश्यक घबराहट पैदा न करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →