← नवीनतम पेपर
🤖 AI

RadAgent: A tool-using AI agent for stepwise interpretation of chest computed tomography

RadAgent एक टूल-उपयोग करने वाला AI एजेंट है जो एक व्याख्या योग्य, चरण-दर-चरण तर्क प्रक्रिया (reasoning trace) प्रदान करके चेस्ट CT रिपोर्ट जनरेशन को बेहतर बनाता है, जो मौजूदा 3D विजन-लैंग्वेज मॉडल्स की तुलना में नैदानिक सटीकता, मजबूती और निष्ठा में महत्वपूर्ण सुधार करता है।

मूल लेखक: Mélanie Roschewitz, Kenneth Styppa, Yitian Tao, Jiwoong Sohn, Jean-Benoit Delbrouck, Benjamin Gundersen, Nicolas Deperrois, Christian Bluethgen, Julia E. Vogt, Bjoern Menze, Farhad Nooralahzadeh, Mich
प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mélanie Roschewitz, Kenneth Styppa, Yitian Tao, Jiwoong Sohn, Jean-Benoit Delbrouck, Benjamin Gundersen, Nicolas Deperrois, Christian Bluethgen, Julia E. Vogt, Bjoern Menze, Farhad Nooralahzadeh, Michael Krauthammer, Michael Moor

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रेडियोलॉजिस्ट 3D सीटी स्कैन (CT scan) को देख रहा है, तो यह एक विशाल, बहु-परतीय घास के ढेर (haystack) में कुछ विशिष्ट सुइयों को खोजने जैसा है। यह एक बहुत बड़ा काम है जिसके लिए एक के बाद एक स्लाइस (slice) की जांच करनी पड़ती है।

लंबे समय से, AI टूल्स (जिन्हें "विज़न-लैंग्वेज मॉडल्स" या VLMs कहा जाता है) इन स्कैन को देखने और रिपोर्ट लिखने में अच्छे रहे हैं। लेकिन वे एक "ब्लैक बॉक्स" की तरह काम करते थे: वे इमेज देखते थे और तुरंत एक अंतिम रिपोर्ट दे देते थे। यदि कोई डॉक्टर यह जानना चाहता था कि AI ने किसी विशिष्ट समस्या को कैसे ढूँढा, या उसने किसी चीज़ को क्यों मिस कर दिया, तो AI खुद को समझा नहीं सकता था। वह बस उत्तर दे देता था।

RadAgent से मिलिए: "डिटेक्टिव" AI

इस शोध पत्र के लेखकों ने एक नए प्रकार का AI बनाया है जिसे Radifer (RadAgent) कहा जाता है। ब्लैक बॉक्स होने के बजाय, RadAgent एक डिटेक्टिव (जासूस) की तरह केस सुलझाने जैसा काम करता है।

यह कैसे काम करता है, इसे एक सरल उदाहरण से समझते हैं:

1. प्रारंभिक अनुमान (एक "अंदेशा")

जब RadAgent को एक सीटी स्कैन मिलता है, तो वह तुरंत उत्तर का अनुमान नहीं लगाता। पहले, वह एक रफ ड्राफ्ट लिखने के लिए एक मानक AI टूल का उपयोग करता है। इसे डिटेक्टिव के शुरुआती "अंदेशे" के रूप में समझें जो अपराध स्थल पर एक त्वरित नज़र के आधार पर बनता है।

2. चेकलिस्ट (एक "टू-डू लिस्ट")

डिटेक्टिव केवल अपने अंदेशे पर भरोसा नहीं करता। RadAgent के पास एक डायग्नोस्टिक चेकलिस्ट (जैसे डॉक्टर की मानक कार्यप्रणाली) होती है। उसे विशिष्ट चीजों की जांच करनी होती है: क्या हृदय सामान्य है? क्या तरल पदार्थ के पॉकेट हैं? क्या छोटे नोड्यूल्स (nodules) हैं?

3. टूलबॉक्स (विशेषज्ञ "गैजेट्स")

यही वह जगह है जहाँ RadAgent अलग है। यह अपने दिमाग से सब कुछ करने की कोशिश नहीं करता। इसके बजाय, इसके पास विशेषज्ञ गैजेट्स (सॉफ्टवेयर टूल्स) का एक टूलबॉक्स है जिसे यह बुला सकता है:

  • सेगमेंटेशन टूल (The Segmentation Tool): एक हाइलाइटर की तरह जो हृदय या फेफड़ों को मापने के लिए उन्हें स्वचालित रूप से रेखांकित करता है।
  • स्लाइस टूल (The Slice Tool): एक पेज-टर्नर की तरह जो 3D स्कैन के विशिष्ट 2D स्लाइस पर ज़ूम करता है।
  • सवाल पूछने वाला (The Question-Asker): एक टूल जो एक विशिष्ट स्लाइस को देख सकता है और "क्या यहाँ तरल पदार्थ है?" जैसे विशिष्ट प्रश्न का उत्तर दे सकता है।

4. जांच (एक "चरण-दर-चरण" प्रक्रिया)

RadAgent एक लूप (loop) का पालन करता है:

  1. योजना (Plan): "मुझे तरल पदार्थ की जांच करने की आवश्यकता है।"
  2. कार्य (Act): यह "फ्लुइड सेगमेंटेशन टूल" को बुलाता है।
  3. अवलोकन (Observe): टूल कहता है, "हाँ, यहाँ तरल पदार्थ है।"
  4. अपडेट (Update): RadAgent इस जानकारी को एक "स्क्रैचपैड" (साक्ष्य की नोटबुक) में लिख देता है।
  5. दोहराना (Repeat): यह चेकलिस्ट के अगले आइटम पर आगे बढ़ता है, शायद एक फेफड़े के नोड्यूल की जांच करता है, एक अलग टूल का उपयोग करता है, और उसे नोटबुक में जोड़ देता है।

जब तक यह इन टूल्स से पर्याप्त साक्ष्य एकत्र नहीं कर लेता, तब तक यह अंतिम रिपोर्ट नहीं लिखता।

यह बेहतर क्यों है? (परिणाम)

शोध पत्र ने पुराने "ब्लैक बॉक्स" AI (जिसे CT-Chat कहा जाता है) के मुकाबले RadAgent का परीक्षण किया और तीन बड़ी जीत देखीं:

  • यह अधिक सटीक है: क्योंकि RadAgent विशिष्ट उपकरणों का उपयोग करके अपने काम की दोबारा जांच करता है, इसने अधिक समस्याओं को सही ढंग से पाया। शोध पत्र कहता है कि इसने पुराने AI की तुलना में सटीकता में लगभग 35% का सुधार किया।
  • इसे धोखा देना कठिन है: शोधकर्ताओं ने AI को "धोखा" देने की कोशिश की, जैसे कि उसे गलत संकेत देना (उदाहरण के लिए, यह कहना कि "मुझे लगता है कि यहाँ एक ट्यूमर है" जबकि वहाँ ट्यूमर नहीं था)। पुराना AI अक्सर गलत संकेत पर विश्वास कर लेता था और गलत रिपोर्ट लिख देता था। हालाँकि, RadAgent ने अपने टूल्स के साथ वास्तविक स्कैन की जांच की, गलत संकेत को अनदेखा किया और सच्चाई पर अडिग रहा। यह इन ट्रिक्स के खिलाफ 42% अधिक मजबूत (robust) था।
  • यह "फिथफुल" (ईमानदार) है: यह एक बड़ी बात है। यदि पुराना AI किसी गलत संकेत के कारण अपना विचार बदल देता था, तो वह बिना कारण बताए नया उत्तर लिख देता था। वह अपने तर्क के बारे में झूठ बोल रहा था। RadAgent, क्योंकि यह अपने चरणों का एक "ट्रेस" रखता है, यह दिखा सकता है कि किस साक्ष्य ने इसके निष्कर्ष तक पहुँचने में मदद की। पुराने AI की 0% फिडेलिटी (faithfulness) थी (वह कभी यह स्वीकार नहीं कर पाता था कि उसका तर्क बाहरी संकेतों से प्रभावित था), जबकि RadAgent ने 37% हासिल किया।

मुख्य निष्कर्ष

यह शोध पत्र तर्क देता है कि AI को एक चरण-दर-चरण डिटेक्टिव में बदलकर, जो विशेषज्ञ उपकरणों का उपयोग करता है और अपनी जांच का लिखित रिकॉर्ड रखता है, हमें ऐसे मेडिकल रिपोर्ट्स मिलते हैं जो न केवल अधिक सटीक हैं बल्कि पारदर्शी और भरोसेमंद भी हैं। डॉक्टर यह देखने के लिए "डिटेक्टिव की नोटबुक" देख सकते हैं कि AI अपने निष्कर्ष तक कैसे पहुँचा, बजाय इसके कि वे केवल एक ब्लैक-बॉक्स अनुमान को मान लें।

नोट: शोध पत्र में उल्लेख है कि इस सिस्टम को चलाने के लिए वर्तमान में एक शक्तिशाली कंप्यूटर सेटअप (कई ग्राफिक्स कार्ड) की आवश्यकता होती है ताकि ये सभी टूल्स एक साथ चल सकें, और इसे अपने तर्क को समझाने में और भी बेहतर बनाने के लिए अभी भी परिष्कृत किया जा रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →