← नवीनतम पेपर
💬 NLP

PromptRad: Knowledge-Enhanced Multi-Label Prompt-Tuning for Low-Resource Radiology Report Labeling

PromptRad एक ज्ञान-संवर्धित प्रॉम्प्ट-ट्यूनिंग फ्रेमवर्क है जो रेडियोलॉजी रिपोर्ट लेबलिंग को UMLS समानार्थी शब्दों का उपयोग करके मास्क्ड लैंग्वेज मॉडलिंग के रूप में पुनर्गठित करता है, जिससे न्यूनतम लेबल किए गए डेटा के साथ उच्च-प्रदर्शन वाली मल्टी-लेबल वर्गीकरण सक्षम होती है और पारंपरिक फाइन-ट्यूनिंग एवं डिक्शनरी-आधारित विधियों से बेहतर प्रदर्शन करती है।

मूल लेखक: Ying-Jia Lin, Tzu-Chin Lo, Ping-Chien Li, Chi-Tung Cheng, Chien-Hung Liao, Hung-Yu Kao

प्रकाशित 2026-05-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ying-Jia Lin, Tzu-Chin Lo, Ping-Chien Li, Chi-Tung Cheng, Chien-Hung Liao, Hung-Yu Kao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइब्रेरियन हैं जो मेडिकल रिपोर्ट्स के एक विशाल, अराजक पुस्तकालय को व्यवस्थित करने की कोशिश कर रहे हैं। ये रिपोर्ट्स डॉक्टरों द्वारा लिखे गए लंबे, अव्यवस्थित पैराग्राफ हैं जो तकनीकी शब्दों (jargon), समानार्थी शब्दों और "कैंसर के कोई संकेत नहीं" (जिसका अर्थ है कि मरीज ठीक है) या "इन्फेक्शन की संभावना को खारिज करें" (जिसका अर्थ भी यह है कि मरीज ठीक है) जैसे पेचीदा वाक्यांशों से भरे हुए हैं।

आपका लक्ष्य इन रिपोर्ट्स को विशिष्ट लेबल देना है, जैसे कि "Cyst," "Tumor," या "Liver Damage," ताकि कंप्यूटर बाद में इन्हें ढूंढ सके। इसे रिपोर्ट लेबलिंग (report labeling) कहा जाता है।

यहाँ समस्या है:

  1. पुराने नियम-आधारित सिस्टम (Old Rule-Based Systems): ये एक ऐसे रोबोट की तरह हैं जो केवल सटीक शब्दों को खोजता है। यदि रिपोर्ट कहती है "fatty liver" लेकिन आपकी सूची में केवल "Steatosis" है, तो रोबोट इसे मिस कर देता है। यदि रिपोर्ट कहती है "No tumor," तो रोबोट भ्रमित हो सकता है और सोच सकता है कि उसने ट्यूमर पा लिया है क्योंकि उसने "tumor" शब्द देखा था।
  2. स्टैंडर्ड एआई (Standard AI - Deep Learning): यह एक प्रतिभाशाली छात्र की तरह है जिसे काम सीखने के लिए हजारों पहले से टैग की गई किताबें पढ़ने की आवश्यकता होती है। लेकिन एक अस्पताल में, डॉक्टर हजारों रिपोर्ट्स को टैग करने के लिए बहुत व्यस्त होते हैं। हमारे पास केवल टैग की गई उदाहरणों का एक छोटा ढेर है (शायद 32)। छात्र इसलिए असफल हो जाता है क्योंकि उसने पर्याप्त अध्ययन नहीं किया है।

पेश है: PromptRad

लेखकों ने इस पेपर में एक नया टूल बनाया है जिसे PromptRad कहा जाता है। इसे उस प्रतिभाशाली छात्र के लिए एक स्मार्ट 'स्टडी हैक' की तरह समझें जिसके पास अध्ययन करने के लिए केवल किताबों का एक छोटा ढेर है।

1. "खाली स्थान भरो" वाला तरीका (Prompt-Tuning)

एआई को चीजों को वर्गीकृत करने का एक बिल्कुल नया तरीका सीखने के लिए मजबूर करने के (जिसके लिए बहुत अधिक डेटा की आवश्यकता होती) बजाय, PromptRad इस कार्य को एक खाली स्थान भरने वाले खेल (fill-in-the-blank game) में बदल देता है, जो बिल्कुल वैसा ही है जैसा कि एआई को किसी मेडिकल रिपोर्ट को देखने से पहले ही इस पर प्रशिक्षित किया गया था।

  • पुराना तरीका: "यहाँ एक रिपोर्ट है। क्या यहाँ ट्यूमर है? हाँ/नहीं।" (इसके लिए एक नए, जटिल मस्तिष्क संरचना की आवश्यकता होती है)।
  • PromptRad का तरीका: "रेडियोलॉजी रिपोर्ट [खाली स्थान] से संबंधित है।"
    • एआई को बस खाली स्थान में फिट होने वाले शब्द का अनुमान लगाना है। यदि वह "Hepatoma" (एक प्रकार का ट्यूमर) का अनुमान लगाता है, तो सिस्टम जान जाता है कि यह रिपोर्ट ट्यूमर के बारे में है।

चूंकि एआई पहले से ही गायब शब्दों का अनुमान लगाने में विशेषज्ञ है (उसने पूरे इंटरनेट को पढ़कर यह सीखा है), वह बहुत कम नए प्रशिक्षण डेटा के साथ भी यह काम बहुत अच्छी तरह से कर सकता है।

2. "समानार्थी शब्दकोश" (Knowledge-Enhanced Verbalizer)

मेडिकल शब्द पेचीदा होते हैं। एक डॉक्टर "HCC," "hepatoma," या "liver cancer" लिख सकता है जिसका अर्थ बिल्कुल एक ही है।

  • समस्या: यदि एआई केवल यह जानता है कि "HCC" का अर्थ "Hepatocellular Carcinoma" है, तो यह उस रिपोर्ट को मिस कर सकता है जिसमें "hepatoma" लिखा हो।
  • समाधान: लेखकों ने एआई को एक विशेष बहु-शब्द शब्दकोश (multi-word dictionary) दिया है (जो एक विशाल मेडिकल थिसॉरसस UMLS पर आधारित है)।
    • केवल लेबल "Hepatocellular Carcinoma" को शब्द "HCC" से मैप करने के बजाय, उन्होंने इसे "HCC" और "hepatoma" दोनों से मैप किया।
    • अब, यदि एआई खाली स्थान को इनमें से किसी भी शब्द से भरता है, तो वह जानता है कि लेबल मौजूद है। यह एआई को बहुत अधिक लचीला बनाता है और केवल इसलिए किसी निदान को मिस करने की संभावना को कम करता है क्योंकि डॉक्टर ने किसी अलग शब्द का उपयोग किया था।

3. "ऑटो-टीचर" (Automatic Prompt Generation)

लेखकों ने एक ऐसा सिस्टम भी बनाया है जो स्वचालित रूप से "खाली स्थान भरने" वाले प्रश्न को पूछने के विभिन्न तरीकों को आज़माता है ताकि यह देखा जा सके कि कौन सा तरीका एआई को सबसे अच्छी तरह सीखने में मदद करता है। यह एक शिक्षक की तरह है जो एक छात्र को अवधारणा समझाने के लिए अलग-अलग तरीके आज़माता है जब तक कि वह अंततः कहता है, "ओह, मैं समझ गया!"

उन्होंने क्या पाया?

टीम ने एक वास्तविक अस्पताल से Liver CT रिपोर्ट्स पर इसका परीक्षण किया। उन्होंने एआई को सीखने के लिए केवल 32 टैग की गई रिपोर्ट्स दीं (एक "लो-रिसोर्स" सेटिंग)।

  • विशेषज्ञों को पछाड़ना: PromptRad ने पुराने "नियम-आधारित" रोबोटों (जिन्होंने कई समानार्थी शब्दों को मिस कर दिया था) से बेहतर प्रदर्शन किया और यहाँ तक कि उन स्टैंडर्ड एआई मॉडल्स से भी बेहतर प्रदर्शन किया जिन्होंने उन्हीं 32 उदाहरणों से सीखने की कोशिश की थी।
  • विशालकाय को पछाड़ना: आश्चर्यजनक रूप से, PromptRad ने GPT-4 (एक विशाल, अत्यधिक महंगी एआई मॉडल) के लगभग बराबर प्रदर्शन किया, लेकिन PromptRad एक छोटा, हल्का मॉडल है जिसे एक सामान्य कंप्यूटर पर चलाया जा सकता है।
  • "ना" का टेस्ट: मेडिकल रिपोर्ट्स का सबसे कठिन हिस्सा निषेध (negation) को समझना है (जैसे, "कैंसर के कोई प्रमाण नहीं")। PromptRad पुराने नियम-आधारित सिस्टम की तुलना में इन पेचीदा "ना" वाले बयानों को समझने में बहुत बेहतर था।

यह क्यों महत्वपूर्ण है?

पेपर का दावा है कि PromptRad एक व्यावहारिक, कम लागत वाला समाधान है उन अस्पतालों के लिए जिनके पास हजारों टैग की गई रिपोर्ट्स नहीं हैं या जिनके पास बड़े क्लाउड कंपनियों (जैसे OpenAI) को संवेदनशील रोगी डेटा भेजने का बजट नहीं है। यह एक छोटे अस्पताल को केवल कुछ उदाहरणों और अपने स्वयं के स्थानीय कंप्यूटरों का उपयोग करके एक स्मार्ट लेबलिंग सिस्टम बनाने की अनुमति देता है, जिससे रोगी का डेटा निजी और सुरक्षित रहता है।

संक्षेप में: PromptRad एक स्मार्ट, हल्का टूल है जो एक छोटे एआई को "खाली स्थान भरने" के खेल और समानार्थी शब्दों के मेडिकल डिक्शनरी का उपयोग करके मेडिकल रिपोर्ट्स पढ़ना सिखाता है, जिससे यह बहुत कम प्रशिक्षण डेटा के साथ भी पूरी तरह से काम करने में सक्षम होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →