← नवीनतम पेपर
⚡ electrical engineering

Large Language Model-Assisted Cleaning of Report-Derived Labels in a Large-Scale Chest CT Dataset

यह अध्ययन प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल-सहायता प्राप्त लेबल क्लीनिंग, CT-RATE चेस्ट सीटी डेटासेट में रेडियोलॉजी रिपोर्ट और मौजूदा लेबल के बीच नैदानिक रूप से सार्थक विसंगतियों को प्रभावी ढंग से पहचानती और हल करती है, जो रेडियोलॉजिस्ट अधिनिर्णय के साथ उच्च सहमति प्राप्त करती है और सार्वजनिक इमेजिंग डेटा के लिए स्केलेबल गुणवत्ता सुधार का समर्थन करती है।

मूल लेखक: Yosuke Yamagishi, Atsushi Takamatsu, Mototsugu Sato, Tomohiro Kikuchi, Shouhei Hanaoka, Takeharu Yoshikawa, Osamu Abe

प्रकाशित 2026-06-23
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yosuke Yamagishi, Atsushi Takamatsu, Mototsugu Sato, Tomohiro Kikuchi, Shouhei Hanaoka, Takeharu Yoshikawa, Osamu Abe

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास मेडिकल टेक्स्टबुक्स (रेडियोलॉजी रिपोर्ट्स) का एक विशाल पुस्तकालय है जो हजारों चेस्ट सीटी स्कैन का वर्णन करती है। साथ ही, प्रत्येक पुस्तक के साथ किसी ने एक "चीट शीट" (डेटासेट लेबल) भी बनाई है, जो सारांश देती है कि मरीज के साथ क्या समस्या है, जैसे कि "निमोनिया" या "बढ़े हुए लिम्फ नोड्स"।

समस्या यह है कि कभी-कभी चीट शीट और किताब की कहानी पूरी तरह मेल नहीं खाती। शायद किताब कहती है, "हमें एक छोटा सा धब्बा दिख सकता है," लेकिन चीट शीट बड़े साहस से कहती है, "निमोनिया मौजूद है।" आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, यदि आप एक रोबोट को इन चीट शीट्स से सीखने के लिए प्रशिक्षित करते हैं, तो वह गलत सबक सीख जाएगा।

यह पेपर इस बारे में है कि कैसे शोधकर्ताओं की एक टीम ने इन चीट शीट्स के लिए एक प्रूफरीडर के रूप में काम करने के लिए एक बहुत ही स्मार्ट AI टूल (एक लार्ज लैंग्वेज मॉडल, या LLM) का उपयोग किया। उन्होंने इसे कैसे किया, यहाँ सरल भाषा में समझाया गया है:

जासूसी का काम

शोधकर्ताओं ने CT-RATE नामक एक बहुत बड़ा सार्वजनिक डेटासेट लिया, जिसमें लगभग 24,000 चेस्ट सीटी रिपोर्ट्स और उनके संबंधित लेबल शामिल हैं। उन्होंने एक बहुत ही उन्नत AI (GPT-5.4) से रिपोर्ट्स के टेक्स्ट को शुरू से पढ़ने और अपनी खुद की चीट शीट लिखने के लिए कहा।

इसे इस तरह समझें:

  • मूल चीट शीट: एक जल्दबाजी में किए गए छात्र के नोट्स।
  • AI प्रूफरीडर: एक सूक्ष्म पुस्तकालयाध्यक्ष (लाइब्रेरियन) जो मूल पुस्तक को पढ़ता है और केवल उसी के आधार पर नोट्स का एक नया सेट लिखता है जो स्पष्ट रूप से लिखा गया है।
  • तुलना: शोधकर्ताओं ने यह देखने के लिए छात्र के नोट्स की तुलना लाइब्रेरियन के नोट्स से की कि वे कहाँ असहमत थे।

उन्हें क्या मिला

  1. ज्यादातर सही, लेकिन पूर्ण नहीं: AI प्रूफरीडर मूल नोट्स के साथ 96.4% बार सहमत था। यह एक उच्च स्कोर है, लेकिन इस आकार के पुस्तकालय में, 3.6% की त्रुटि दर का मतलब हजारों गलतियाँ हैं।
  2. कठिन स्थान: एक विशिष्ट श्रेणी, लिम्फैडेनोपैथी (सूजे हुए लिम्फ नोड्स), काफी गड़बड़ थी। सहमति बहुत कम थी। शोधकर्ताओं ने पाया कि मूल नोट्स अक्सर बहुत अस्पष्ट या बहुत सख्त थे। उदाहरण के लिए, रिपोर्ट में "छोटे लिम्फ नोड्स" (जो सामान्य हैं) का उल्लेख हो सकता है, लेकिन मूल लेबल ने इसे "बीमारी मौजूद है" के रूप में चिह्नित किया। AI प्रूफरीडर ने इन छोटे, सामान्य नोड्स को सही ढंग से अनदेखा कर दिया।
  3. मानवीय निर्णय: विवादों को सुलझाने के लिए, वास्तविक डॉक्टरों (रेडियोलॉजिस्ट) ने उन मामलों को देखा जहाँ AI और मूल नोट्स असहमत थे।
    • सामान्य असहमतियों में, डॉक्टर AI के पक्ष में 74% बार थे।
    • कठिन लिम्फ नोड वाले मामलों के लिए, डॉक्टर AI के पक्ष में 92% बार थे। यह सुझाव देता है कि मूल लेबल अक्सर गलत थे, और AI ने उन्हें पकड़ लिया था।

"टीम वोट" रणनीति

शोधकर्ताओं ने केवल एक AI पर भरोसा नहीं किया। उन्होंने एक दूसरा और तीसरा AI मॉडल आज़माया और उन्हें वोट देने के लिए कहा।

  • कल्पना कीजिए कि टैलेंट शो में तीन जज हैं। यदि तीन में से दो जज एक स्कोर पर सहमत होते हैं, तो वह स्कोर केवल एक जज की राय की तुलना में अधिक विश्वसनीय होता है।
  • इस "बहुमत वोट" पद्धति ने सबसे सटीक लेबल बनाए, जो मूल डेटासेट या किसी भी एकल AI से बेहतर थे।

मुख्य निष्कर्ष

मुख्य निष्कर्ष यह है कि AI मेडिकल डेटा के लिए एक शक्तिशाली गुणवत्ता नियंत्रण उपकरण हो सकता है।

जिस तरह एक स्पेल-चेकर आपके निबंध में टाइपो खोजने में मदद करता है, उसी तरह यह LLM-सहायता प्राप्त विधि विशाल मेडिकल डेटासेट में "लेबल टाइपो" को खोजने में मदद करती है। इन त्रुटियों को साफ करके, शोधकर्ताओं ने इस डेटासेट का एक "परिष्कृत" संस्करण बनाया है जो अधिक ईमानदार है कि उनकी रिपोर्ट्स वास्तव में क्या कहती हैं। वे इस स्वच्छ संस्करण को जनता के साथ साझा करने की योजना बना रहे हैं ताकि अन्य वैज्ञानिक खराब डेटा से सीखने के बजाय बेहतर AI मॉडल बना सकें।

महत्वपूर्ण नोट: शोधकर्ता सावधानी बरतते हुए कहते हैं कि उनका AI रिपोर्ट्स के टेक्स्ट को पढ़ रहा है, न कि वास्तविक एक्स-रे छवियों को देख रहा है। इसलिए, वे यह देख रहे हैं कि क्या लेबल कहानी से मेल खाते हैं, न कि यह कि कहानी मरीज के शरीर की वास्तविकता से मेल खाती है या नहीं। हालांकि, डेटासेट की आंतरिक निरंतरता को ठीक करने के उद्देश्य से, यह तरीका बहुत अच्छा काम कर गया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →