Reinforcement Learning Improves LLM Accuracy and Reasoning in Disease Classification from Radiology Reports
यह शोध पत्र रेडियोलॉजी रिपोर्ट से बीमारियों को वर्गीकृत करने के लिए हल्के (lightweight) LLMs की सटीकता और तर्क क्षमताओं दोनों को बढ़ाने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग को ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन के साथ संयोजित करने वाले एक दो-चरणीय ढांचे का प्रस्ताव करता है, जो कई डेटासेट पर मानक बेसलाइन से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन अनुभवहीन मेडिकल छात्र है जिसका नाम LLM है। इस छात्र ने लाखों मेडिकल टेक्स्टबुक्स (इंटरनेट) पढ़ रखी हैं और उसे बहुत सारी जानकारी है, लेकिन उसने अभी तक अस्पताल के माहौल में विशिष्ट रोगी रिपोर्टों (patient reports) पर अपने ज्ञान को लागू करना नहीं सीखा है।
इस शोध पत्र का लक्ष्य इस छात्र को रेडियोलॉजी रिपोर्ट (जैसे एक्स-रे नोट्स) से बीमारियों का सटीक निदान करने में सक्षम बनाना है और सबसे महत्वपूर्ण बात यह है कि उन्हें यह भी समझाना है कि उन्होंने वे निदान क्यों किए।
यहाँ बताया गया है कि शोधकर्ताओं ने इस छात्र को कैसे प्रशिक्षित किया, जिसे सरल चरणों में विभाजित किया गया है:
1. समस्या: "रटने वाला" जाल (The "Rote Learner" Trap)
सबसे पहले, शोधकर्ताओं ने प्रशिक्षण के मानक तरीके का उपयोग किया: सुपरवाइज्ड फाइन-ट्यूनिंग (SFT)।
- उपमा (Analogy): कल्पना करें कि आप छात्र को 2,000 एक्स-रे रिपोर्टों का एक ढेर देते हैं और साथ में केवल उत्तर कुंजी (answer key) भी देते हैं (जैसे, "इस मरीज को निमोनिया है")। आप उनसे कहते हैं, "इन उत्तरों को याद कर लो।"
- परिणाम: छात्र सही बीमारी का अनुमान लगाने में बहुत अच्छा हो जाता है। लेकिन, वे एक "रटने वाले शिक्षार्थी" बन जाते हैं। यदि आप उनसे पूछते हैं, "आपको कैसे पता चला कि यह निमोनिया है?" तो वे शायद सिर्फ इतना कहेंगे, "क्योंकि उत्तर कुंजी में ऐसा ही था," या वे अपनी तर्क प्रक्रिया को समझाने की क्षमता पूरी तरह से खो सकते हैं। वे जानते हैं कि उत्तर क्या है, लेकिन वे क्यों समझने की क्षमता खो देते हैं। चिकित्सा में, "क्या" जानने जितना ही महत्वपूर्ण "क्यों" जानना है।
2. समाधान: "कोच" (Reinforcement Learning)
इसे ठीक करने के लिए, शोधकर्ताओं ने GRPO (ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन) नामक तकनीक का उपयोग करके प्रशिक्षण का दूसरा चरण जोड़ा।
- उपमा: केवल उत्तर कुंजी देने के बजाय, अब वे एक सख्त कोच की तरह कार्य करते हैं। छात्र को उन्हीं 2,000 रिपोर्टों को फिर से हल करने के लिए कहा जाता है, लेकिन इस बार उन्हें उत्तर देने से पहले अपना तर्क (reasoning) लिखना होगा।
- नियम: कोच यह देखने के लिए तर्क को नहीं पढ़ता कि वह कितना "परफेक्ट" है (क्योंकि उनके पास कोई परफेक्ट रीजनिंग गाइड नहीं है)। इसके बजाय, कोच एक नियम-आधारित स्कोरकार्ड (Rule-Based Scorecard) का उपयोग करता है:
- क्या आपने बीमारी सही बताई? (सटीकता/Accuracy)
- क्या आपने प्रारूप (format) का पालन किया? (क्या आपने वास्तव में एक तर्क अनुभाग लिखा, या आपने केवल उत्तर को कॉपी किया?)
- ट्विस्ट: यदि छात्र एक ऐसा तर्क अनुभाग लिखता है जो खाली है या केवल उत्तर को दोहराता है, तो उसे शून्य स्कोर मिलता है। अंक पाने के लिए उन्हें एक वास्तविक स्पष्टीकरण लिखना ही होगा।
यह छात्र को "सोचने" के लिए मजबूर करता है। वे सीखते हैं कि उच्च स्कोर प्राप्त करने के लिए, वे केवल अनुमान नहीं लगा सकते; उन्हें रिपोर्ट और निदान के बीच एक तार्किक सेतु (logical bridge) बनाना होगा।
3. "समिति" रणनीति (Ensemble & Summarization)
कोच के साथ भी, छात्र एक एकल प्रयास में गलती कर सकता है। इसलिए, शोधकर्ताओं ने अंतिम परीक्षण के दौरान एक चतुर तकनीक जोड़ी।
- उपमा: छात्र को एक उत्तर देने के बजाय, वे उनसे एक ही रिपोर्ट पर स्वतंत्र रूप से पाँच बार सोचने के लिए कहते हैं।
- प्रयास 1: "मुझे लगता है कि यह निमोनिया है क्योंकि..."
- प्रयास 2: "मुझे लगता है कि यह निमोनिया है क्योंकि..."
- प्रयास 3: "रुको, शायद यह केवल फ्लूइड (fluid) है..."
- वोटिंग (The Vote): सिस्टम सभी पाँचों उत्तरों को लेता है और बहुमत मतदान (Majority Voting) का उपयोग करता है। यदि 5 में से 3 लोग "निमोनिया" कहते हैं, तो वह अंतिम निदान होता है। यह अंतिम उत्तर को बहुत अधिक विश्वसनीय बनाता है, जैसे डॉक्टरों की एक समिति किसी निदान पर सहमत होती है।
- सारांश (The Summary): अंत में, एक "सीनियर रेडियोलॉजिस्ट" (एक अन्य AI) सभी पाँचों तर्क प्रयासों को पढ़ता है और अंतिम निर्णय को समझाने के लिए एक साफ, सुसंगत सारांश रिपोर्ट लिखता है।
4. परिणाम: अधिक स्मार्ट और अधिक ईमानदार
शोधकर्ताओं ने वास्तविक अस्पताल की रिपोर्टों के तीन अलग-अलग सेटों पर इस पद्धति का परीक्षण किया।
- सटीकता (Accuracy): छात्र पहले की तुलना में बीमारियों का निदान करने में बेहतर हुआ।
- तर्क (Reasoning): सबसे महत्वपूर्ण बात यह है कि छात्र बेहतर स्पष्टीकरण लिखने लगा। उन्होंने केवल बीमारियों की सूची नहीं बनाई; उन्होंने रिपोर्ट के उन विशिष्ट वाक्यांशों की ओर इशारा किया जो उनके तर्क को सिद्ध करते थे।
- तुलना: भले ही छात्र "लाइटवेट" (बड़ी कंपनियों के विशाल सुपर-कंप्यूटरों की तुलना में छोटा और सस्ता) था, इस दो-चरणीय प्रशिक्षण ने उन्हें बड़ी टेक कंपनियों द्वारा उपयोग किए जाने वाले विशाल, महंगे मॉडलों के लगभग बराबर प्रदर्शन करने में सक्षम बनाया।
मुख्य निष्कर्ष (The Big Picture Takeaway)
इस शोध को AI डॉक्टरों के लिए एक नए प्रशिक्षण मैनुअल के रूप में देखें।
- चरण 1: उन्हें तथ्य सिखाएं (SFT)।
- चरण 2: उन्हें बिना किसी शिक्षक द्वारा हर वाक्य को ग्रेड कराए बिना अपने उत्तरों को उचित ठहराना सिखाएं (GRPO)।
- चरण 3: उन्हें उत्तर पर वोट करने और तर्क का सारांश लिखने के लिए कहें (Ensemble)।
परिणामस्वरूप एक ऐसा AI प्राप्त होता है जो न केवल सटीक है बल्कि विश्वसनीय भी है क्योंकि वह अपने तर्क को समझा सकता है, ठीक वैसे ही जैसे एक मानव डॉक्टर को करना चाहिए। यह वास्तविक अस्पतालों में AI के सुरक्षित उपयोग की दिशा में एक बड़ा कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।