InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training
यह शोध पत्र ORBIT को प्रस्तुत करता है, जो एक रूब्रिक-आधारित वृद्धिशील प्रशिक्षण ढांचा (incremental training framework) है जो खुले-अंत वाले चिकित्सा संवादों पर बड़े भाषा मॉडलों (large language models) को प्रभावी ढंग से संरेखित करने के लिए गतिशील रूप से जनरेट किए गए, केस-कंडीशन्ड रूब्रिक्स का लाभ उठाता है, जिससे पारंपरिक रिवॉर्ड मॉडलिंग की कमियों से बचते हुए न्यूनतम प्रशिक्षण डेटा के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन प्रशिक्षु डॉक्टर (apprentice doctor) को एक कठिन मरीज को संभालने के तरीके सिखाने की कोशिश कर रहे हैं।
अतीत में, एक AI (एक लार्ज लैंग्वेज मॉडल) को एक अच्छा डॉक्टर बनने के लिए सिखाना एक साधारण "थम्स अप" या "थम्स डाउन" देने जैसा था। यदि AI ने गलत उत्तर दिया, तो उसे "थम्स डाउन" मिलता था। यदि वह सही था, तो उसे "थम्स अप" मिलता था।
समस्या:
चिकित्सा संबंधी बातचीत जटिल होती है। एक मरीज कह सकता है, "मेरे पेट में दर्द है।" एक साधारण "थम्स अप/डाउन" प्रणाली यह अंतर नहीं कर पाएगी कि एक डॉक्टर ने कहा "एस्पिरिन लें" (जो खतरनाक हो सकता है) और एक डॉक्टर ने कहा "पहले देखते हैं कि क्या आपको बुखार है, और यदि दर्द गंभीर है, तो हमें तुरंत ER (आपातकालीन कक्ष) जाना चाहिए।" "थम्स अप" प्रणाली बहुत धुंधली है। यह एक जटिल पेंटिंग को केवल यह देखकर आंकने जैसा है कि वह "नीली" है या "नहीं"।
समाधान: ORBIT
यह शोध पत्र एक नई विधि पेश करता है जिसे ORBIT (ओपन-एंडेड रूब्रिक-बेस्ड इनक्रीमेंटल ट्रेनिंग) कहा जाता है। ORBIT को एक प्रशिक्षु डॉक्टर को हर मरीज के लिए एक अनुकूलित चेकलिस्ट (customized checklist) देने के रूप में समझें, न कि केवल एक अंतिम ग्रेड देने के रूप में।
यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:
1. अनुकूलित चेकलिस्ट (द "रूब्रिक")
एक सामान्य नियम पुस्तिका के बजाय, ORBIT उस विशिष्ट मरीज की कहानी को देखता है और एक अनूठी चेकलिस्ट बनाता है कि उस सटीक स्थिति में एक अच्छा डॉक्टर क्या करना चाहिए।
- उपमा: कल्पना कीजिए कि आप एक कुकिंग प्रतियोगिता में जज हैं। केवल यह कहने के बजाय कि "यह सूप अच्छा है" या "यह सूप बुरा है," आपके पास इस सूप के लिए एक विशिष्ट स्कोरकार्ड है: "क्या उन्होंने शोरबा चखा? क्या उन्होंने नमक की जांच की? क्या उन्होंने मेहमान को तीखी मिर्च के बारे में चेतावनी दी?"
- शोध पत्र में: पेट दर्द वाले मरीज के लिए, चेकलिस्ट में शामिल हो सकता है: "क्या AI ने बुखार के बारे में पूछा?" "क्या इसने उल्टी में खून जैसे रेड फ्लैग्स के बारे में चेतावनी दी?" "क्या इसने सहानुभूति दिखाई?" सूची का प्रत्येक आइटम अंक (या खतरनाक होने पर माइनस अंक) के योग्य है।
2. "स्मार्ट सर्च" (रिट्रीवल)
AI को यह कैसे पता चलता है कि चेकलिस्ट में क्या रखना है? यह केवल अनुमान नहीं लगाता है। यह पिछले मामलों के पुस्तकालय को देखता है ताकि समान स्थितियां मिल सकें।
- उपमा: नए सूप को ग्रेड करने से पहले, जज रेसिपी बुक्स और पिछले विजेता सूपों को देखता है जो इस संतुलन के समान थे। वे वर्तमान व्यंजन के लिए एकदम सही स्कोरकार्ड बनाने के लिए उन उदाहरणों का उपयोग करते हैं।
- शोध पत्र में: सिस्टम मेडिकल मामलों के डेटाबेस को खोजता है ताकि समान मरीज की कहानियाँ मिल सकें और उस नए मामले के लिए अत्यधिक विशिष्ट, प्रासंगिक चेकलिस्ट बनाने के लिए उनका उपयोग करता है। यह AI को "एक ही आकार सबके लिए" (one-size-fits-all) वाली चेकलिस्ट का उपयोग करने से रोकता है जो विशिष्ट समस्या के लिए उपयुक्त नहीं होती।
3. प्रशिक्षण का खेल (रीइन्फोर्समेंट लर्निंग)
अब, AI एक खेल खेलता है। यह मरीज के प्रश्न का उत्तर देने का प्रयास करता है। सिस्टम अपने उत्तर की जांच अनुकूलित चेकलिस्ट के विरुद्ध करता है।
- उपमा: AI एक वीडियो गेम कैरेक्टर की तरह है। हर बार जब वह कुछ सही करता है (जैसे सुरक्षा प्रश्न पूछना), तो उसे अंक मिलते हैं। हर बार जब वह किसी सुरक्षा जांच को छोड़ देता है, तो उसके अंक कट जाते हैं। लक्ष्य चेकलिस्ट पर उच्चतम संभव स्कोर प्राप्त करना है।
- शोध पत्र का दावा: AI उत्तर देने का प्रयास करता है, चेकलिस्ट पर ग्रेड प्राप्त करता है, स्कोर से सीखता है, और फिर से प्रयास करता है। वह इसे बार-बार करता है जब तक कि वह चेकलिस्ट में महारत हासिल नहीं कर लेता।
4. "गोल्डीलॉक्स" फ़िल्टर
शोध पत्र में प्रशिक्षण को तेज़ बनाने के लिए एक चतुर तकनीक का उल्लेख किया गया है। हर मरीज का मामला सीखने के लिए उपयोगी नहीं होता है।
- उपमा: यदि किसी मरीज को बहुत मामूली जुकाम है, तो AI पहले से ही जानता है कि इसे कैसे संभालना है (बहुत आसान)। यदि मरीज को कोई रहस्यमय बीमारी है जिसे सुलझाना असंभव है, तो AI हर बार विफल हो जाएगा (बहुत कठिन)। सिस्टम "बहुत आसान" और "बहुत कठिन" मामलों को फ़िल्टर कर देता है, और केवल "बिल्कुल सही" (just right) मामलों को रखता है जहाँ AI वास्तव में कुछ नया सीख सकता है।
- शोध पत्र में: वे एक "Pass@k" फ़िल्टर का उपयोग करते हैं ताकि केवल उन्हीं मामलों को रखा जा सके जहाँ AI संघर्ष कर रहा है लेकिन फिर भी सुधार कर सकता है। यह समय बचाता है और सीखने को अधिक कुशल बनाता है।
परिणाम
इस शोध पत्र का परीक्षण 4-बिलियन-पैरामीटर वाले एक AI मॉडल पर किया गया (जो अपेक्षाकृत छोटा और सस्ता है)।
- ORBIT से पहले: AI ने "HealthBench-Hard" नामक एक कठिन चिकित्सा परीक्षण में 7.0 का स्कोर किया।
- ORBIT के बाद: केवल 2,000 प्रशिक्षण उदाहरणों के साथ, स्कोर उछलकर 27.5 हो गया।
- तुलना: इस छोटे AI ने, इस प्रशिक्षण के बाद, बहुत बड़े, विशेष चिकित्सा AI (कुछ 30+ बिलियन पैरामीटर वाले) को भी पीछे छोड़ दिया और बाजार में मौजूद कुछ सबसे बड़े प्रोप्राइटरी मॉडल्स को भी मात दी।
मुख्य निष्कर्ष
शोध पत्र का दावा है कि अस्पष्ट "अच्छे/बुरे" संकेतों को विस्तृत, मामले-विशिष्ट चेकलिस्ट से बदलकर, वे छोटे AI मॉडल्स को चिकित्सा बातचीत में बहुत अधिक सुरक्षित और प्रभावी बनाना सीख सकते हैं। उन्हें एक विशाल नया मस्तिष्क बनाने की आवश्यकता नहीं थी; उन्हें बस होमवर्क ग्रेड करने का एक बेहतर तरीका चाहिए था।
शोध पत्र से महत्वपूर्ण नोट:
लेखक स्पष्ट रूप से कहते हैं कि यह एक अनुसंधान ढांचा (research framework) है जिसे डॉक्टरों की सहायता करने के लिए डिज़ाइन किया गया है। वे इस बात पर जोर देते हैं कि यह एक स्वायत्त प्रणाली नहीं है जिसका उद्देश्य मानव डॉक्टरों को बदलना है, और वास्तविक दुनिया में किसी भी उपयोग के लिए चेकलिस्ट और अंतिम उत्तरों की निगरानी के लिए मानव विशेषज्ञों की आवश्यकता होगी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।