← नवीनतम पेपर
💬 NLP

InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training

यह शोध पत्र ORBIT को प्रस्तुत करता है, जो एक रूब्रिक-आधारित वृद्धिशील प्रशिक्षण ढांचा (incremental training framework) है जो खुले-अंत वाले चिकित्सा संवादों पर बड़े भाषा मॉडलों (large language models) को प्रभावी ढंग से संरेखित करने के लिए गतिशील रूप से जनरेट किए गए, केस-कंडीशन्ड रूब्रिक्स का लाभ उठाता है, जिससे पारंपरिक रिवॉर्ड मॉडलिंग की कमियों से बचते हुए न्यूनतम प्रशिक्षण डेटा के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Pengkai Wang, Pengwei Liu, Qi Zuo, Zhijie Sang, Congkai Xie, Hongxia Yang

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pengkai Wang, Pengwei Liu, Qi Zuo, Zhijie Sang, Congkai Xie, Hongxia Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन प्रशिक्षु डॉक्टर (apprentice doctor) को एक कठिन मरीज को संभालने के तरीके सिखाने की कोशिश कर रहे हैं।

अतीत में, एक AI (एक लार्ज लैंग्वेज मॉडल) को एक अच्छा डॉक्टर बनने के लिए सिखाना एक साधारण "थम्स अप" या "थम्स डाउन" देने जैसा था। यदि AI ने गलत उत्तर दिया, तो उसे "थम्स डाउन" मिलता था। यदि वह सही था, तो उसे "थम्स अप" मिलता था।

समस्या:
चिकित्सा संबंधी बातचीत जटिल होती है। एक मरीज कह सकता है, "मेरे पेट में दर्द है।" एक साधारण "थम्स अप/डाउन" प्रणाली यह अंतर नहीं कर पाएगी कि एक डॉक्टर ने कहा "एस्पिरिन लें" (जो खतरनाक हो सकता है) और एक डॉक्टर ने कहा "पहले देखते हैं कि क्या आपको बुखार है, और यदि दर्द गंभीर है, तो हमें तुरंत ER (आपातकालीन कक्ष) जाना चाहिए।" "थम्स अप" प्रणाली बहुत धुंधली है। यह एक जटिल पेंटिंग को केवल यह देखकर आंकने जैसा है कि वह "नीली" है या "नहीं"।

समाधान: ORBIT
यह शोध पत्र एक नई विधि पेश करता है जिसे ORBIT (ओपन-एंडेड रूब्रिक-बेस्ड इनक्रीमेंटल ट्रेनिंग) कहा जाता है। ORBIT को एक प्रशिक्षु डॉक्टर को हर मरीज के लिए एक अनुकूलित चेकलिस्ट (customized checklist) देने के रूप में समझें, न कि केवल एक अंतिम ग्रेड देने के रूप में।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. अनुकूलित चेकलिस्ट (द "रूब्रिक")

एक सामान्य नियम पुस्तिका के बजाय, ORBIT उस विशिष्ट मरीज की कहानी को देखता है और एक अनूठी चेकलिस्ट बनाता है कि उस सटीक स्थिति में एक अच्छा डॉक्टर क्या करना चाहिए।

  • उपमा: कल्पना कीजिए कि आप एक कुकिंग प्रतियोगिता में जज हैं। केवल यह कहने के बजाय कि "यह सूप अच्छा है" या "यह सूप बुरा है," आपके पास इस सूप के लिए एक विशिष्ट स्कोरकार्ड है: "क्या उन्होंने शोरबा चखा? क्या उन्होंने नमक की जांच की? क्या उन्होंने मेहमान को तीखी मिर्च के बारे में चेतावनी दी?"
  • शोध पत्र में: पेट दर्द वाले मरीज के लिए, चेकलिस्ट में शामिल हो सकता है: "क्या AI ने बुखार के बारे में पूछा?" "क्या इसने उल्टी में खून जैसे रेड फ्लैग्स के बारे में चेतावनी दी?" "क्या इसने सहानुभूति दिखाई?" सूची का प्रत्येक आइटम अंक (या खतरनाक होने पर माइनस अंक) के योग्य है।

2. "स्मार्ट सर्च" (रिट्रीवल)

AI को यह कैसे पता चलता है कि चेकलिस्ट में क्या रखना है? यह केवल अनुमान नहीं लगाता है। यह पिछले मामलों के पुस्तकालय को देखता है ताकि समान स्थितियां मिल सकें।

  • उपमा: नए सूप को ग्रेड करने से पहले, जज रेसिपी बुक्स और पिछले विजेता सूपों को देखता है जो इस संतुलन के समान थे। वे वर्तमान व्यंजन के लिए एकदम सही स्कोरकार्ड बनाने के लिए उन उदाहरणों का उपयोग करते हैं।
  • शोध पत्र में: सिस्टम मेडिकल मामलों के डेटाबेस को खोजता है ताकि समान मरीज की कहानियाँ मिल सकें और उस नए मामले के लिए अत्यधिक विशिष्ट, प्रासंगिक चेकलिस्ट बनाने के लिए उनका उपयोग करता है। यह AI को "एक ही आकार सबके लिए" (one-size-fits-all) वाली चेकलिस्ट का उपयोग करने से रोकता है जो विशिष्ट समस्या के लिए उपयुक्त नहीं होती।

3. प्रशिक्षण का खेल (रीइन्फोर्समेंट लर्निंग)

अब, AI एक खेल खेलता है। यह मरीज के प्रश्न का उत्तर देने का प्रयास करता है। सिस्टम अपने उत्तर की जांच अनुकूलित चेकलिस्ट के विरुद्ध करता है।

  • उपमा: AI एक वीडियो गेम कैरेक्टर की तरह है। हर बार जब वह कुछ सही करता है (जैसे सुरक्षा प्रश्न पूछना), तो उसे अंक मिलते हैं। हर बार जब वह किसी सुरक्षा जांच को छोड़ देता है, तो उसके अंक कट जाते हैं। लक्ष्य चेकलिस्ट पर उच्चतम संभव स्कोर प्राप्त करना है।
  • शोध पत्र का दावा: AI उत्तर देने का प्रयास करता है, चेकलिस्ट पर ग्रेड प्राप्त करता है, स्कोर से सीखता है, और फिर से प्रयास करता है। वह इसे बार-बार करता है जब तक कि वह चेकलिस्ट में महारत हासिल नहीं कर लेता।

4. "गोल्डीलॉक्स" फ़िल्टर

शोध पत्र में प्रशिक्षण को तेज़ बनाने के लिए एक चतुर तकनीक का उल्लेख किया गया है। हर मरीज का मामला सीखने के लिए उपयोगी नहीं होता है।

  • उपमा: यदि किसी मरीज को बहुत मामूली जुकाम है, तो AI पहले से ही जानता है कि इसे कैसे संभालना है (बहुत आसान)। यदि मरीज को कोई रहस्यमय बीमारी है जिसे सुलझाना असंभव है, तो AI हर बार विफल हो जाएगा (बहुत कठिन)। सिस्टम "बहुत आसान" और "बहुत कठिन" मामलों को फ़िल्टर कर देता है, और केवल "बिल्कुल सही" (just right) मामलों को रखता है जहाँ AI वास्तव में कुछ नया सीख सकता है।
  • शोध पत्र में: वे एक "Pass@k" फ़िल्टर का उपयोग करते हैं ताकि केवल उन्हीं मामलों को रखा जा सके जहाँ AI संघर्ष कर रहा है लेकिन फिर भी सुधार कर सकता है। यह समय बचाता है और सीखने को अधिक कुशल बनाता है।

परिणाम

इस शोध पत्र का परीक्षण 4-बिलियन-पैरामीटर वाले एक AI मॉडल पर किया गया (जो अपेक्षाकृत छोटा और सस्ता है)।

  • ORBIT से पहले: AI ने "HealthBench-Hard" नामक एक कठिन चिकित्सा परीक्षण में 7.0 का स्कोर किया।
  • ORBIT के बाद: केवल 2,000 प्रशिक्षण उदाहरणों के साथ, स्कोर उछलकर 27.5 हो गया।
  • तुलना: इस छोटे AI ने, इस प्रशिक्षण के बाद, बहुत बड़े, विशेष चिकित्सा AI (कुछ 30+ बिलियन पैरामीटर वाले) को भी पीछे छोड़ दिया और बाजार में मौजूद कुछ सबसे बड़े प्रोप्राइटरी मॉडल्स को भी मात दी।

मुख्य निष्कर्ष

शोध पत्र का दावा है कि अस्पष्ट "अच्छे/बुरे" संकेतों को विस्तृत, मामले-विशिष्ट चेकलिस्ट से बदलकर, वे छोटे AI मॉडल्स को चिकित्सा बातचीत में बहुत अधिक सुरक्षित और प्रभावी बनाना सीख सकते हैं। उन्हें एक विशाल नया मस्तिष्क बनाने की आवश्यकता नहीं थी; उन्हें बस होमवर्क ग्रेड करने का एक बेहतर तरीका चाहिए था।

शोध पत्र से महत्वपूर्ण नोट:
लेखक स्पष्ट रूप से कहते हैं कि यह एक अनुसंधान ढांचा (research framework) है जिसे डॉक्टरों की सहायता करने के लिए डिज़ाइन किया गया है। वे इस बात पर जोर देते हैं कि यह एक स्वायत्त प्रणाली नहीं है जिसका उद्देश्य मानव डॉक्टरों को बदलना है, और वास्तविक दुनिया में किसी भी उपयोग के लिए चेकलिस्ट और अंतिम उत्तरों की निगरानी के लिए मानव विशेषज्ञों की आवश्यकता होगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →