← नवीनतम पेपर
🤖 AI

MedCalc-R1: Knowledge-Guided Reward Framework for Medical Mathematical Reasoning

यह शोध पत्र MedCalc-R1 प्रस्तुत करता है, जो एक ज्ञान-निर्देशित हाइब्रिड रिवॉर्ड फ्रेमवर्क है जो स्पष्ट फॉर्मूला जनरेशन को लागू करके और सुरक्षा-महत्वपूर्ण डोमेन में पारंपरिक टॉलरेंस-आधारित मूल्यांकन की सीमाओं को दूर करने के लिए क्लिनिकल सुरक्षा बाधाओं को परिशुद्धता-संवेदनशील रिवॉर्ड्स के साथ जोड़कर चिकित्सा गणितीय तर्क क्षमता को बढ़ाता है।

मूल लेखक: Haotian Wang, Lian Yan, Xingzhi Yao, Fanshu Meng, Ye He, Jingchi Jiang, Yi Guan

प्रकाशित 2026-08-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Haotian Wang, Lian Yan, Xingzhi Yao, Fanshu Meng, Ye He, Jingchi Jiang, Yi Guan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को गणित करना सिखाने की कोशिश कर रहे हैं, लेकिन सिर्फ साधारण गणित नहीं—ऐसा गणित जो जीवन बचा सके। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन रोबोट्स को प्रशिक्षित करने का एक लोकप्रिय तरीका है जिसे "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) कहा जाता है। इसे एक कुत्ते को प्रशिक्षित करने जैसा समझें: यदि कुत्ता कहे जाने पर बैठता है, तो उसे एक इनाम (ट्रीट) मिलता है; यदि वह नहीं बैठता, तो उसे कुछ नहीं मिलता। सरल गणित समस्याओं के लिए, जैसे "2 प्लस 2 क्या है?", यदि रोबोट "4" कहता है तो उसे एक स्पष्ट इनाम मिलता है और यदि वह "5" कहता है तो कोई इनाम नहीं मिलता। लेकिन क्या होगा जब उत्तर एक पूर्ण संख्या (whole number) न हो? क्या होगा यदि रोबोट को दवा की खुराक की गणना करनी हो और उत्तर 12.456 मिलीग्राम हो? वास्तविक दुनिया में, थोड़ा सा भी इधर-उधर होना खतरनाक हो सकता है। यदि रोबोट 12.5 का अनुमान लगाता है, तो क्या यह काफी है? यदि वह 12.0 का अनुमान लगाता है, तो क्या यह एक आपदा है? वर्तमान तरीके इसे इस तरह हल करने की कोशिश करते हैं कि "यदि आपका उत्तर सही संख्या के एक बहुत ही सूक्ष्म दायरे के भीतर है, तो आपको एक इनाम मिलेगा।" लेकिन यह एक कुत्ते को यह सिखाने जैसा है कि वह तभी बैठे जब वह मैट के बिल्कुल बीच में बैठे, लेकिन मैट इतना छोटा है कि कुत्ता उसे ढूंढ ही नहीं पाता, या इतना बड़ा है कि कुरा सोचता है कि कहीं भी लेट जाना ठीक है। यह रोबोट को भ्रमित, अस्थिर और कभी-कभी खतरनाक रूप से गलत बनाता है।

यहीं पर हारबिन इंस्टीट्यूट ऑफ टेक्नोलॉजी के शोधकर्ताओं की एक टीम एक नए विचार के साथ सामने आती है जिसे MEDCALC-R1 कहा जाता है। उन्होंने महसूस किया कि मेडिकल गणित के लिए, आप केवल अंतिम उत्तर को नहीं देख सकते; आपको उसके पीछे की "सोच" की जांच करनी होगी। उन्होंने एक विशेष प्रशिक्षण प्रणाली बनाई जो एक सख्त लेकिन सहायक ट्यूटर की तरह कार्य करती है। केवल यह देखने के बजाय कि अंतिम संख्या कितनी करीब है, यह प्रणाली रोबोट को पहले अपनी "रेसिपी" (फॉर्मूला) लिखने के लिए मजबूर करती है। एक दूसरा, अधिक स्मार्ट रोबोट एक जज के रूप में कार्य करता है ताकि यह सुनिश्चित किया जा सके कि रेसिपी वास्तव में उस काम के लिए सही है। यदि रेसिपी गलत है, तो रोबोट को तुरंत "नो ट्रीट" (कोई इनाम नहीं) मिलता है, भले ही अंतिम संख्या किस्मत से ठीक लग रही हो। फिर, अंतिम संख्या के लिए, वे दो-भाग वाली पुरस्कार प्रणाली का उपयोग करते हैं: एक "कठोर नियम" जो कहता है, "आपको इस सुरक्षित क्षेत्र के भीतर होना ही होगा, अन्यथा आप विफल हो जाएंगे," और एक "कोमल प्रोत्साहन" जो कहता है, "आप सटीक संख्या के जितने करीब होंगे, आपको उतने ही अधिक अंक मिलेंगे।" इस प्रकार, रोबोट सुरक्षित और सटीक दोनों होना सीखता है।

शोधकर्ताओं ने चिकित्सा गणित की समस्याओं (जैसे दवा की खुराक और किडनी फंक्शन) वाले एक डेटासेट पर इस नई पद्धति का परीक्षण किया। उन्होंने पाया कि उनकी प्रणाली पुराने तरीकों की तुलना में बहुत बेहतर काम करती है। यहाँ तक कि जब उन्होंने छोटे, अधिक कुशल रोबोट मॉडल का उपयोग किया, तो इस नए तरीके ने उन्हें उन बहुत बड़े, महंगे मॉडलों की तुलना में अधिक सटीक और सुरक्षित रूप से समस्याओं को हल करने में मदद की जो इस विशेष प्रशिक्षण का उपयोग नहीं करते थे। परिणाम बताते हैं कि रोबोट को अपना काम दिखाने के लिए मजबूर करके और वास्तविक चिकित्सा नियमों के विरुद्ध उस काम की जांच करके, हम AI को स्वास्थ्य सेवा जैसे उच्च-जोखिम वाले कार्यों के लिए बहुत अधिक विश्वसनीय बना सकते हैं। यह हर समस्या के लिए कोई जादुई समाधान नहीं है, लेकिन यह AI को वास्तविक अस्पतालों में उपयोग करने के लिए भरोसेमंद बनाने की दिशा में एक महत्वपूर्ण कदम है, जहाँ तेज़ होने से अधिक महत्वपूर्ण सही होना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →