← नवीनतम पेपर
🤖 AI

Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolving Skill Memory

यह शोध पत्र SkeMex को प्रस्तुत करता है, जो एक पोस्ट-डिप्लॉयमेंट स्व-विकसित (self-evolving) फ्रेमवर्क है जो इंटरेक्शन ट्राजेक्टरीज को एक संरचित, मल्टी-ब्रांच स्किल मेमोरी में संकलित करके और मॉडल वेट्स को अपडेट किए बिना पुन: प्रयोज्य ज्ञान को निरंतर परिष्कृत करने के लिए एक क्लोज्ड-लूप "रीड-राइट-असेस-गवर्न" लाइफसाइकिल का उपयोग करके मेडिकल एजेंट्स की लॉन्ग-होरइजन रीजनिंग को बढ़ाता है।

मूल लेखक: Haoran Sun, Wenjie Li, Yujie Zhang, Zekai Lin, Fanrui Zhang, Kaitao Chen, Xingqi He, Yichen Li, Mianxin Liu, Lei Liu, Yankai Jiang

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoran Sun, Wenjie Li, Yujie Zhang, Zekai Lin, Fanrui Zhang, Kaitao Chen, Xingqi He, Yichen Li, Mianxin Liu, Lei Liu, Yankai Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolving Skill Memory" (SkeMex) का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी समस्या: "भुलक्कड़" इंटर्न

कल्पना कीजिए कि एक प्रतिभाशाली मेडिकल छात्र (एक AI एजेंट) है जो अविश्वसनीय रूप से बुद्धिमान है लेकिन उसकी याददाश्त बहुत खराब है। हर बार जब वह किसी नए मरीज को देखता है, तो वह शून्य से शुरुआत करता है। उसे यह याद नहीं रहता कि पिछले हफ्ते उसने एक दुर्लभ स्थिति का सफलतापूर्वक निदान किया था, और न ही उसे यह याद रहता है कि उसने एक समान मामले में गलत जानकारी खोजने में अपना समय बर्बाद किया था।

वर्तमान AI मेडिकल टूल्स ऐसे ही हैं। वे सवालों के जवाब दे सकते हैं, लेकिन वे वास्तव में अपने पिछले अनुभवों या गलतियों से इस तरह नहीं सीखते जो भविष्य में काम आ सके। वे केवल कच्चे, अव्यवस्थित नोट्स (जैसे एक अस्त-व्यस्त डायरी) को स्टोर करते हैं जो पढ़ने में कठिन होते हैं और जिनमें अक्सर बेकार की जानकारी होती है।

समाधान: SkeMex (द "स्किलफुल लाइब्रेरियन")

लेखकों ने SkeMex नामक एक सिस्टम बनाया है। SkeMex को एक नए मस्तिष्क के रूप में नहीं, बल्कि एक अत्यधिक व्यवस्थित, स्वयं-अपडेट होने वाले पुस्तकालय (लाइब्रेरी) के रूप में सोचें जो मेडिकल छात्र के बगल में बैठा है।

केवल यह बचाने के बजाय कि क्या हुआ, SkeMex उन कहानियों को कौशल (Skills) में बदल देता है।

  • कच्ची स्मृति (Raw Memory): "मैंने एक मरीज को देखा जिसे सिरदर्द था, मैंने उनकी आँखों के बारे में पूछा, फिर मैंने उनका रक्तचाप चेक किया, और पता चला कि यह तनाव (stress) था।" (बहुत लंबा, बहुत विशिष्ट)।
  • SkeMex कौशल (Skill): "जब मरीज को सिरदर्द हो लेकिन वाइटल्स सामान्य हों, तो महंगे स्कैन ऑर्डर करने से पहले तनाव के कारणों की जांच करें।" (छोटा, पुन: उपयोग योग्य, कार्रवाई योग्य)।

यह कैसे काम करता है: "रीड-राइट-असेस-गवर्न" चक्र

SkeMex एक क्लोज्ड लूप पर चलता है, जैसे एक शेफ लगातार अपनी रेसिपी बुक को बेहतर बनाता है।

1. रीड (स्मार्ट सर्च - पढ़ना)

जब एक नया मरीज आता है, तो एजेंट केवल अनुमान नहीं लगाता। वह लाइब्रेरी से पूछता है: "इस विशिष्ट प्रकार की समस्या के लिए मुझे किन कौशलों की आवश्यकता है?"

  • उपमा: कल्पना कीजिए कि एक जासूस अपराध स्थल पर प्रवेश करता है। हर फाइल को देखने के बजाय, वह लाइब्रेरियन से पूछता है, "मुझे पिछले महीने में सफलतापूर्वक सुलझाए गए 'बर्ग्लेरी' (चोरी) से संबंधित फाइल दिखाएं।"
  • SkeMex सबसे प्रासंगिक "कौशल्स" को चुनता है, इस आधार पर नहीं कि शब्द कितने मिलते-जुलते हैं, बल्कि इस आधार पर कि वे अतीत में कितने उपयोगी रहे हैं।

2. राइट (डिस्टिलिंग द लेसन - लिखना)

एजेंट एक केस पूरा करने के बाद, SkeMex देखता है कि क्या हुआ। क्या एजेंट सफल रहा? क्या वह विफल रहा?

  • उपमा: यदि एजेंट ने एक कठिन केस सुलझा लिया है, तो SkeMex केवल पूरे ट्रांसक्रिप्ट को सेव नहीं करता। यह एक समराइज़र (सारांश बनाने वाला) की तरह काम करता है, जो उस एक या दो मुख्य कदमों को निकालता है जिन्होंने अंतर पैदा किया और उन्हें एक नए "स्किल कार्ड" में बदल देता है।
  • यदि एजेंट ने गलती की, तो SkeMex एक मौजूदा कार्ड में एक "पैच" (सुधार) लिखता है ताकि कोई भी दोबारा वह गलती न करे।

3. असेस (द स्कोरकार्ड - मूल्यांकन)

हर कौशल अच्छा नहीं होता। कुछ कौशल एक प्रकार के मरीज के लिए काम कर सकते हैं लेकिन दूसरे के लिए विफल हो सकते हैं।

  • उपमा: कल्पना कीजिए कि एक कोच खिलाड़ी को देख रहा है। यदि एक विशेष चाल 10 में से 9 बार काम करती है, तो कोच उसे उच्च स्कोर देता है। यदि वह विफल होती है, तो स्कोर गिर जाता है।
  • SkeMex प्रत्येक कौशल को एक यूटिलिटी स्कोर (उपयोगिता स्कोर) देता है। यदि कोई कौशल एजेंट को बेहतर परिणाम प्राप्त करने में मदद करता है, तो उसका स्कोर बढ़ जाता है। यदि यह त्रुटियों का कारण बनता है, तो स्कोर कम हो जाता है।

4. गवर्न (द जेनीटर - शासन/प्रबंधन)

समय के साथ लाइब्रेरी अव्यवस्थित हो जाती है। पुराने, बेकार या खतरनाक कौशल जमा हो जाते हैं।

  • उपमा: एक लाइब्रेरियन जो लगातार अलमारियों की सफाई करता है।
    • मर्जिंग (विलय): यदि दो कौशल एक ही बात कहते हैं, तो उन्हें एक में मिला दिया जाता है।
    • डिप्रीकेटिंग (निरस्त करना): यदि किसी कौशल का स्कोर कम है (वह आमतौर पर गलत है), तो उसे कचरे में फेंक दिया जाता है।
    • प्रमोटिंग (पदोन्नति): यदि कोई कौशल उत्कृष्ट साबित होता है, तो उसे "मैच्योर" (परिपक्व) बैज मिलता है और उसे प्राथमिकता दी जाती है।

यह क्यों विशेष है

  1. कोई "ब्रेन सर्जरी" नहीं: अधिकांश AI सिस्टम को नई चीजें सीखने के लिए रिट्रेन (जैसे छात्र को एक नया मस्तिष्क देना) करने की आवश्यकता होती है। SkeMex एजेंट के मस्तिष्क को बिल्कुल नहीं बदलता। यह केवल उसके बगल वाली लाइब्रेरी को अपडेट करता है। यह अधिक सुरक्षित और सस्ता है।
  2. यह केवल मेमोरी नहीं है: यह केवल "क्या हुआ" को सेव नहीं करता। यह "कैसे करना है" को सेव करता है। यह अनुभव को प्रक्रियात्मक ज्ञान (procedural knowledge) (जैसे एक रेसिपी) में बदल देता है, न कि केवल एक कहानी में।
  3. यह सामान्यीकरण (Generalizes) करता है: पेपर दिखाता है कि एक प्रकार के मेडिकल कार्य पर सीखे गए कौशल पूरी तरह से अलग कार्यों में मदद कर सकते हैं। यदि एजेंट ने एक जटिल निदान को व्यवस्थित करने का तरीका सीख लिया है, तो वह "व्यवस्थित करने का कौशल" उसे तब भी मदद करता है जब मेडिकल विषय बदल जाता है।

परिणाम

लेखकों ने कई अलग-अलग मेडिकल बेंचमार्क (जैसे डॉक्टरों की परीक्षा) पर SkeMex का परीक्षण किया।

  • बेहतर स्कोर: SkeMex वाले एजेंटों ने बिना SkeMex वाले एजेंटों की तुलना में लगातार उच्च स्कोर किया, और अन्य मेमोरी सिस्टम की तुलना में भी बेहतर प्रदर्शन किया।
  • स्थिर विकास: "ऑनलाइन" परीक्षणों में (जहाँ एजेंट काम करते समय सीखता है), SkeMex समय के साथ बेहतर होता गया, जबकि अन्य सिस्टम कभी-कभी भ्रमित हो गए या खराब प्रदर्शन करने लगे।
  • क्रॉस-मॉडल मैजिक: उन्होंने एक AI मॉडल (DeepSeek) का उपयोग करके लाइब्रेरी बनाई और फिर वह लाइब्रेरी एक दूसरे AI मॉडल (Qwen) को दे दी। दूसरे मॉडल ने तुरंत अधिक स्मार्ट प्रदर्शन किया, जो यह सिद्ध करता है कि कौशल वास्तव में सार्वभौमिक हैं और केवल एक विशिष्ट AI से बंधे नहीं हैं।

सारांश

SkeMex एक मेडिकल AI को एक "दूसरा मस्तिष्क" देने जैसा है जो उसके सिर का हिस्सा नहीं है, बल्कि सर्वोत्तम प्रथाओं (best practices) का एक निरंतर विकसित होने वाला, स्वयं-सफाई करने वाला और स्वयं-सुधार करने वाला पुस्तकालय है। यह बिखरे हुए पिछले अनुभवों को साफ, पुन: उपयोग योग्य कौशलों में बदल देता है, जिससे AI को बिना शून्य से रिट्रेन किए समय के साथ स्मार्ट बनना संभव होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →