← नवीनतम पेपर
🤖 machine learning

FeatEHR-LLM: Leveraging Large Language Models for Feature Engineering in Electronic Health Records

FeatEHR-LLM एक गोपनीयता-संरक्षण फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स और टूल-ऑगमेंटेड जनरेशन का उपयोग करके अनियमित रूप से नमूना लिए गए और विरल इलेक्ट्रॉनिक हेल्थ रिकॉर्ड (EHR) टाइम सीरीज़ से स्वचालित रूप से नैदानिक रूप से सार्थक, निष्पादन योग्य फीचर-एक्सट्रैक्शन कोड उत्पन्न करता है।

मूल लेखक: Hojjat Karami, David Atienza, Jean-Philippe Thiran, Anisoara Ionescu

प्रकाशित 2026-04-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Hojjat Karami, David Atienza, Jean-Philippe Thiran, Anisoara Ionescu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक जटिल, बहु-कोर्स भोजन के लिए एकदम सही रेसिपी बनाने की कोशिश कर रहे हैं। लेकिन, एक पेच है: आपकी सामग्री आपके किचन में पूरी तरह से रैंडम समय पर आती है। कभी नमक पाँच मिनट में आ जाता है; तो कभी स्टेक तीन घंटे तक नहीं आता। इससे भी बुरा यह है कि कुछ सामग्रियां पूरी तरह से गायब हैं, और आपको यह भी नहीं पता कि वे भूल दी गईं या उस विशिष्ट व्यंजन के लिए उनकी आवश्यकता ही नहीं थी।

चिकित्सा की दुनिया में, इलेक्ट्रॉनिक हेल्थ रिकॉर्ड्स (EHRs) उन अराजक सामग्रियों की तरह हैं। एक मरीज का डेटा (हृदय गति, ब्लड शुगर, ऑक्सीजन स्तर) एक व्यवस्थित, लयबद्ध ताल में नहीं आता। यह "अनियमित रूप से सैम्पल किया गया" (irregularly sampled) होता है—डॉक्टर केवल तभी माप लेते हैं जब कुछ घटित होता है। यह मानक कंप्यूटरों के लिए यह भविष्यवाणी करना अविश्वसनीय रूप से कठिन बना देता है कि मरीज बेहतर हो रहा है या बिगड़ रहा है।

यह पेपर FeatEHR-LLM को पेश करता है, जो इस "किचन की अराजकता" को व्यवस्थित करने का एक नया तरीका है, जिसमें लार्ज लैंग्वेज मॉडल्स (जैसे ChatGPT) की "बौद्धिक क्षमता" का उपयोग किया गया है।

समस्या: मेडिकल डेटा का "अव्यवस्थित किचन"

अधिकांश AI मॉडल कठोर रोबोट की तरह होते हैं। वे उम्मीद करते हैं कि डेटा पंक्तियों और कॉलमों में पूरी तरह से व्यवस्थित हो, जैसे कि एक सलीके से सजा हुआ स्प्रेडशीट। जब वे वास्तविक अस्पताल के डेटा के "अव्यवस्थित किचन" का सामना करते हैं—जहाँ हृदय गति हर मिनट दर्ज की जा सकती है, लेकिन एक रक्त परीक्षण दिन में केवल एक बार होता है—तो वे रोबोट भ्रमित हो जाते हैं। वे या तो गायब डेटा का "अनुमान" लगाने की कोशिश करते हैं (जो खतरनाक हो सकता है) या वे पैटर्न देखने में पूरी तरह विफल हो जाते हैं।

समाधान: "एक्सपर्ट सू-शेफ" (FeatEHR-LLM)

एक कठोर रोबोट को काम पर लगाने के बजाय, शोधकर्ताओं ने एक एक्सपर्ट सू-शेफ (LLM) को नियुक्त करने का निर्णय लिया।

यहाँ बताया गया है कि सू-शेफ कैसे काम करता है:

  1. गोपनीयता सर्वोपरि (केवल "रेसिपी" का नियम): मरीज की गोपनीयता की रक्षा के लिए, सू-शेफ वास्तव में "कच्चा मांस" (वास्तविक संवेदनशील नाम या निजी रिकॉर्ड) कभी नहीं देखता है। इसके बजाय, उन्हें केवल "मेन्यू" (डेटा स्कीमा) दिखाया जाता है। वे देखते हैं: "हमारे पास एक वेरिएबल है जिसे 'हार्ट रेट' कहा जाता है, जिसे बीट्स प्रति मिनट में मापा जाता है।" इस तरह, AI बिना यह जाने सीखता है कि खाना कैसे बनाना है कि डाइनर (ग्राहक) कौन है।
  2. निर्देश लिखना (कोड जनरेशन): गणित स्वयं करने के बजाय, सू-शेफ अनुकूलित निर्देश नियमावली (पायथन कोड) लिखता है। वे कहते हैं: "यदि हृदय गति हर दस मिनट में बेतहाशा ऊपर-नीचे हो रही है, तो 'स्टेबिलिटी स्कोर' 2 लिखें।"
  3. यूनिवेरिएट और मल्टीवेरिएट विचार (फ्लेवर प्रोफाइल):
    • यूनिवेरिएट (एकल सामग्री): सू-शेफ एक समय में एक चीज़ को देखता है। "शुगर लेवल कितना उतार-चढ़ाव भरा है?"
    • मल्टीवेरिएट (पूरा व्यंजन): यहीं असली जादू होता है। सू-शेफ समझता है कि सामग्रियां आपस में कैसे क्रिया करती हैं। वे पूछ सकते हैं: "ब्लड प्रेशर और ऑक्सीजन लेवल के बीच का संबंध कैसे बदल रहा है?" यह एक शेफ की तरह है जो जानता है कि यदि सॉस बहुत नमकीन है, तो आपको उसे संतुलित करने के लिए अधिक एसिड की आवश्यकता होगी।
  4. वैलिडेशन लूप (स्वाद परीक्षण): सू-शेफ कोड लिखता है, उसे चलाता है, और यदि कोड क्रैश हो जाता है या जिसका कोई अर्थ नहीं निकलता, तो वह उसे ठीक करता है। वे अपनी "रेसिपी" को तब तक परिष्कृत करते रहते हैं जब तक कि वे पूरी तरह से काम न करने लगें।

यह क्यों मायने रखता है?

अराजक, अनियमित टाइम-सीरीज डेटा को साफ, सार्थक "फीचर्स" (जैसे "ऑर्गन स्टेबिलिटी स्कोर" या "रेस्पिरेटरी स्ट्रेस लेवल") में बदलने के लिए एक LLM का उपयोग करके, शोधकर्ताओं ने पाया कि वे मरीजों के परिणामों की बहुत अधिक सटीकता से भविष्यवाणी कर सकते हैं।

अपने परीक्षणों में, इस पद्धति ने लगभग सभी पुराने "रोबोटिक" तरीकों को पीछे छोड़ दिया, और कभी-कभी सटीकता में 6% तक सुधार किया। अस्पताल के माहौल में, संकट की भविष्यवाणी करने में 6% का सुधार वास्तव में जीवन और मृत्यु के बीच का अंतर हो सकता है।

संक्षेप में सारांश

FeatEHR-LLM एक "स्मार्ट" AI लेता है, उसे मेडिकल डेटा का ढांचा दिखाता है (लेकिन निजी विवरण नहीं), और उससे चतुर, कस्टम गणितीय सूत्र लिखने के लिए कहता है जो वास्तविक दुनिया की अस्पताल निगरानी के अनिश्चित समय को संभाल सकें। यह टाइमस्टैम्प के एक अराजक ढेर को डॉक्टरों के लिए एक स्पष्ट, व्यवस्थित डैशबोर्ड में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →