Clinically Grounded AI-Scribing in Psychotherapy: Benchmarking LLMs Against Expert Documentation in the iCARE Framework
यह शोध पत्र नैदानिक रूप से आधारित iCARE दस्तावेज़ीकरण ढांचे और संगत iHOPE डेटासेट को प्रस्तुत करता है जो ग्यारह लार्ज लैंग्वेज मॉडल्स का बेंचमार्किंग करता है, जिससे यह पता चलता है कि जबकि क्लोज्ड-सोर्स मॉडल स्वचालित मेट्रिक्स में आम तौर पर ओपन-सोर्स मॉडल्स से बेहतर प्रदर्शन करते हैं, मानव विशेषज्ञ मूल्यांकन विशिष्ट शक्तियों और कमजोरियों को उजागर करता है—जैसे कि टेम्पोरल रीजनिंग (सामयिक तर्क) के साथ संघर्ष और भिन्न नैदानिक प्राथमिकताएं—जो उन एआई टूल्स की आवश्यकता को रेखांकित करती हैं जिन्हें थेरेपिस्ट्स को बदलने के बजाय उनकी सहायता करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
उन शांत कमरों में जहाँ मनोचिकित्सा (साइक थेरेपी) होती है, वहाँ काम अत्यंत मानवीय होता है। यह एक चिकित्सक द्वारा क्लाइंट की कहानी सुनने, एक ठहराव के भार को महसूस करने और वर्षों पुराने डर के संदर्भ को समझने पर निर्भर करता है। एक चिकित्सक के लिए इस कार्य को प्रभावी ढंग से करने के लिए, उन्हें भी एक रिकॉर्ड रखना आवश्यक होता है। ये नोट्स केवल प्रशासनिक कागजी कार्रवाई नहीं हैं; वे किसी व्यक्ति के आंतरिक जगत का मानचित्र हैं, जो तत्काल संकट से लेकर परिवार और उन आदतों के लंबे इतिहास तक सब कुछ दर्ज करते हैं जिन्होंने उन्हें आकार दिया है। पारंपरिक रूप से, ये नोट्स लिखना एक भारी बोझ रहा है, जो चिकित्सक का ध्यान रोगी से हटाकर कंप्यूटर स्क्रीन की ओर खींच लेता है। हाल के वर्षों में, आर्टिफिशियल इंटेलिजेंस (AI) ने इस बोझ को कम करने का वादा किया है। ये "AI स्क्रीब्स" बातचीत को सुन सकते हैं और उसे टाइप कर सकते हैं, लेकिन मानसिक स्वास्थ्य की जटिल दुनिया में, अधिकांश वर्तमान प्रणालियाँ विफल रहती हैं। वे संक्षिप्त, शुष्क सारांश तैयार करती हैं जो उन बारीकियों, भावनात्मक अंतर्धाराओं और महत्वपूर्ण सुरक्षा विवरणों को छोड़ देती हैं जो एक थेरेपी सत्र को परिभाषित करते हैं। चुनौती एक ऐसी मशीन बनाने की थी जो न केवल शब्दों को ट्रांसक्राइब करे, बल्कि कहानी को समझे।
भारत और सिंगापुर के शोधकर्ताओं की एक टीम ने इस समस्या के समाधान की दिशा में एक महत्वपूर्ण कदम उठाया है, जिसमें उन्होंने इस बात पर पुनर्विचार किया कि थेरेपी नोट्स को कैसे संरचित किया जाना चाहिए और मशीनों को उन्हें लिखना कैसे सीखना चाहिए। उन्होंने दस्तावेज़ीकरण के लिए एक नया, व्यापक ढांचा बनाया जिसे iCARE कहा गया। अस्पतालों में उपयोग किए जाने वाले मानक, संक्षिप्त प्रारूपों के विपरीत, जो त्वरित प्रशासनिक जांच के लिए डिज़ाइन किए गए हैं, iCARE एक नैदानिक मुलाकात की पूरी गहराई को पकड़ने के लिए बनाया गया है। यह सत्रों के विवरण वाली सत्रों की एक विस्तृत संरचना है, जिसमें सत्रह विशिष्ट खंड हैं, जो बुनियादी पहचान संबंधी जानकारी और क्लाइंट की मुख्य चिंताओं से लेकर उनके चिकित्सा इतिहास की गहरी जांच, आत्म-हानि जैसे तात्कालिक खतरों के लिए जोखिम मूल्यांकन और भविष्य के सत्रों की योजना तक विस्तृत है। शोधकर्ताओं का तर्क था कि एक AI प्रणाली को संक्षिप्त सारांश में बदलने से पहले, इस समृद्ध, पूर्ण चित्र को उत्पन्न करने में सक्षम होना चाहिए। इस विचार का परीक्षण करने के लिए, उन्होंने एक नया डेटासेट बनाया जिसे iCARE नाम दिया गया। उन्होंने एक सार्वजनिक संग्रह से 174 रिकॉर्ड किए गए थेरेपी सत्रों को लिया, ऑडियो को साफ किया ताकि हर शब्द सुना जा सके, और फिर विशेषज्ञों की एक टीम—मनोचिकित्सकों और मनोवैज्ञानिकों—से प्रत्येक सत्र के लिए नए iCARE प्रारूप का उपयोग करके आदर्श, 'गोल्ड-स्टैंडर्ड' नोट्स लिखवाए। इसने एक बेंचमार्क तैयार किया, आदर्श उत्तरों का एक सेट जिसके विरुद्ध किसी भी मशीन को मापा जा सकता था।
शोधकर्ताओं ने फिर ग्यारह अलग-अलग लार्ज लैंग्वेज मॉडल्स (LLMs) का परीक्षण किया। ये मॉडल, जो आधुनिक AI चैटबॉट्स के पीछे के शक्तिशाली कंप्यूटर प्रोग्राम हैं, उनसे थेरेपी रिकॉर्डिंग सुनने और iCARE नोट्स लिखने के लिए कहा गया। उन्होंने मॉडल्स का परीक्षण दो तरीकों से किया: पहला, उन्हें बिना किसी उदाहरण के रिकॉर्डिंग दी गई, और दूसरा, उन्हें लिखने के लिए कहने से पहले एक आदर्श नोट का उदाहरण दिखाया गया। परिणामों ने विभिन्न प्रकार के AI के बीच एक स्पष्ट विभाजन प्रकट किया। क्लोज्ड-सोर्स मॉडल, जो प्रमुख तकनीकी कंपनियों द्वारा विकसित किए जाते हैं और सार्वजनिक संशोधन के लिए खुले नहीं हैं, ओपन-सोर्स मॉडल्स (जो सार्वजनिक समुदाय द्वारा बनाए जाते हैं) की तुलना में लगातार बेहतर प्रदर्शन करते रहे। एक विशिष्ट मॉडल, GPT-4o-mini, ने उन मानक कंप्यूटर परीक्षणों पर उच्चतम स्कोर प्राप्त किया जो यह मापते हैं कि मशीन के शब्द मानव विशेषज्ञों के शब्दों से कितने मेल खाते हैं। एक अन्य मॉडल, Gemini Pro, ने संकट के संकेतों, जैसे कि आत्महत्या के जोखिम या मादक द्रव्यों के सेवन के संकेतों को पहचानने में विशेष शक्ति दिखाई, जो थेरेपी में महत्वपूर्ण सुरक्षा विवरण हैं।
हालाँकि, कहानी तब और दिलचस्प हो गई जब शोधकर्ताओं ने कंप्यूटर स्कोर पर भरोसा करने के बजाय मानव विशेषज्ञों से नोट्स का मूल्यांकन करने को कहा। उन्होंने छह मानसिक स्वास्थ्य पेशेवरों को नोट्स को बिना यह जाने (ब्लाइंडली) पढ़ने के लिए बुलाया कि उन्हें AI ने लिखा है या नहीं, और उन्हें पाँच प्रमुख गुणों पर रेट करने को कहा: विश्वसनीयता, प्रासंगिकता, सटीकता, पूर्णता और स्पष्टता। मानव विशेषज्ञों ने पाया कि हालांकि शीर्ष कंप्यूटर मॉडल अच्छे थे, लेकिन वे अभी भी समय के प्रवाह (फ्लो ऑफ टाइम) के साथ संघर्ष कर रहे थे। मशीनें अक्सर यह सही ढंग से अंतर करने में विफल रहीं कि क्या पिछले सत्र में हुआ था और क्या अगले सत्र के लिए नियोजित था, जो कि थेरेपी का एक मौलिक पहलू है जिसके लिए एक समयरेखा (टाइमलाइन) को समझना आवश्यक है। आश्चर्यजनक रूप से, मानव विशेषज्ञों ने Mistral नामक एक छोटे, ओपन-सोर्स मॉडल के नोट्स को अधिक शक्तिशाली वाणिज्यिक मॉडल्स की तुलना में पसंद किया। वास्तव में, Mistral ही एकमात्र ऐसा सिस्टम था जिसने एक विशिष्ट श्रेणी में मानव-लिखित नोट्स से थोड़ा अधिक स्कोर किया: पूर्णता। यह निष्कर्ष बताता है कि हम वर्तमान में एल्गोरिदम के माध्यम से AI की सफलता को जिस तरह से मापते हैं, वह हमेशा उस चीज़ से मेल नहीं खाता जिसकी एक मानव चिकित्सक को वास्तव में आवश्यकता होती है। वाणिज्यिक मॉडल विशिष्ट वाक्यांशों से मेल खाने में उत्कृष्ट थे, लेकिन छोटा मॉडल विशेषज्ञों की दृष्टि में सत्र के नैदानिक सार (क्लीनिकल एसेंस) को अधिक प्रभावी ढंग से पकड़ने में सक्षम था।
अध्ययन यह निष्कर्ष निकालता है कि हालांकि आर्टिफिशियल इंटेलिजेंस थेपिस्ट की सहायता करने के लिए तैयार है, लेकिन यह अभी तक उनकी जगह लेने के लिए तैयार नहीं है। शोधकर्ताओं ने पाया कि सबसे अच्छा मार्ग सहयोगात्मक है, जहाँ AI विस्तृत नोट्स का मसौदा तैयार करने का भारी काम संभालता है, जिससे चिकित्सक को रिकॉर्ड की समीक्षा करने, उसे परिष्कृत करने और अंतिम रूप देने का अवसर मिलता है। यह दृष्टिकोण चिकित्सकों को कीबोर्ड के बजाय रोगी पर ध्यान केंद्रित करने के लिए मूल्यवान समय मुक्त कर सकता है। टीम ने इस बात पर जोर दिया कि उनका कार्य एक अंतिम समाधान नहीं बल्कि एक आधार है। उन्होंने अपने नए ढांचे, अपने डेटासेट और अपनी मूल्यांकन पद्धति को अन्य वैज्ञानिकों के लिए उपलब्ध कराया है ताकि यह क्षेत्र निरंतर सुधार कर सके। अंतिम लक्ष्य मानसिक स्वास्थ्य देखभाल की विशाल आवश्यकता और उपलब्ध थेपिस्टों की सीमित संख्या के बीच के अंतर को पाटना है, जिसमें तकनीक का उपयोग उपचार के केंद्र में स्थित मानवीय जुड़ाव के विकल्प के रूप में नहीं, बल्कि उसके समर्थन के रूप में किया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।