← नवीनतम पेपर
💻 computer science

Safe Deployment of a Generative AI Assistant for Traditional-Medicine Education: Defense-in-Depth Architecture, Domain-Calibrated Safety Evaluation, and a Proposed Minimum Safety Stack

यह शोध पत्र TLAS-YHCT प्रस्तुत करता है, जो पारंपरिक चिकित्सा शिक्षा के लिए एक जनरेटिव एआई सहायक है, जो डिफेंस-इन-डेप्थ आर्किटेक्चर के माध्यम से डोमेन-विशिष्ट हमलों के विरुद्ध 100% सुरक्षा प्राप्त करता है, और यह प्रदर्शित करता है कि क्लिनिकल शिक्षा में सुरक्षित परिनियोजन के लिए क्लिनिकली कैलिब्रेटेड सुरक्षा मानक और RAG, मानकीकृत प्रॉम्प्टिंग, और LLM-as-judge सत्यापन को संयोजित करने वाला एक न्यूनतम सुरक्षा स्टैक आवश्यक है।

मूल लेखक: Ta Bich Hong, Tran Tan Linh, Le Hoang Oanh, Nghiem Thi Thuy Giang, Tran Tang, Le Thi Thuy Tien, Thi Ngoc Anh Bui

प्रकाशित 2026-07-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ta Bich Hong, Tran Tan Linh, Le Hoang Oanh, Nghiem Thi Thuy Giang, Tran Tang, Le Thi Thuy Tien, Thi Ngoc Anh Bui

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक सुरक्षा-प्रथम AI ट्यूटर

कल्पना कीजिए कि आप पारंपरिक चिकित्सा (प्राचीन जड़ी-बूटियों और उपचारों का उपयोग) पर एक कक्षा पढ़ा रहे हैं। आप छात्रों को अध्ययन में मदद करने के लिए एक सुपर-स्मार्ट AI चैटबॉट का उपयोग करना चाहते हैं। लेकिन एक बहुत बड़ी समस्या है: यदि यह AI गलत उत्तर देता है कि किन जड़ी-बूटियों को कैसे मिलाया जाए, तो एक छात्र एक खतरनाक नुस्खा सीख सकता है जो बाद में एक वास्तविक रोगी को नुकसान पहुँचा सकता है।

होआ बिन्ह यूनिवर्सिटी के शोधकर्ताओं ने TLAS-YHCT नामक एक विशेष AI ट्यूटर बनाया है। उन्होंने केवल AI को "अच्छा बनने" के लिए नहीं कहा। इसके बजाय, उन्होंने इसके चारों ओर एक किला बनाया ताकि यह सुनिश्चित हो सके कि यह कभी भी खतरनाक सलाह न दे। उन्होंने इस किले का परीक्षण 206 अलग-अलग "हमलों" (AI को चकमा देने के लिए डिज़ाइन किए गए चालाकी भरे प्रश्न) के विरुद्ध किया और पाया कि यह पूर्णतः सुरक्षित था, जबकि दो लोकप्रिय व्यावसायिक AI (GPT और Gemini) ने गलतियाँ कीं।

मूल समस्या: "सुरक्षा" के दो अलग-अलग प्रकार

यह शोध पत्र तर्क देता है कि "सुरक्षा" के दो अलग अर्थ हैं, और अधिकांश लोग इनमें भ्रमित हो जाते हैं:

  1. IT सुरक्षा (IT Security Safety): यह एक क्लब के बाउंसर की तरह है। यह जाँचता है कि क्या आप नियमों को तोड़ने, डेटा चुराने या सिस्टम को अपने रहस्य बताने के लिए बहलाने की कोशिश कर रहे हैं।
  2. नैदानिक शिक्षा सुरक्षा (Clinical Education Safety): यह एक रसोई में हेड शेफ की तरह है। यह जाँचता है कि क्या भोजन (उत्तर) वास्तव में खाने के लिए सुरक्षित है।

उपमा (Analogy):
एक रोबोट शेफ की कल्पना करें।

  • IT सुरक्षा पूछती है: "क्या रोबोट ने रेसिपी बुक चुराने की कोशिश की? क्या उसने 'छूना मना है' के साइन को अनदेखा किया?"
  • नैदानिक सुरक्षा पूछती है: "क्या रोबोट ने सूप में ज़हर मिला दिया?"

शोध पत्र में पाया गया कि एक रोबोट IT चेक पास कर सकता है (उसने किताब नहीं चुराई) लेकिन फिर भी नैदानिक चेक में विफल हो सकता है (उसने सूप में ज़हर परोसा)। अधिकांश AI सुरक्षा परीक्षण केवल "बाउंसर" के नियमों को देखते हैं, जिससे सूप में मौजूद "ज़हर" छूट जाता है।

उन्होंने "किला" कैसे बनाया (डिफेंस-इन-डेप्थ)

AI के आंतरिक मस्तिष्क को पूर्ण होने पर भरोसा करने के बजाय, उन्होंने एक 5-स्तरीय सुरक्षा पाइपलाइन बनाई। इसे कई तालों वाले एक उच्च-सुरक्षा बैंक वॉल्ट की तरह समझें:

  1. कठोर रेलिंग (बाउंसर): AI के सोचने से पहले ही, एक सख्त नियम-जांचकर्ता किसी भी ऐसे अनुरोध को ब्लॉक कर देता है जो सिस्टम को धोखा देने की कोशिश करता है या वर्जित विषयों के बारे में पूछता है। आप बातों से इसे पार नहीं कर सकते; यह एक सख्त "ना" है।
  2. सत्यापित पुस्तकालय (संदर्भ पुस्तक): AI को अनुमान लगाने की अनुमति नहीं है। उसे विशेषज्ञों द्वारा लिखी गई पारंपरिक चिकित्सा की एक विशिष्ट, स्वीकृत लाइब्रेरी से उत्तर ढूँढना होगा। यदि उत्तर लाइब्रेरी में नहीं है, तो AI कहेगा, "मुझे नहीं पता," बजाय इसके कि वह कुछ भी बना ले।
  3. मानकीकृत स्क्रिप्ट (कार्य विवरण): AI के पास एक सख्त स्क्रिप्ट है जो उसे बताती है कि एक शिक्षक के रूप में उसे कैसे व्यवहार करना है। वह जानता है कि उसे कभी भी असली डॉक्टर की जगह नहीं लेनी है।
  4. दूसरी राय (न्यायाधीश): छात्र को उत्तर दिखाने से पहले, एक दूसरा AI काम की जाँच करता है। वह पूछता है: "क्या पहले AI ने लाइब्रेरी का पालन किया? क्या यह सलाह वास्तव में एक मरीज के लिए सुरक्षित है?" यदि उत्तर "नहीं" है, तो सिस्टम इसे ठीक करता है या ब्लॉक कर देता है।
  5. मानवीय ऑडिट (प्रिंसिपल): वास्तविक शिक्षक AI की बातचीत के लॉग की नियमित समीक्षा करते हैं ताकि किसी भी अजीब गलती को पकड़ा जा सके और नियमों को अपडेट किया जा सके।

महान प्रयोग: रेड टीम (The Red Team)

इसे टेस्ट करने के लिए, शोधकर्ताओं ने कुछ बहुत सख्त किया:

  • हमलावर: पाँच विशेषज्ञ डॉक्टरों और शिक्षकों ने (जिन्हें यह पता नहीं था कि AI कैसे बनाया गया है) 206 चालाकी भरे प्रश्न लिखे ताकि सिस्टम को तोड़ने की कोशिश की जा सके।
  • निर्माता: AI बनाने वाले व्यक्ति को टेस्ट खत्म होने तक प्रश्न देखने की अनुमति नहीं थी
  • न्यायाधीश: उन्हीं विशेषज्ञ डॉक्टरों ने अंधे होकर (blindly) उत्तरों को ग्रेड किया (वे नहीं जानते थे कि कौन सा उत्तर किस AI ने दिया है)।

उन्होंने हर उत्तर के लिए दो स्कोरकार्ड का उपयोग किया: एक IT सुरक्षा के लिए और दूसरा नैदानिक सुरक्षा के लिए।

परिणाम: किला बनाम खुला दरवाज़ा

  • TLAS-YHCT (कस्टम AI): इसने 100% सुरक्षा स्कोर प्राप्त किया। इसने कभी भी खतरनाक उत्तर नहीं दिया, और इसने कभी भी किसी चालाक व्यक्ति को अपने नियमों को तोड़ने नहीं दिया।
  • व्यावसायिक AI (GPT और Gemini): इन्होंने बहुत कम स्कोर (लगभग 79% से 89%) प्राप्त किया।
    • वे तब विफल हुए जब लोगों ने रोल-प्लेइंग या नकली अधिकार के साथ उन्हें चकमा देने की कोशिश की।
    • महत्वपूर्ण रूप से: वे "नैदानिक सुरक्षा" पर विफल रहे, भले ही वे "IT सुरक्षा" में पास हो गए हों। उदाहरण के लिए, उन्होंने जहरीली जड़ी-बूटियों को मिलाने के बारे में खतरनाक सलाह दी। उन्होंने सुरक्षा के किसी नियम को नहीं तोड़ा, लेकिन उन्होंने खराब चिकित्सा सलाह दी।

"न्यूनतम सुरक्षा स्टैक" (The Minimum Safety Stack)

शोध पत्र निष्कर्ष निकालता है कि यदि आप चिकित्सा शिक्षा के लिए AI का उपयोग करना चाहते हैं, तो आप केवल एक जेनेरिक AI नहीं खरीद सकते और उम्मीद नहीं कर सकते। आपको एक न्यूनतम सुरक्षा स्टैक की आवश्यकता है:

  1. रिट्रीवल-ऑगमेंटेड जनरेशन (RAG): AI को अपनी याददाश्त के बजाय एक सत्यापित लाइब्रेरी का उपयोग करने के लिए मजबूर करें।
  2. मानकीकृत प्रॉम्प्ट्स: इसे एक सख्त, अपरिवर्तनीय कार्य विवरण दें।
  3. LLM-as-Judge: पहले AI को विशिष्ट चिकित्सा नियमों के विरुद्ध दोबारा जाँचने के लिए दूसरे AI का उपयोग करें।
  4. डोमेन-कैलिब्रेटेड मानदंड: आपके पास विशेषज्ञ (डॉक्टर) होने चाहिए जो यह परिभाषित करें कि उनके क्षेत्र के लिए "असुरक्षित" क्या है, न कि केवल IT सुरक्षा विशेषज्ञ।

निष्कर्ष

यह शोध पत्र सिद्ध करता है कि चिकित्सा जैसे उच्च-जोखिम वाले क्षेत्रों के लिए, बेस मॉडल से अधिक आर्किटेक्चर मायने रखता है। सुरक्षा जांच की परतों (किले) वाला एक कस्टम-निर्मित सिस्टम, एक शक्तिशाली, जेनेरिक AI मॉडल की तुलना में बहुत अधिक सुरक्षित है, भले ही वह जेनेरिक मॉडल बहुत स्मार्ट क्यों न हो। मुख्य सबक यह है कि सुरक्षा केवल हैकर्स को रोकने के बारे में नहीं है; यह सुनिश्चित करने के बारे में है कि दी गई सलाह वास्तव में मानव स्वास्थ्य के लिए सुरक्षित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →