← नवीनतम पेपर
📄 health informatics

Sino-US-DrugQA: A Benchmark for Evaluating Large Language Models in Cross-Jurisdictional Pharmaceutical Regulation

यह शोध पत्र Sino-US-DrugQA को प्रस्तुत करता है, जो अमेरिकी और चीनी फार्मास्युटिकल नियमों से व्युत्पन्न 11,871 प्रश्नों का एक द्विभाषी बेंचमार्क डेटासेट है, जो यह प्रकट करता है कि जबकि वर्तमान बड़े भाषा मॉडल (large language models) एकभाषी नियामक प्रश्नों पर अच्छा प्रदर्शन करते हैं, उन्हें क्रॉस-क्षेत्राधिकार तुलनात्मक तर्क में महत्वपूर्ण चुनौतियों का सामना करना पड़ता है, जिसके लिए उच्च-जोखिम वाले अनुपालन अनुप्रयोगों हेतु विशेषज्ञ निरीक्षण की आवश्यकता होती है।

मूल लेखक: Chen, Z., Fu, X., Lu, W.

प्रकाशित 2026-02-17
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Chen, Z., Fu, X., Lu, W.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक बेहतरीन केक बनाने की कोशिश कर रहे हैं, लेकिन आपको दो पूरी तरह से अलग नियमपुस्तिकाओं (rulebooks) का पालन करना है: एक जो अमेरिकी खाद्य एवं औषधि प्रशासन (FDA) द्वारा लिखी गई है और दूसरी जो चीन के नेशनल मेडिकल प्रोडक्ट्स एडमिनिस्ट्रेशन (NMPA) द्वारा लिखी गई है। दोनों पुस्तकें आपको दवा बनाने के निर्देश देती हैं, लेकिन वे अलग-अलग शब्दों, अलग-अलग मापों और कभी-कभी एक ही सामग्री के लिए अलग-अलग नियमों का उपयोग करती हैं।

अब, कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट शेफ (AI) को काम पर रखते हैं जो दोनों पुस्तकों को पढ़ सके और आपको उनके बीच के अंतर बता सके। आप यह जानना चाहते हैं: क्या यह रोबलेट वास्तव में बारीकियों को समझ सकता है, या यह केवल अनुमान लगाएगा और रेसिपी को गलत कर देगा?

यही वह विषय है जिसके बारे में यह शोध पत्र है। यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. समस्या: "दो-नियमपुस्तिका" का भ्रम

वास्तविक दुनिया में, दवा बनाना एक बहुत ही उच्च जोखिम वाला खेल है। यदि आप नियमों को गलत समझते हैं, तो लोग बीमार पड़ सकते हैं। हालाँकि AI चिकित्सा संबंधी प्रश्नों के उत्तर देने में बहुत अच्छा होता जा रहा है, लेकिन किसी ने भी वास्तव में यह परीक्षण नहीं किया था कि क्या यह दो अलग-अलग देशों (अमेरिका और चीन) के बीच नियमों की तुलना करने के कठिन कार्य को संभाल सकता है। यह एक अनुवादक से केवल एक वाक्य का अनुवाद करने के लिए नहीं, बल्कि यह समझाने के लिए कहने जैसा है कि न्यूयॉर्क के कानून बीजिंग के कानूनों से क्यों अलग हैं।

2. समाधान: AI के लिए एक "ट्रेनिंग जिम"

शोधकर्ताओं ने इन AI रोबोटों को टेस्ट करने के लिए एक विशाल ट्रेनिंग जिम (एक डेटासेट जिसे Sino-US-DrugQA कहा गया है) बनाया।

  • वर्कआउट: उन्होंने दोनों देशों के वास्तविक कानूनों पर आधारित लगभग 12,000 क्विज़ प्रश्न (बहुविकल्पीय) तैयार किए।
  • लेवल: कुछ प्रश्न आसान थे (केवल अमेरिकी नियमों के बारे में पूछना), और कुछ कठिन थे (पूछना कि, "अमेरिकी नियम चीनी नियम से कैसे भिन्न है?")।
  • लक्ष्य: यह देखना कि क्या AI एक अनुभवी कानूनी विशेषज्ञ की तरह काम कर सकता है जो दोनों नियमपुस्तिकाओं को पूरी तरह से जानता हो।

3. परीक्षण: रोबोटों को काम पर लगाना

उन्होंने चार सबसे स्मार्ट उपलब्ध AI मॉडलों (जैसे GPT, Gemini और अन्य के नवीनतम संस्करण) को लिया और उन्हें बिना किसी मदद के यह क्विज़ देने के लिए कहा (एक "ज़ीरो-शॉट" टेस्ट, जिसका अर्थ है कि वे उत्तर नहीं देख सकते थे या संकेत नहीं ले सकते थे)।

परिणाम:

  • अच्छी खबर: AI रोबोटों ने काफी अच्छा प्रदर्शन किया! उन्होंने लगभग 79% से 85% उत्तर सही दिए। इसका मतलब है कि वे पहले से ही सरल कार्यों के लिए बहुत उपयोगी हैं, जैसे कि किसी मानव विशेषज्ञ द्वारा जांच के लिए किसी एक देश के नियमों का त्वरित सारांश तैयार करना।
  • बुरी खबर: जब प्रश्न कठिन हो गए—जिसमें दोनों देशों की तुलना आमने-सामने करनी थी—तो उनके स्कोर में लगभग 6 से 9 अंक की गिरावट आई।

4. बड़ा सबक: "अभी अकेले रोबोट पर भरोसा न करें"

AI को एक बहुत तेज़, बहुत पढ़े-लिखे इंटर्न की तरह समझें।

  • यदि आप इंटर्न से पूछते हैं, "इस दवा के लिए अमेरिकी नियम क्या हैं?" तो वे उत्तर जल्दी और सटीक रूप से ढूंढ सकते हैं।
  • लेकिन यदि आप उनसे पूछते हैं, "अमेरिकी नियम चीनी नियमों से कैसे भिन्न हैं, और कौन सा अधिक सुरक्षित है?" तो वे भ्रमित हो सकते हैं या विवरणों को मिला सकते हैं।

यह शोध पत्र निष्कर्ष निकालता है कि हालांकि ये AI उपकरण दस्तावेज़ों का मसौदा तैयार करने या जानकारी की स्क्रीनिंग करने के लिए बेहतरीन सहायक हैं, लेकिन वे अंतर्राष्ट्रीय कानूनों की तुलना करने के मामले में अंतिम निर्णय लेने वाले बनने के लिए तैयार नहीं हैं। क्योंकि दांव बहुत ऊंचे हैं (लोगों का स्वास्थ्य), इसलिए एक मानव विशेषज्ञ को हमेशा AI के काम की दोबारा जांच करनी चाहिए, विशेष रूप से सीमा पार के नियमों से निपटने के दौरान।

संक्षेप में: शोधकर्ताओं ने यह देखने के लिए एक विशाल परीक्षण बनाया कि क्या AI अमेरिकी और चीनी चिकित्सा कानूनों की तुलना करने के जटिल कार्य को संभाल सकता है। AI ने आसान हिस्सों को पास कर लिया लेकिन कठिन तुलनाओं में लड़खड़ा गया, जिससे यह साबित हुआ कि हालांकि यह एक सहायक उपकरण है, फिर भी इसे सभी को सुरक्षित रखने के लिए एक मानव पर्यवेक्षक की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →