Bilingual Retrieval-Augmented Access to ANVISA Regulatory Documents: A Technical Evaluation Using Drug-Development and Health-Product Questions
यह अध्ययन ANVISA नियामक दस्तावेजों पर निर्मित एक द्विभाषी रिट्रीवल-ऑगमेंटेड जनरेशन सिस्टम का मूल्यांकन करता है, जो दवा विकास के लिए पुर्तगाली और अंग्रेजी नियामक आवश्यकताओं को खोजने, उद्धृत करने और सारांशित करने में अपनी उच्च सटीकता प्रदर्शित करता है और कैलिब्रेशन के बाद अनुत्तरित प्रश्नों को प्रभावी ढंग से संभालता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
नियामक विज्ञान (Regulatory science) वह शांत इंजन है जो दवाओं, टीकों और चिकित्सा उपकरणों को जनता के लिए सुरक्षित रखता है। इससे पहले कि कोई नई दवा फार्मेसी की शेल्फ तक पहुँचे, एक कंपनी को सरकारी स्वास्थ्य अधिकारियों द्वारा लिखे गए नियमों के एक भूलभुलैया से गुजरना पड़ता है। ब्राजील में, यह प्राधिकरण ANVISA है, जो पुर्तगाली भाषा में हजारों पृष्ठों के नियम प्रकाशित करता है। ये दस्तावेज़ सब कुछ निर्धारित करते हैं, इस बात से लेकर कि क्लिनिकल ट्रायल कैसे चलाए जाते हैं, जब तक कि किसी कंपनी को दुष्प्रभाव (side effect) की रिपोर्ट कैसे करनी चाहिए। अंग्रेजी में काम करने वाले वैज्ञानिकों और नियामकों के लिए, या कई भाषाओं को संभालने वाली टीमों के लिए, ये नियम एक महत्वपूर्ण बाधा प्रस्तुत करते हैं। जानकारी मौजूद है, लेकिन किसी विशिष्ट प्रश्न का उत्तर देने वाले सटीक वाक्य को खोजना घास के ढेर में सुई खोजने जैसा महसूस हो सकता है, खासकर जब वह सुई उस भाषा में लिखी हो जो प्रश्न की भाषा से अलग हो।
इसे हल करने के लिए, शोधकर्ताओं ने एक प्रकार के कंप्यूटर सिस्टम का परीक्षण करना शुरू कर कर दिया है जो एक अत्यधिक कुशल लाइब्रेरियन की तरह कार्य करता है। केवल पहले पढ़ी गई बातों के आधार पर उत्तर का अनुमान लगाने के बजाय, यह सिस्टम पहले दस्तावेजों के एक विशिष्ट पुस्तकालय (library) में जाता है, उन सटीक पृष्ठों को खोजता है जिनमें उत्तर होता है, और फिर उन पृष्ठों का उपयोग करके एक प्रतिक्रिया लिखता है। यह विधि, जिसे 'रिट्रिवल-ऑगमेंटेड जनरेशन' (retrieval-augmented-generation) के रूप में जाना जाता है, कंप्यूटर को मनगढ़ंत बातें बनाने से रोकने के लिए डिज़ाइन की गई है। इसका लक्ष्य मानव विशेषज्ञों को बदलना नहीं है, बल्कि उन्हें सही नियम जल्दी और सटीक रूप से खोजने में मदद करना है, जिससे यह सुनिश्चित हो सके कि प्रत्येक उत्तर को उसके मूल स्रोत से ट्रैक किया जा सके।
शोधकर्ताओं की एक टीम ने हाल ही में इस विचार का परीक्षण छह प्रमुख ब्राजीलियाई स्वास्थ्य नियमों के संग्रह का उपयोग करके किया। उन्होंने एक प्रोटोटाइप सिस्टम बनाया जो अंग्रेजी या पुर्तगाली में पूछे गए प्रश्नों को समझ सकता था और उत्तर खोजने के लिए आधिकारिक पुर्तगाली दस्तावेजों की खोज कर सकता था। चुनौती दोहरी थी: सिस्टम को भाषा के अंतर को पाटना था, और इसे जटिल कानूनी विवरणों को संभालने के लिए पर्याप्त सटीक होना था जहाँ एक शब्द के गायब होने से अर्थ बदल सकता है। शोधकर्ता यह जानना चाहते थे कि क्या एक मशीन न केवल सही अनुच्छेद (article) को ढूंढ सकती है, बल्कि उसका सही ढंग से सारांश भी दे सकती है, अपने स्रोत का हवाला दे सकती है, और सबसे महत्वपूर्ण बात यह है कि जब उसे उत्तर न पता हो तो वह स्वीकार कर सके।
शोधकर्ताओं ने नियमों के कच्चे पाठ (raw text) को साफ करने और व्यवस्थित करने से शुरुआत की। उन्होंने दस्तावेजों को केवल विशाल टेक्स्ट ब्लॉक्स के रूप में कंप्यूटर में नहीं डाला। इसके बजाय, उन्होंने दस्तावेजों को उनके प्राकृतिक निर्माण खंडों: व्यक्तिगत अनुच्छेदों (articles) में विभाजित किया। यह एक जानबूझकर किया गया चुनाव था क्योंकि नियामक नियम अक्सर एक एकल अनुच्छेद के भीतर विशिष्ट खंडों (clauses) पर आधारित होते हैं। प्रत्येक अनुच्छेद को एक अलग इकाई के रूप में मानकर, सिस्टम सटीक रूप से पहचान सकता था कि कोई नियम कहाँ स्थित है। फिर उन्होंने कंप्यूटर को अंग्रेजी और पुर्तगाली दोनों में प्रमुख शब्दों को पहचानने के लिए प्रशिक्षित किया, जिससे एक ऐसा सेतु बना जिसने एक अंग्रेजी प्रश्न को पुर्तगाली उत्तर खोजने में सक्षम बनाया। सिस्टम को एक बंद लाइब्रेरी के भीतर काम करने के लिए डिज़ाइन किया गया था; इसे लाइव इंटरनेट खोजने या दिए गए दस्तावेजों में मौजूद तथ्यों का अनुमान लगाने से सख्ती से मना किया गया था।
जब शोधकर्ताओं ने 200 विभिन्न प्रश्नों के साथ सिस्टम का परीक्षण किया, तो परिणाम उत्साहजनक थे लेकिन उन्होंने महत्वपूर्ण सीमाओं को भी उजागर किया। उन प्रश्नों के लिए जहाँ उत्तर स्पष्ट रूप से दस्तावेजों में लिखा था, सिस्टम ने उल्लेखनीय सटीकता के साथ प्रदर्शन किया। इसने सफलतापूर्वक सही अनुच्छेदों को खोजा, उनका उचित रूप से उल्लेख किया, और उपयोगकर्ता की भाषा में नियमों का सारांश प्रस्तुत किया। चाहे प्रश्न क्लिनिकल ट्रायल के लिए सुरक्षा रिपोर्टों के समय के बारे में हो या जैविक उत्पादों को पंजीकृत करने के नियमों के बारे में, सिस्टम ने लगभग हर बार सही साक्ष्य खोज लिया। इन मामलों में, कंप्यूटर एक विश्वसनीय मार्गदर्शक के रूप में कार्य करता था, जो खोज को सीमित करता था और एक स्पष्ट, सत्यापन योग्य सारांश प्रस्तुत करता था।
हालाँकि, अध्ययन ने यह भी रेखांकित किया कि सिस्टम को कहाँ सावधान रहने की आवश्यकता थी। सबसे बड़ी चुनौती तब आई जब सिस्टम से ऐसे प्रश्न पूछे गए जो सुनने में ऐसे लगे कि उनका उत्तर दस्तावेजों में होना चाहिए, लेकिन वास्तव में नहीं था। उदाहरण के लिए, यदि कोई उपयोगकर्ता किसी विशिष्ट इलेक्ट्रॉनिक फॉर्म के वर्तमान संस्करण या किसी नियामक के फोन नंबर के बारे में पूछता है, तो सिस्टम कभी-कभी पाठ में मौजूद एक संबंधित लेकिन अपूर्ण नियम का उपयोग करके उत्तर देने की कोशिश करता है। यह एक नियामक संदर्भ में एक खतरनाक त्रुटि है, जहाँ एक अधूरा उत्तर कंपनी को एक महंगी गलती करने की ओर ले जा सकता है। शोधकर्ताओं ने पाया कि सिस्टम शुरू में यह कहने में संघर्ष करता था कि "मुझे नहीं पता" जब विशिष्ट तथ्य गायब थे।
इसे ठीक करने के लिए, टीम ने सिस्टम के निर्देशों को अधिक सतर्क बनाने के लिए समायोजित किया। उन्होंने इसे सिखाया कि जब तक सटीक जानकारी स्पष्ट रूप से मौजूद न हो, तब तक उत्तर देने से इनकार कर दे, भले ही उससे संबंधित कोई नियम मौजूद हो। इस समायोजन के बाद, सिस्टम अपनी सीमाओं को जानने में बहुत बेहतर हो गया। इसने उन लगभग सभी प्रश्नों को देने से मना कर दिया जो इसके पुस्तकालय के बाहर थे, जबकि वैध प्रश्नों का उच्च सटीकता के साथ उत्तर देता रहा। यह समझौता आवश्यक था: एक आंशिक या भ्रामक उत्तर देने की तुलना में यह कहना कि वह मदद नहीं कर सकता, एक नियामक उपकरण के लिए अधिक सुरक्षित है।
शोधकर्ताओं ने निष्कर्ष निकाला कि यह द्विभाषी प्रणाली जटिल स्वास्थ्य नियमों को समझने के लिए एक शक्तिशाली उपकरण है, बशर्ते इसका सही ढंग से उपयोग किया जाए। यह कोई जादुई भविष्यवक्ता (oracle) नहीं है जो हर समस्या को हल कर सके या कानूनी सलाह दे सके। इसके बजाय, यह एक विशेष सहायक है जो उपयोगकर्ताओं को परिभाषित दस्तावेजों के भीतर साक्ष्य खोजने में मदद करता है। अध्ययन ने दिखाया कि जब उत्तर पाठ में मौजूद होता है, तो सिस्टम उसे ढूंढ सकता है और उसे कई भाषाओं में स्पष्ट रूप से समझा सकता है। लेकिन इसका वास्तविक मूल्य यह पहचानने की क्षमता में निहित है कि उत्तर गायब है और वहीं रुक जाना, ताकि अंतिम निर्णय एक मानव विशेषज्ञ पर छोड़ा जा सके जो उद्धरण (citation) को सत्यापित कर सके। दवा विकास और सार्वजनिक स्वास्थ्य की उच्च-दांव वाली दुनिया में, यह जानना कि आप क्या नहीं जानते, उतना ही महत्वपूर्ण है जितना कि वह खोजना जिसे आप ढूंढ रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।