Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment
यह शोध पत्र ChatInvent एजेंटिक ड्रग डिस्कवरी सिस्टम के लिए एक मानव-संरेखित (human-aligned) LLM-as-a-Judge मूल्यांकन ढांचे को प्रस्तुत करता है, जो विशिष्ट गुणवत्ता आयामों को परिभाषित करता है, उच्च संरेखण प्राप्त करने के लिए विशेषज्ञ एनोटेशन के माध्यम से एक जज मॉडल को मान्य और अनुकूलित करता है, और यह प्रकट करता है कि अनौपचारिक वाक्यांश प्रदर्शन में बाधा नहीं डालते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
दवा की खोज (ड्रग डिस्कवरी) की उच्च-दांव वाली दुनिया में, वैज्ञानिक वर्षों तक अणुओं को डिजाइन करने, उन्हें प्रयोगशाला में बनाने और यह देखने के लिए उनका परीक्षण करने में बिताते हैं कि क्या वे बीमारी को ठीक कर सकते हैं। यह प्रक्रिया धीमी, महंगी और जटिल निर्णयों से भरी होती है। हाल ही में, एक नए प्रकार का आर्टिफिशियल इंटेलिजेंस (AI) दृश्य में आया है: ऐसे सिस्टम जो न केवल सवालों के जवाब देते हैं बल्कि कार्रवाई भी करते हैं। इन्हें 'एजेंटिक सिस्टम' कहा जाता है। एक मानक चैटबॉट के विपरीत जो केवल टेक्स्ट जेनरेट करता है, एक एजेंट एक बहु-चरणीय प्रयोग की योजना बना सकता है, रासायनिक गुणों की गणना करने के लिए विशेष सॉफ्टवेयर का उपयोग कर सकता है, और विशाल वैज्ञानिक डेटाबेस से डेटा प्राप्त कर सकता है। यह एक डिजिटल शोध सहायक की तरह कार्य करता है जो केवल उसके बारे में बात नहीं करता, बल्कि वास्तव में काम कर सकता है। हालाँकि, जैसे-जैसे ये डिजिटल सहायक अधिक सक्षम होते जा रहे हैं, एक महत्वपूर्ण समस्या उभरती है: हमें कैसे पता चलेगा कि वे अच्छा काम कर रहे हैं या नहीं? कंप्यूटर के उत्तरों को ग्रेड देने के पारंपरिक तरीके, जो अक्सर सही उत्तर से शब्दों के मिलान पर निर्भर करते हैं, तब विफल हो जाते हैं जब कार्य खुला और रचनात्मक हो। इसके अलावा, प्रत्येक आउटपुट को ग्रेड देने के लिए मानव विशेषज्ञों से पूछना इन नई मशीनों की गति के साथ तालमेल बिठाने के लिए बहुत धीमा है। वैज्ञानिक समुदाय को इन एजेंटों का मूल्यांकन करने के लिए एक ऐसे तरीके की आवश्यकता थी जो तेज़ और विश्वसनीय दोनों हो।
एस्ट्राजेनिका (AstraZeneca) और गोटसबर्ग विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इस चुनौती से निपटने के लिए एक ऐसा सिस्टम बनाया जहाँ एक आर्टिफिशियल इंटेलिजेंस दूसरे के लिए जज (न्यायाधीश) के रूप में कार्य करता है। उन्होंने 'चैटइन्वेंट' (ChatInvent) नामक एक विशिष्ट टूल पर ध्यान केंद्रित किया, जो एक एजेंटिक असिस्टेंट है जिसे वैज्ञानिकों को दवा विकास के चरणों को नेविगेट करने में मदद करने के लिए डिज़ाइन किया गया है। शोधकर्ता जानते थे कि केवल एक AI को खुद को ग्रेड देने देना जोखिम भरा है, क्योंकि ये मॉडल पक्षपाती या असंगत हो सकते हैं। इसे हल करने के लिए, उन्होंने एक कठोर परीक्षण ढांचा तैयार किया ताकि यह सुनिश्चित किया जा सके कि "जज" AI मानव विशेषज्ञों के साथ सहमत है। उन्होंने चार विशिष्ट गुणों को परिभाषित किया कि एक अच्छा उत्तर कैसा होना चाहिए: क्या प्रतिक्रिया पूर्ण थी, क्या जानकारी प्रश्न के लिए प्रासंगिक थी, टेक्स्ट कितना स्पष्ट और सुव्यवस्थित था, और क्या एजेंट ने अपनी निर्धारित भूमिका के भीतर रहते हुए काम किया बिना उन चीजों को करने की कोशिश किए जिनके लिए वह अधिकृत नहीं था। उन्होंने यह जांचने के लिए एक सख्त चेक भी शामिल किया कि क्या एजेंट ने काम पूरा करने के लिए सही कंप्यूटर टूल्स का उपयोग किया।
सर्वश्रेष्ठ जज खोजने के लिए, टीम ने प्रमुख प्रौद्योगिकी कंपनियों और ओपन-सोर्स प्रोजेक्ट्स के विकल्पों सहित चार अलग-अलग शक्तिशाली AI मॉडलों का परीक्षण किया। उन्होंने रसायन विज्ञान और आर्टिफिशियल इंटेलिजेंस के पांच मानव विशेषज्ञों को 35 प्रश्नों और उत्तरों के सेट को ग्रेड देने के लिए कहा। इन विशेषज्ञों को AI जजों के समान ही निर्देश और जानकारी दी गई थी। शोधकर्ताओं ने फिर मानव विशेषज्ञों द्वारा दिए गए स्कोर की तुलना प्रत्येक AI मॉडल द्वारा दिए गए स्कोर से की। उन्होंने पाया कि हालांकि मानव विशेषज्ञ हमेशा एक-दूसरे से पूरी तरह सहमत नहीं थे, लेकिन AI मॉडल आश्चर्यजनक रूप से सुसंगत थे। एक विशेष मॉडल, विशेष रूप से, मानव बहुमत की राय के साथ बहुत करीब से मेल खाता था। शोधकर्ताओं ने फिर मानव विशेषज्ञों द्वारा एनोटेट किए गए उदाहरणों के एक छोटे सेट का उपयोग करके इस सर्वश्रेष्ठ प्रदर्शन करने वाले AI जज को फाइन-ट्यून (परिष्कृत) किया। अनुकूलन (Optimization) के रूप में जानी जाने वाली इस प्रक्रिया ने जज की मानव सोच से मेल खाने की क्षमता में सुधार किया, जिससे इसका सहमति स्कोर 80% से बढ़कर 86% हो गया।
एक विश्वसनीय जज के साथ, टीम ने 70 नए प्रश्नों का मूल्यांकन किया जिन्हें चैटइन्वेंट सिस्टम ने पहले कभी नहीं देखा था। परिणामों ने एजेंट के प्रदर्शन में ताकत और कमजोरियों दोनों को उजागर किया। सिस्टम विषय पर बने रहने, अपने उत्तरों को स्पष्ट रूप से व्यवस्थित करने और जानकारी एकत्र करने के लिए सही टूल्स का उपयोग करने में उत्कृष्ट था। हालाँकि, यह पूर्णता (completeness) के मामले में संघर्ष करता है। लगभग 40% मामलों में, एजेंट ने आंशिक उत्तर दिया, जिसमें अक्सर विशिष्ट विवरण जैसे कि उत्पन्न फ़ाइल कहाँ मिलेगी या अनुरोधित रासायनिक गुण शामिल करना भूल गया। शोधकर्ताओं ने पाया कि यह इसलिए नहीं था क्योंकि एजेंट ने प्रश्न को गलत समझा, बल्कि इसलिए था क्योंकि वह कभी-कभी अपने वर्कफ़्लो के अंतिम चरण को निष्पादित करने में विफल रहा। दिलचस्प बात यह है कि प्रश्न पूछने का तरीका अंतर पैदा करता है। टीम ने बहुत औपचारिक से लेकर बहुत अनौपचारिक तक के प्रश्नों का परीक्षण किया। उन्होंने पाया कि अत्यधिक औपचारिक शब्दावली से एजेंट के प्रदर्शन में कोई मदद नहीं मिली; वास्तव में, थोड़ा अधिक अनौपचारिक या तटस्थ शब्दावली कभी-कभी बेहतर परिणाम देती है। यह सुझाव देता है कि एजेंट को काम शुरू करने से पहले उपयोगकर्ता के कठिन या जटिल प्रॉम्प्ट को एक स्पष्ट संस्करण में फिर से लिखने के लिए अपने स्वयं के आंतरिक सिस्टम की आवश्यकता हो सकती है।
अध्ययन यह निष्कर्ष निकालता है कि हालांकि ये एजेंटिक सिस्टम दवा की खोज की गति बढ़ाने के लिए बहुत आशाजनक हैं, वे अभी भी पूर्ण नहीं हैं। शोधकर्ताओं ने प्रदर्शित किया कि एक मजबूत, स्वचालित मूल्यांकन प्रणाली बनाना संभव है जो मानव निर्णय की नकल करती है, बशर्ते कि जज को विशेषज्ञ विचारों के साथ सावधानीपूर्वक संरेखित किया गया हो। यह दृष्टिकोण डेवलपर्स को जल्दी से यह पहचानने की अनुमति देता है कि उनके एजेंट कहाँ विफल हो रहे हैं—जैसे कि मिसिंग फ़ाइल पाथ या अधूरा डेटा—बिना हर परीक्षण के लिए मानव ग्रेडर्स की एक टीम को नियुक्त किए। यह कार्य एक ब्लूप्रिंट के रूप में कार्य करता है, जो दिखाता है कि आर्टिफिशियल इंटेलिजेंस के विज्ञान के लिए वास्तव में उपयोगी होने के लिए, हमें पहले इसे यह सिखाना होगा कि वह अपने काम को उसी देखभाल और सटीकता के साथ कैसे ग्रेड दे जैसा कि एक मानव विशेषज्ञ उपयोग करेगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।