From Traditional Scientists to Agentic AI Research: Unequivocal Diagram-as-Code in Scientific Publications
यह शोध पत्र वैज्ञानिक प्रकाशनों में "डायग्राम्स-एज़-कोड" (diagrams-as-code) को अपनाने का समर्थन करता है ताकि व्याख्यात्मक अस्पष्टता को समाप्त किया जा सके, जिससे भविष्य की वैज्ञानिक खोज के लिए वैज्ञानिकों, लार्ज लैंग्वेज मॉडल्स और स्वायत्त एआई एजेंटों के बीच विश्वसनीय सूचना हस्तांतरण सक्षम हो सके।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
विज्ञान हमेशा से अपनी खोजों को साझा करने के लिए दो भाषाओं पर निर्भर रहा है: लिखित शब्द और चित्र। एक शोधकर्ता एक कोशिका के विभिन्न हिस्सों के परस्पर क्रिया करने के तरीके को दिखाने वाले आरेख (डायग्राम) के साथ एक जैविक प्रक्रिया का वर्णन एक पैराग्राफ में कर सकता है। दशकों तक, इन तरीकों ने मानव पाठकों की अच्छी सेवा की है, जिससे वैज्ञानिकों को एक-दूसरे के काम पर आगे बढ़ने में मदद मिली है। फिर भी, भाषा और चित्र दोनों में एक छिपा हुआ दोष है: वे व्याख्या के लिए खुले हैं। एक वाक्य को पाठक की पृष्ठभूमि के आधार पर थोड़े अलग तरीकों से पढ़ा जा सकता है, और एक ड्राइंग को दर्शक द्वारा आकृतियों और तीरों की व्याख्या करने के तरीके के आधार पर अलग तरह से समझा जा सकता है। यह अस्पष्टता मनुष्यों के लिए प्रबंधनीय है, लेकिन यह कृत्रिम बुद्धिमत्ता (AI) प्रणालियों की नई पीढ़ी के लिए एक बड़ी समस्या पैदा करती है, जिन्हें वैज्ञानिक साहित्य को पढ़ने और स्वयं खोज करने के लिए डिज़ाइन किया गया है। इन प्रणालियों, जिन्हें AI एजेंट कहा जाता है, को ऐसी जानकारी की आवश्यकता होती है जो सटीक और स्पष्ट हो, जिसमें अनुमान की कोई गुंजाइश न हो। यदि कोई AI किसी आरेख या विवरण की गलत व्याख्या करता है, तो वह ऐसी गलतियाँ कर सकता है जो उसके काम में लहरों की तरह फैल सकती हैं, जिससे गलत निष्कर्ष निकल सकते हैं।
एक हालिया अध्ययन में, सर्बिया के नोवी साद विश्वविद्यालय के शोधकर्ताओं मिला ग्लवाश्की और लाजर वेलिकी ने इस समस्या का समाधान प्रस्तावित किया। वे सुझाव देते हैं कि वैज्ञानिक पत्रों में "डायग्राम-एज़-कोड" (diagrams-as-code) शामिल होना चाहिए। केवल एक स्थिर इमेज फ़ाइल अपलोड करने के बजाय, लेखक उस छवि को उत्पन्न करने के लिए उपयोग किए जाने वाले वास्तविक कंप्यूटर कोड को प्रदान करेंगे। यह कोड एक सख्त, गणितीय निर्देश सेट के रूपas कार्य करता है जो कंप्यूटर को ठीक से बताता है कि हर रेखा, आकृति और संबंध को कैसे बनाना है। क्योंकि कोड कला के बजाय तर्क की भाषा है, यह अनुमान लगाने की गुंजाइश को खत्म कर देता है। जब एक कंप्यूटर कोड को पढ़ता है, तो वह बिल्कुल वही संरचना देखता है जो लेखक ने चाही थी, जिसका अर्थ में कोई भिन्नता नहीं होती। शोधकर्ताओं ने इस विचार का परीक्षण करने के लिए हृदय गति रुकने (हार्ट फेलियर) से संबंधित तीन सामान्य प्रकार के वैज्ञानिक कंटेंट—कारणों के शाब्दिक विवरण, जैविक तंत्र की व्याख्याएं, और रोगी देखभाल के लिए क्लिनिकल पाथवे—को इस कोड प्रारूप में परिवर्तित किया। उन्होंने पाया कि यह दृष्टिकोण काम करता है, जो एक ऐसा सेतु बनाता है जिससे मानव वैज्ञानिक और AI एजेंट दोनों पूर्ण स्पष्टता के साथ वैज्ञानिक प्रक्रियाओं को समझ सकते हैं।
शोधकर्ताओं ने इस बात पर गौर करते हुए शुरुआत की कि वर्तमान में वैज्ञानिक जानकारी कैसे साझा की जाती है। उन्होंने नोट किया कि जबकि प्राकृतिक भाषा अभिव्यक्ति में अनंत विविधता की अनुमति देती है, यह व्याख्या में भी अनंत विविधता की अनुमति देती है। एक वैज्ञानिक लिख सकता है कि हृदय की स्थिति उच्च रक्तचाप के कारण होती है, जबकि दूसरा इसे वाल्व की क्षति के परिणाम के रूप में वर्णित कर सकता है। दोनों सही हैं, लेकिन विशिष्ट शब्दावली AI को दोनों के बीच के संबंध को समझने से रोक सकती है। इसी तरह, एक दृश्य आरेख विभिन्न हिस्सों को जोड़ने वाले तीर दिखा सकता है, लेकिन एक सख्त परिभाषा के बिना, AI को यह पता नहीं चल सकता कि वे तीर एक कारण, एक दुष्प्रभाव, या एक साधारण जुड़ाव का प्रतिनिधित्व करते हैं। आधुनिक AI विकास का लक्ष्य ऐसी प्रणालियाँ बनाना है जो स्वायत्त रूप से वैज्ञानिक खोजें कर सकें, जो स्वतंत्र शोधकर्ताओं के रूप में कार्य कर सकें जो हजारों शोध पत्रों को पढ़ सकें और नया ज्ञान संश्लेषित कर सकें। ऐसा करने के लिए, इन AI एजेंटों को एक-दूसरे को पूर्ण सटीकता के साथ जानकारी देने की आवश्यकता होती है। यदि एक एजेंट किसी गलत समझे गए आरेख के आधार पर दूसरे को कार्य सौंपता है, तो अनुसंधान की पूरी श्रृंखला विफल हो सकती है।
अपने विचार का परीक्षण करने के लिए, ग्लवाश्की और वेलिकी ने कार्डियोलॉजी (हृदय के अध्ययन) के क्षेत्र से तीन अलग-अलग उदाहरण चुने। पहला उदाहरण एक पैराग्राफ था जो हृदय गति रुकने के विभिन्न तरीकों का वर्णन करता था, जिसमें इस्केमिक इंजरी, प्रेशर ओवरलोड और मेटाबॉलिक डिजीज जैसे कारणों को सूचीबद्ध किया गया था। दूसरा, हृदय गति रुकने की एक नैदानिक सिंड्रोम के रूप में परिभाषा थी, जो विस्तार से बताती थी कि हृदय में संरचनात्मक समस्याओं से लक्षण कैसे उत्पन्न होते हैं। तीसरा, डॉक्टरों के लिए एक चरण-दर-चरण मार्गदर्शिका थी कि हृदय गति रुकने के संदिग्ध रोगी का मूल्यांकन कैसे किया जाए, जिसमें मेडिकल हिस्ट्री से लेकर शारीरिक परीक्षण तक सब कुछ शामिल था। इन ग्रंथों के साथ, उन्होंने तीन संगत आरेखों का भी उपयोग किया जो इन्हीं अवधारणाओं को दृश्य रूप में प्रस्तुत करते थे। ये इनपुट उनके प्रयोग के लिए कच्चा माल (raw material) थे।
टीम ने इन इनपुट्स को कोड में बदलने के लिए एक बड़े लैंग्वेज मॉडल (एक प्रकार का AI चैटबॉट) के मुफ्त संस्करण का उपयोग किया। उन्होंने AI से दो अलग-अलग डायग्रामिंग टूल्स, मर्मेड (Mermaid) और D2 के लिए कोड बनाने को कहा, जो टेक्स्ट निर्देशों को विजुअल चार्ट में बदलते हैं। टेक्स्ट विवरणों के लिए, प्रॉम्प्ट सरल था: "इसके लिए मर्मर्ड डायग्राम का कोड बनाएं।" मौजूदा छवियों के लिए, प्रॉम्प्ट थोड़ा अधिक विशिष्ट था: "इस आकृति के लिए मर्मर्ड डायग्राम का कोड बनाएं। अपनी ओर से कुछ भी न जोड़ें।" शोधकर्ता यह देखना चाहते थे कि क्या AI एक पैराग्राफ के टेक्स्ट या एक स्थिर छवि को देख सकता है और उसे तार्किक निर्देशों के एक सेट में अनुवादित कर सकता है जिसे दूसरा कंप्यूटर पढ़ सके।
परिणामों ने दिखाया कि यह दृष्टिकोण व्यवहार्य है। प्रत्येक टेक्स्ट विवरण और प्रत्येक छवि के लिए, AI ने सफलतापूर्वक कोड उत्पन्न किया जो, जब एक मानक एडिटर के माध्यम से चलाया गया, तो एक ऐसा डायग्राम बनाया जो मूल अर्थ से मेल खाता था। हार्ट फेलियर के साझा तंत्रों के बारे में टेक्स्ट के लिए, कोड ने एक फ्लोचार्ट बनाया जो दिखाता है कि कैसे विभिन्न मार्ग एक ही परिणाम की ओर ले जाते हैं। बीमारी को परिभाषित करने वाले टेक्स्ट के लिए, कोड ने विभिन्न कारणों को स्थिति से जोड़ने वाला एक डायग्राम बनाया। क्लिनिकल पाथवे के लिए, कोड ने उन चरणों को मैप किया जो एक डॉक्टर को पहले दौरे से लेकर शारीरिक परीक्षण तक उठाने चाहिए। शोधकर्ताओं ने मूल स्थिर छवियों को भी कोड में परिवर्तित किया, जिसके लिए उन्होंने AI को आकृतियों के आधार पर कोड उत्पन्न करने का निर्देश दिया। AI ने कोड निर्देश सफलतापूर्वक तैयार किए जो, रेंडर होने पर, आणविक तंत्र, पैथोफिजियोलॉजिकल कैस्केड और क्लिनिकल पाथवे की दृश्य संरचना को फिर से बना सके।
एक बार कोड उत्पन्न हो जाने के बाद, शोधकर्ताओं ने इसे आँख मूंदकर स्वीकार नहीं किया। उन्होंने मर्मर्ड और D2 के ऑनलाइन एडिटर्स में आउटपुट की मैन्युअल जांच की। उन्होंने पाया कि हालांकि AI ने सामान्य संरचना को सही पकड़ा, लेकिन कभी-कभी इसमें मामूली समायोजन की आवश्यकता होती थी। उदाहरण के लिए, एक तीर की दिशा को पलटने की आवश्यकता हो सकती थी, या दो ब्लॉक्स के बीच के कनेक्शन को सटीक विज्ञान को दर्शाने के लिए दूसरी जगह स्थानांतरित करने की आवश्यकता हो सकती थी। ये छोटे बदलाव यह सुनिश्चित करने के लिए आवश्यक थे कि कोड इच्छित प्रतिनिधित्व को पूरी तरह से प्रतिबिंबित करे। हालाँकि, तथ्य यह था कि मुख्य संरचना को स्वचालित रूप से उत्पन्न किया जा सकता था, जो प्रमुख निष्कर्ष था। कोड ने जानकारी के अपरिवर्तनीय, सटीक रिकॉर्ड के रूप में कार्य किया, जबकि दृश्य आरेख केवल मनुष्यों के लिए यह पुष्टि करने का एक तरीका था कि कोड सही है।
शोधकर्ता इस बात पर जोर देते हैं कि यह पद्धति मानवीय निरीक्षण की आवश्यकता को प्रतिस्थापित नहीं करती है। यदि कोई AI 'हैलुसिनेशन' (AI द्वारा बनाई गई एक गलत तथ्य) के आधार पर कोड उत्पन्न करता है, तो परिणामी डायग्राम गलत होगा। हालाँकि, उनके द्वारा प्रस्तावित प्रणाली में एक अंतर्निहित जाँच शामिल है। क्योंकि कोड मानव-पठनीय है और इसे तुरंत रेंडर किया जा सकता है, एक वैज्ञानिक उत्पन्न डायग्राम को देख सकता है और तुरंत देख सकता है कि क्या यह टेक्स्ट या मूल छवि से मेल खाता है। यदि ऐसा नहीं है, तो वे कोड को ठीक कर सकते हैं। यह प्रक्रिया सुनिश्चित करती है कि अंतिम प्रतिनिधित्व सटीक है। अध्ययन का सुझाव है कि भविष्य में, वैज्ञानिक पत्रों में इन कोड स्निपेट्स को पारंपरिक टेक्स्ट और छवियों के साथ शामिल किया जा सकता है। इससे AI एजेंट शोध के सटीक तर्क को निकालने में सक्षम होंगे, बिना दृश्य या पाठ्य संकेतों की गलत व्याख्या किए।
इस कार्य के निहितार्थ केवल हार्ट फेलियर तक ही सीमित नहीं हैं। शोधकर्ताओं का तर्क है कि इस दृष्टिकोण को किसी भी वैज्ञानिक क्षेत्र में लागू किया जा सकता है जहाँ प्रक्रियाओं का वर्णन किया जाता है। चाहे वह लैब में रसायनों का प्रवाह हो, चिकित्सा उपचार के चरण हों, या पारिस्थितिक तंत्र के संबंध हों, इन प्रक्रियाओं को कोड के रूप में प्रस्तुत करना उन्हें सार्वभौमिक रूप से समझने योग्य बना देगा। यह एक मानव वैज्ञानिक को अपने प्रोजेक्ट को एक AI एजेंट को सौंपने की अनुमति देगा, और उस एजेंट को दूसरे AI को इसे सौंपने की, इस गारंटी के साथ कि काम का अर्थ हर चरण पर अपरिवर्तित रहता है। कोड एक सार्वभौमिक अनुवादक के रूप में कार्य करता है, जो प्राकृतिक भाषा की अस्पष्टता और स्थिर छवियों की व्यक्तिपरकता को हटा देता है।
अपनी चर्चा में, लेखक स्वीकार करते हैं कि इस पद्धति की सीमाएँ हैं। यह केवल उसी चीज़ का प्रतिनिधित्व कर सकता है जो पहले से ज्ञात है। यदि कोई वैज्ञानिक प्रक्रिया अज्ञात तत्वों या संबंधों में शामिल है जो अभी तक खोजे नहीं गए हैं, तो उन रिक्त स्थानों को कोड द्वारा नहीं भरा जा सकता है। इसके अलावा, कोड की गुणवत्ता उस AI की गुणवत्ता पर निर्भर करती है जो इसे उत्पन्न कर रहा है। अधिक जटिल प्रॉम्प्ट का उपयोग करने से बेहतर परिणाम मिल सकते हैं, लेकिन शोधकर्ताओं ने दिखाया कि सरल निर्देशों के साथ भी, सिस्टम उपयोगी होने के लिए पर्याप्त रूप से काम करता है। उन्होंने यह भी नोट किया कि हालांकि उन्होंने मर्मर्ड और D2 का उपयोग किया, अन्य उपकरण जैसे प्लांट-यूएमएल (PlantUML) या ग्राफविज़ (Graphviz) भी समान उद्देश्य पूरा कर सकते हैं। विशिष्ट उपकरण से अधिक महत्वपूर्ण यह अवधारणा है कि एक कोड-आधारित प्रतिनिधित्व मौजूद हो।
अध्ययन इस निष्कर्ष पर पहुँचता है कि AI के युग में वैज्ञानिक जानकारी को साझा करने के तरीके को मानकीकृत करने का समय आ गया है। 'डायग्राम-एज़-कोड' को अपनाकर, वैज्ञानिक समुदाय यह सुनिश्चित कर सकता है कि उनके द्वारा उत्पादित ज्ञान न केवल मनुष्यों द्वारा पठनीय है, बल्कि मशीनों द्वारा निष्पादित (executable) भी है। यह बदलाव वैज्ञानिक साहित्य को स्थिर दस्तावेजों के संग्रह से एक गतिशील, मशीन-पठनीय संसाधन में बदल देगा। यह मानव शोधकर्ताओं और कृत्रिम बुद्धिमत्ता के बीच ज्ञान के निर्बाध हस्तांतरण की अनुमति देगा, जिससे एक ऐसा भविष्य प्रशस्त होगा जहाँ AI एजेंट वैज्ञानिकों के साथ सहयोग कर सकेंगे और उस स्तर की सटीकता के साथ जटिल समस्याओं को हल कर सकेंगे जो पहले असंभव थी। शोधकर्ताओं ने प्रदर्शित किया है कि यह केवल एक सैद्धांतिक विचार नहीं है, बल्कि एक व्यावहारिक वास्तविकता है जिसे मौजूदा उपकरणों के साथ आज ही लागू किया जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।