← नवीनतम पेपर
💻 computer science

From Traditional Scientists to Agentic AI Research: Unequivocal Diagram-as-Code in Scientific Publications

यह शोध पत्र वैज्ञानिक प्रकाशनों में "डायग्राम्स-एज़-कोड" (diagrams-as-code) को अपनाने का समर्थन करता है ताकि व्याख्यात्मक अस्पष्टता को समाप्त किया जा सके, जिससे भविष्य की वैज्ञानिक खोज के लिए वैज्ञानिकों, लार्ज लैंग्वेज मॉडल्स और स्वायत्त एआई एजेंटों के बीच विश्वसनीय सूचना हस्तांतरण सक्षम हो सके।

मूल लेखक: Mila Glavaški, Lazar Velicki

प्रकाशित 2026-09-16
📖 10 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mila Glavaški, Lazar Velicki

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

विज्ञान हमेशा से अपनी खोजों को साझा करने के लिए दो भाषाओं पर निर्भर रहा है: लिखित शब्द और चित्र। एक शोधकर्ता एक कोशिका के विभिन्न हिस्सों के परस्पर क्रिया करने के तरीके को दिखाने वाले आरेख (डायग्राम) के साथ एक जैविक प्रक्रिया का वर्णन एक पैराग्राफ में कर सकता है। दशकों तक, इन तरीकों ने मानव पाठकों की अच्छी सेवा की है, जिससे वैज्ञानिकों को एक-दूसरे के काम पर आगे बढ़ने में मदद मिली है। फिर भी, भाषा और चित्र दोनों में एक छिपा हुआ दोष है: वे व्याख्या के लिए खुले हैं। एक वाक्य को पाठक की पृष्ठभूमि के आधार पर थोड़े अलग तरीकों से पढ़ा जा सकता है, और एक ड्राइंग को दर्शक द्वारा आकृतियों और तीरों की व्याख्या करने के तरीके के आधार पर अलग तरह से समझा जा सकता है। यह अस्पष्टता मनुष्यों के लिए प्रबंधनीय है, लेकिन यह कृत्रिम बुद्धिमत्ता (AI) प्रणालियों की नई पीढ़ी के लिए एक बड़ी समस्या पैदा करती है, जिन्हें वैज्ञानिक साहित्य को पढ़ने और स्वयं खोज करने के लिए डिज़ाइन किया गया है। इन प्रणालियों, जिन्हें AI एजेंट कहा जाता है, को ऐसी जानकारी की आवश्यकता होती है जो सटीक और स्पष्ट हो, जिसमें अनुमान की कोई गुंजाइश न हो। यदि कोई AI किसी आरेख या विवरण की गलत व्याख्या करता है, तो वह ऐसी गलतियाँ कर सकता है जो उसके काम में लहरों की तरह फैल सकती हैं, जिससे गलत निष्कर्ष निकल सकते हैं।

एक हालिया अध्ययन में, सर्बिया के नोवी साद विश्वविद्यालय के शोधकर्ताओं मिला ग्लवाश्की और लाजर वेलिकी ने इस समस्या का समाधान प्रस्तावित किया। वे सुझाव देते हैं कि वैज्ञानिक पत्रों में "डायग्राम-एज़-कोड" (diagrams-as-code) शामिल होना चाहिए। केवल एक स्थिर इमेज फ़ाइल अपलोड करने के बजाय, लेखक उस छवि को उत्पन्न करने के लिए उपयोग किए जाने वाले वास्तविक कंप्यूटर कोड को प्रदान करेंगे। यह कोड एक सख्त, गणितीय निर्देश सेट के रूपas कार्य करता है जो कंप्यूटर को ठीक से बताता है कि हर रेखा, आकृति और संबंध को कैसे बनाना है। क्योंकि कोड कला के बजाय तर्क की भाषा है, यह अनुमान लगाने की गुंजाइश को खत्म कर देता है। जब एक कंप्यूटर कोड को पढ़ता है, तो वह बिल्कुल वही संरचना देखता है जो लेखक ने चाही थी, जिसका अर्थ में कोई भिन्नता नहीं होती। शोधकर्ताओं ने इस विचार का परीक्षण करने के लिए हृदय गति रुकने (हार्ट फेलियर) से संबंधित तीन सामान्य प्रकार के वैज्ञानिक कंटेंट—कारणों के शाब्दिक विवरण, जैविक तंत्र की व्याख्याएं, और रोगी देखभाल के लिए क्लिनिकल पाथवे—को इस कोड प्रारूप में परिवर्तित किया। उन्होंने पाया कि यह दृष्टिकोण काम करता है, जो एक ऐसा सेतु बनाता है जिससे मानव वैज्ञानिक और AI एजेंट दोनों पूर्ण स्पष्टता के साथ वैज्ञानिक प्रक्रियाओं को समझ सकते हैं।

शोधकर्ताओं ने इस बात पर गौर करते हुए शुरुआत की कि वर्तमान में वैज्ञानिक जानकारी कैसे साझा की जाती है। उन्होंने नोट किया कि जबकि प्राकृतिक भाषा अभिव्यक्ति में अनंत विविधता की अनुमति देती है, यह व्याख्या में भी अनंत विविधता की अनुमति देती है। एक वैज्ञानिक लिख सकता है कि हृदय की स्थिति उच्च रक्तचाप के कारण होती है, जबकि दूसरा इसे वाल्व की क्षति के परिणाम के रूप में वर्णित कर सकता है। दोनों सही हैं, लेकिन विशिष्ट शब्दावली AI को दोनों के बीच के संबंध को समझने से रोक सकती है। इसी तरह, एक दृश्य आरेख विभिन्न हिस्सों को जोड़ने वाले तीर दिखा सकता है, लेकिन एक सख्त परिभाषा के बिना, AI को यह पता नहीं चल सकता कि वे तीर एक कारण, एक दुष्प्रभाव, या एक साधारण जुड़ाव का प्रतिनिधित्व करते हैं। आधुनिक AI विकास का लक्ष्य ऐसी प्रणालियाँ बनाना है जो स्वायत्त रूप से वैज्ञानिक खोजें कर सकें, जो स्वतंत्र शोधकर्ताओं के रूप में कार्य कर सकें जो हजारों शोध पत्रों को पढ़ सकें और नया ज्ञान संश्लेषित कर सकें। ऐसा करने के लिए, इन AI एजेंटों को एक-दूसरे को पूर्ण सटीकता के साथ जानकारी देने की आवश्यकता होती है। यदि एक एजेंट किसी गलत समझे गए आरेख के आधार पर दूसरे को कार्य सौंपता है, तो अनुसंधान की पूरी श्रृंखला विफल हो सकती है।

अपने विचार का परीक्षण करने के लिए, ग्लवाश्की और वेलिकी ने कार्डियोलॉजी (हृदय के अध्ययन) के क्षेत्र से तीन अलग-अलग उदाहरण चुने। पहला उदाहरण एक पैराग्राफ था जो हृदय गति रुकने के विभिन्न तरीकों का वर्णन करता था, जिसमें इस्केमिक इंजरी, प्रेशर ओवरलोड और मेटाबॉलिक डिजीज जैसे कारणों को सूचीबद्ध किया गया था। दूसरा, हृदय गति रुकने की एक नैदानिक सिंड्रोम के रूप में परिभाषा थी, जो विस्तार से बताती थी कि हृदय में संरचनात्मक समस्याओं से लक्षण कैसे उत्पन्न होते हैं। तीसरा, डॉक्टरों के लिए एक चरण-दर-चरण मार्गदर्शिका थी कि हृदय गति रुकने के संदिग्ध रोगी का मूल्यांकन कैसे किया जाए, जिसमें मेडिकल हिस्ट्री से लेकर शारीरिक परीक्षण तक सब कुछ शामिल था। इन ग्रंथों के साथ, उन्होंने तीन संगत आरेखों का भी उपयोग किया जो इन्हीं अवधारणाओं को दृश्य रूप में प्रस्तुत करते थे। ये इनपुट उनके प्रयोग के लिए कच्चा माल (raw material) थे।

टीम ने इन इनपुट्स को कोड में बदलने के लिए एक बड़े लैंग्वेज मॉडल (एक प्रकार का AI चैटबॉट) के मुफ्त संस्करण का उपयोग किया। उन्होंने AI से दो अलग-अलग डायग्रामिंग टूल्स, मर्मेड (Mermaid) और D2 के लिए कोड बनाने को कहा, जो टेक्स्ट निर्देशों को विजुअल चार्ट में बदलते हैं। टेक्स्ट विवरणों के लिए, प्रॉम्प्ट सरल था: "इसके लिए मर्मर्ड डायग्राम का कोड बनाएं।" मौजूदा छवियों के लिए, प्रॉम्प्ट थोड़ा अधिक विशिष्ट था: "इस आकृति के लिए मर्मर्ड डायग्राम का कोड बनाएं। अपनी ओर से कुछ भी न जोड़ें।" शोधकर्ता यह देखना चाहते थे कि क्या AI एक पैराग्राफ के टेक्स्ट या एक स्थिर छवि को देख सकता है और उसे तार्किक निर्देशों के एक सेट में अनुवादित कर सकता है जिसे दूसरा कंप्यूटर पढ़ सके।

परिणामों ने दिखाया कि यह दृष्टिकोण व्यवहार्य है। प्रत्येक टेक्स्ट विवरण और प्रत्येक छवि के लिए, AI ने सफलतापूर्वक कोड उत्पन्न किया जो, जब एक मानक एडिटर के माध्यम से चलाया गया, तो एक ऐसा डायग्राम बनाया जो मूल अर्थ से मेल खाता था। हार्ट फेलियर के साझा तंत्रों के बारे में टेक्स्ट के लिए, कोड ने एक फ्लोचार्ट बनाया जो दिखाता है कि कैसे विभिन्न मार्ग एक ही परिणाम की ओर ले जाते हैं। बीमारी को परिभाषित करने वाले टेक्स्ट के लिए, कोड ने विभिन्न कारणों को स्थिति से जोड़ने वाला एक डायग्राम बनाया। क्लिनिकल पाथवे के लिए, कोड ने उन चरणों को मैप किया जो एक डॉक्टर को पहले दौरे से लेकर शारीरिक परीक्षण तक उठाने चाहिए। शोधकर्ताओं ने मूल स्थिर छवियों को भी कोड में परिवर्तित किया, जिसके लिए उन्होंने AI को आकृतियों के आधार पर कोड उत्पन्न करने का निर्देश दिया। AI ने कोड निर्देश सफलतापूर्वक तैयार किए जो, रेंडर होने पर, आणविक तंत्र, पैथोफिजियोलॉजिकल कैस्केड और क्लिनिकल पाथवे की दृश्य संरचना को फिर से बना सके।

एक बार कोड उत्पन्न हो जाने के बाद, शोधकर्ताओं ने इसे आँख मूंदकर स्वीकार नहीं किया। उन्होंने मर्मर्ड और D2 के ऑनलाइन एडिटर्स में आउटपुट की मैन्युअल जांच की। उन्होंने पाया कि हालांकि AI ने सामान्य संरचना को सही पकड़ा, लेकिन कभी-कभी इसमें मामूली समायोजन की आवश्यकता होती थी। उदाहरण के लिए, एक तीर की दिशा को पलटने की आवश्यकता हो सकती थी, या दो ब्लॉक्स के बीच के कनेक्शन को सटीक विज्ञान को दर्शाने के लिए दूसरी जगह स्थानांतरित करने की आवश्यकता हो सकती थी। ये छोटे बदलाव यह सुनिश्चित करने के लिए आवश्यक थे कि कोड इच्छित प्रतिनिधित्व को पूरी तरह से प्रतिबिंबित करे। हालाँकि, तथ्य यह था कि मुख्य संरचना को स्वचालित रूप से उत्पन्न किया जा सकता था, जो प्रमुख निष्कर्ष था। कोड ने जानकारी के अपरिवर्तनीय, सटीक रिकॉर्ड के रूप में कार्य किया, जबकि दृश्य आरेख केवल मनुष्यों के लिए यह पुष्टि करने का एक तरीका था कि कोड सही है।

शोधकर्ता इस बात पर जोर देते हैं कि यह पद्धति मानवीय निरीक्षण की आवश्यकता को प्रतिस्थापित नहीं करती है। यदि कोई AI 'हैलुसिनेशन' (AI द्वारा बनाई गई एक गलत तथ्य) के आधार पर कोड उत्पन्न करता है, तो परिणामी डायग्राम गलत होगा। हालाँकि, उनके द्वारा प्रस्तावित प्रणाली में एक अंतर्निहित जाँच शामिल है। क्योंकि कोड मानव-पठनीय है और इसे तुरंत रेंडर किया जा सकता है, एक वैज्ञानिक उत्पन्न डायग्राम को देख सकता है और तुरंत देख सकता है कि क्या यह टेक्स्ट या मूल छवि से मेल खाता है। यदि ऐसा नहीं है, तो वे कोड को ठीक कर सकते हैं। यह प्रक्रिया सुनिश्चित करती है कि अंतिम प्रतिनिधित्व सटीक है। अध्ययन का सुझाव है कि भविष्य में, वैज्ञानिक पत्रों में इन कोड स्निपेट्स को पारंपरिक टेक्स्ट और छवियों के साथ शामिल किया जा सकता है। इससे AI एजेंट शोध के सटीक तर्क को निकालने में सक्षम होंगे, बिना दृश्य या पाठ्य संकेतों की गलत व्याख्या किए।

इस कार्य के निहितार्थ केवल हार्ट फेलियर तक ही सीमित नहीं हैं। शोधकर्ताओं का तर्क है कि इस दृष्टिकोण को किसी भी वैज्ञानिक क्षेत्र में लागू किया जा सकता है जहाँ प्रक्रियाओं का वर्णन किया जाता है। चाहे वह लैब में रसायनों का प्रवाह हो, चिकित्सा उपचार के चरण हों, या पारिस्थितिक तंत्र के संबंध हों, इन प्रक्रियाओं को कोड के रूप में प्रस्तुत करना उन्हें सार्वभौमिक रूप से समझने योग्य बना देगा। यह एक मानव वैज्ञानिक को अपने प्रोजेक्ट को एक AI एजेंट को सौंपने की अनुमति देगा, और उस एजेंट को दूसरे AI को इसे सौंपने की, इस गारंटी के साथ कि काम का अर्थ हर चरण पर अपरिवर्तित रहता है। कोड एक सार्वभौमिक अनुवादक के रूप में कार्य करता है, जो प्राकृतिक भाषा की अस्पष्टता और स्थिर छवियों की व्यक्तिपरकता को हटा देता है।

अपनी चर्चा में, लेखक स्वीकार करते हैं कि इस पद्धति की सीमाएँ हैं। यह केवल उसी चीज़ का प्रतिनिधित्व कर सकता है जो पहले से ज्ञात है। यदि कोई वैज्ञानिक प्रक्रिया अज्ञात तत्वों या संबंधों में शामिल है जो अभी तक खोजे नहीं गए हैं, तो उन रिक्त स्थानों को कोड द्वारा नहीं भरा जा सकता है। इसके अलावा, कोड की गुणवत्ता उस AI की गुणवत्ता पर निर्भर करती है जो इसे उत्पन्न कर रहा है। अधिक जटिल प्रॉम्प्ट का उपयोग करने से बेहतर परिणाम मिल सकते हैं, लेकिन शोधकर्ताओं ने दिखाया कि सरल निर्देशों के साथ भी, सिस्टम उपयोगी होने के लिए पर्याप्त रूप से काम करता है। उन्होंने यह भी नोट किया कि हालांकि उन्होंने मर्मर्ड और D2 का उपयोग किया, अन्य उपकरण जैसे प्लांट-यूएमएल (PlantUML) या ग्राफविज़ (Graphviz) भी समान उद्देश्य पूरा कर सकते हैं। विशिष्ट उपकरण से अधिक महत्वपूर्ण यह अवधारणा है कि एक कोड-आधारित प्रतिनिधित्व मौजूद हो।

अध्ययन इस निष्कर्ष पर पहुँचता है कि AI के युग में वैज्ञानिक जानकारी को साझा करने के तरीके को मानकीकृत करने का समय आ गया है। 'डायग्राम-एज़-कोड' को अपनाकर, वैज्ञानिक समुदाय यह सुनिश्चित कर सकता है कि उनके द्वारा उत्पादित ज्ञान न केवल मनुष्यों द्वारा पठनीय है, बल्कि मशीनों द्वारा निष्पादित (executable) भी है। यह बदलाव वैज्ञानिक साहित्य को स्थिर दस्तावेजों के संग्रह से एक गतिशील, मशीन-पठनीय संसाधन में बदल देगा। यह मानव शोधकर्ताओं और कृत्रिम बुद्धिमत्ता के बीच ज्ञान के निर्बाध हस्तांतरण की अनुमति देगा, जिससे एक ऐसा भविष्य प्रशस्त होगा जहाँ AI एजेंट वैज्ञानिकों के साथ सहयोग कर सकेंगे और उस स्तर की सटीकता के साथ जटिल समस्याओं को हल कर सकेंगे जो पहले असंभव थी। शोधकर्ताओं ने प्रदर्शित किया है कि यह केवल एक सैद्धांतिक विचार नहीं है, बल्कि एक व्यावहारिक वास्तविकता है जिसे मौजूदा उपकरणों के साथ आज ही लागू किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →