CompProv Produces Machine Readable Graphs Encoding Microscopic Algebraic Provenance for Reproducible Computation
यह शोध पत्र CompProv को प्रस्तुत करता है, जो एक जावा-आधारित फ्रेमवर्क है जो एक सीरियलाइज़ेबल कैलकुलेशन प्रोवेनेंस ग्राफ के माध्यम से परमाणु संचालन स्तर पर सूक्ष्म बीजगणितीय प्रोवेनेंस को कैप्चर करके पुनरुत्पादक और ऑडिट योग्य कम्प्यूटेशनल परिणामों को सुनिश्चित करता है, जिससे मालिकाना सोर्स कोड को उजागर किए बिना नियत पुनरावृत्ति (डिटरमिनिस्टिक रिप्ले) और संवेदनशीलता विश्लेषण सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
वैज्ञानिक अनुसंधान और वित्तीय मॉडलिंग की दुनिया में, विश्वास पारंपरिक रूप से आस्था का विषय रहा है। एक शोधकर्ता एक परिणाम प्रकाशित करता है, या एक बैंक अपने पोर्टफोलियो के मूल्य की रिपोर्ट करता है, और दर्शकों को यह मान लेना चाहिए कि संख्याओं की गणना सही ढंग से की गई थी। दशकों तक, इन संख्याओं को सत्यापित करने के लिए उपयोग किए जाने वाले उपकरण एक शिपिंग मेनिफेस्ट (माल सूची) की तरह काम करते रहे हैं: वे आपको बता सकते हैं कि डेटा का कौन सा बॉक्स फैक्ट्री में पहुँचा और कौन सा बॉक्स बाहर निकला, लेकिन वे फैक्ट्री के फर्श के भीतर क्या हुआ, यह नहीं देख सकते। यदि किसी गणना में गणितीय चरणों की एक लंबी श्रृंखला शामिल है, तो एक मामूली राउंडिंग एरर (दशमलव त्रुटि) या किसी संख्या में अनकहा बदलाव दरारों से निकल सकता है, जो चुपचाप अंतिम उत्तर को बदल देता है। एक बार जब गणना पूरी हो जाती है और कंप्यूटर आगे बढ़ जाता है, तो वे मध्यवर्ती चरण गायब हो जाते हैं, जिससे यह कोई निशान नहीं बचता कि परिणाम वास्तव में कैसे निकाला गया था। यह अंतर उन लोगों के लिए एक बड़ी बाधा बन गया है जो जटिल कार्यों को सत्यापित करने की कोशिश कर रहे हैं, जैसे मौसम मॉडल की जांच करने वाले जलवायु वैज्ञानिक या अरबों डॉलर की संपत्ति का ऑडिट करने वाले लेखा परीक्षक।
शोधकर्ताओं की एक टीम ने 'कॉम्पप्रोव' (CompProv) नामक एक नई प्रणाली विकसित की है जो इन गणनाओं को देखने के हमारे नजरिए को बदल देती है। केवल शुरुआत और अंत के बिंदुओं को देखने के बजाय, यह प्रणाली कंप्यूटर द्वारा किए जाने वाले प्रत्येक गणितीय कदम को चरण-दर-चरण रिकॉर्ड करती है। यह हर संख्या को एक विशेष डिजिटल कंटेनर में लपेटकर काम करती है जो स्वचालित रूप से अपना इतिहास लिख देता है। जैसे ही कंप्यूटर इन संख्याओं को जोड़ता है, घटाता है, या गुणा करता है, प्रणाली सटीक ऑपरेशन, वह समय जब यह हुआ, और संख्याएँ कहाँ से आईं, इसे कैप्चर करती है। परिणाम एक पूर्ण, स्व-निहित मानचित्र है जो पूरी गणना का है जिसे वर्षों बाद भी सहेजा, साझा और फिर से चलाया जा सकता है, भले ही मूल सॉफ़्टवेयर या कंप्यूटर वातावरण अब मौजूद न हो।
शोधकर्ताओं ने इस विचार का परीक्षण तीन बहुत अलग क्षेत्रों में किया ताकि यह देखा जा सके कि क्या यह वास्तविक दुनिया में टिक सकता है। सबसे पहले, उन्होंने इसे विकेंद्रीकृत वित्त (decentralized finance) परिदृश्य में लागू किया, जिसमें एक पोर्टफोलियो के कुल मूल्य की गणना का अनुकरण किया गया। इस परीक्षण में, सिस्टम ने विभिन्न डिजिटल संपत्तियों के मूल्य को ट्रैक किया जब उन्हें परिवर्तित और संयोजित किया गया। टीम ने पाया कि वे अंतिम रिकॉर्ड को ले सकते हैं, उसे एक नए कंप्यूटर वातावरण में डाल सकते हैं, और हर बार बिल्कुल वही परिणाम प्राप्त कर सकते हैं। इससे भी महत्वपूर्ण बात यह है कि वे विशिष्ट इनपुट संख्याओं को बदलकर, जैसे कि एक एकल संपत्ति की कीमत को बदलना, यह देख सकते थे कि अंतिम कुल योग कैसे बदल जाएगा, और यह सब बिना उस निजी कोड को देखे संभव हुआ जिसने गणना की थी। इसने सिद्ध किया कि यह प्रणाली मालिकाना तर्क (proprietary logic) को उजागर किए बिना संवेदनशील वित्तीय डेटा के लिए एक स्पष्ट ऑडिट ट्रेल प्रदान कर सकती है।
इसके बाद, टीम भौतिक माप की सख्त दुनिया की ओर मुड़ी, विशेष रूप से एक गेज ब्लॉक के अंशांकन (calibration) की, जिसका उपयोग सटीक लंबाई को परिभाषित करने के लिए किया जाता है। इस क्षेत्र में, अंतरराष्ट्रीय मानकों को पूरा करने के लिए साक्ष्य की श्रृंखला अटूट होनी चाहिए। शोधकर्ताओं ने एक प्रकाशित अंशांकन प्रक्रिया का पुनर्निर्माण किया, लेकिन उन्होंने पाया कि मूल दस्तावेज़ में गणना करने के लिए आवश्यक तेरह संख्याओं में से सात संख्याएँ छूट गई थीं, जैसे कि हवा का तापमान और दबाव। क्योंकि मूल लेखकों ने इन मध्यवर्ती मूल्यों को रिकॉर्ड नहीं किया था, इसलिए केवल प्रकाशित पाठ से गणना को पूरी तरह से दोहराया नहीं जा सकता था। हालाँकि, नई प्रणाली ने इन लापता हिस्सों को दृश्यमान बना दिया। प्रत्येक संख्या का उपयोग करने से पहले उसे उसके स्रोत के साथ टैग करने के लिए मजबूर करके, प्रणाली ने यह उजागर किया कि कौन सी वैल्यू गायब थी या किन मूल्यों को माना जाना था। परिणामी रिकॉर्ड ने न केवल अंतिम लंबाई को दिखाया, बल्कि उन सभी धारणाओं और मापों की पूरी श्रृंखला को भी दिखाया जो उस तक पहुँचे, जिससे मूल अध्ययन की सीमाएं पारदर्शी और ऑडिट योग्य बन गईं।
अंतिम परीक्षण में एक हाइड्रोलॉजिकल मॉडल शामिल था जिसका उपयोग नदी के प्रवाह की भविष्यवाणी करने के लिए किया जाता था। शोधकर्ताओं ने एक जटिल सिमुलेशन लिया जिसे पहले चलाया गया था और इसके प्रदर्शन मेट्रिक्स की पुनर्गणना करने के लिए इस प्रणाली का उपयोग किया। मूल अध्ययन में, अंतिम स्कोर रिपोर्ट किए गए थे, लेकिन विस्तृत चरण जो यह दिखाते थे कि उन स्कोर को कैसे निकाला गया, शामिल नहीं थे। नई प्रणाली ने कच्चे जल प्रवाह डेटा से लेकर अंतिम प्रदर्शन स्कोर तक, पूरी प्रक्रिया को कैप्चर किया। शोधकर्ता गणना को फिर से चलाकर परिणामों को ठीक से सत्यापित करने में सक्षम थे। उन्होंने एक संवेदनशीलता विश्लेषण (sensitivity analysis) चलाने के लिए भी सिस्टम का उपयोग किया, जिसमें विभिन्न इनपुट डेटा को बदलकर यह देखा गया कि कौन सा सिमुलेशन सबसे अच्छा प्रदर्शन करता है। इसने उन्हें सबसे सटीक मॉडल की पहचान करने और यह साबित करने की अनुमति दी कि परिणाम एक 'ब्लैक बॉक्स' नहीं था, बल्कि मूल डेटा से जुड़ी घटनाओं की एक पूरी तरह से पता लगाने योग्य श्रृंखला थी।
यह सुनिश्चित करने के लिए कि सिस्टम वास्तविक दुनिया की कंप्यूटिंग की मांगों को संभाल सके, शोधकर्ताओं ने यह भी मापा कि यह प्रक्रिया में कितनी अतिरिक्त मेहनत जोड़ता है। उन्होंने पाया कि सरल, तेज़ गणनाओं के लिए, सिस्टम ने काम को धीमा कर दिया, क्योंकि इसे हर चरण को लिखना पड़ता है। हालाँकि, उन्होंने दोहराव वाले लूप्स के लिए रिकॉर्ड को कंप्रेस (संकुचित) करने की एक तकनीक विकसित की, जिससे आवश्यक अतिरिक्त समय और मेमोरी काफी कम हो गई। इस ओवरहेड के बावजूद, सिस्टम ने जटिल कार्यों को समानांतर (parallel) में चलाने में सक्षम होने का प्रमाण दिया, और मानक सॉफ़्टवेयर की तरह ही कुशलता से कई कंप्यूटर प्रोसेसरों का उपयोग करने के लिए स्केल अप किया। अध्ययन ने दिखाया कि हालांकि सिस्टम को एक मानक गणना की तुलना में अधिक संसाधनों की आवश्यकता होती है, लेकिन यह सत्यापन का एक ऐसा स्तर प्रदान करता है जो पहले असंभव था।
यह कार्य यह प्रदर्शित करता है कि एक ऐसी प्रणाली बनाना संभव है जहाँ संख्या का इतिहास स्वयं संख्या जितना महत्वपूर्ण हो। गणना के आंतरिक चरणों को दृश्यमान और स्थायी बनाकर, शोधकर्ताओं ने एक ऐसा उपकरण बनाया है जो वैज्ञानिकों और ऑडिटरों को मूल सॉफ़्टवेयर या मूल वातावरण पर भरोसा किए बिना परिणामों को सत्यापित करने की अनुमति देता है। यह प्रणाली गणना के दौरान होने वाली त्रुटियों को ठीक नहीं करती है, बल्कि यह सुनिश्चित करती है कि यदि कोई त्रुटि होती है, या यदि कोई संख्या बदली जाती है, तो ठीक क्या हुआ है इसका एक पूर्ण, अपरिवर्तनीय रिकॉर्ड मौजूद है। यह प्रमाण के मानक को रिपोर्ट किए गए आउटपुट पर भरोसा करने से बदलकर एक प्रलेखित प्रक्रिया को सत्यापित करने की ओर ले जाता है, जो तेजी से जटिल होती डिजिटल दुनिया में अखंडता सुनिश्चित करने का एक नया तरीका प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।