MioFFAn: an Annotation Software for Formula Formalization with LLM Automation Capabilities
यह शोध पत्र MioFFAn को प्रस्तुत करता है, जो एक ओपन-सोर्स, अनुकूलन योग्य एनोटेशन फ्रेमवर्क है जो मानव एनोटेशन को मॉड्यूलर लार्ज लैंग्वेज मॉडल ऑटोमेशन के साथ जोड़कर फॉर्मूला फॉर्मलाइजेशन के लिए उच्च-गुणवत्ता वाले डेटासेट के निर्माण को सुगम बनाने हेतु MioGatto आर्किटेक्चर का विस्तार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य को सुलझाने की कोशिश कर रहे हैं, लेकिन सुराग एक गुप्त कोड में लिखे गए हैं जिसे केवल एक कंप्यूटर पढ़ सकता है, जबकि कहानी एक ऐसी भाषा में लिखी गई है जिसे केवल मनुष्य समझते हैं। यह उन वैज्ञानिकों का दैनिक संघर्ष है जो जटिल गणित से भरे शोध पत्र लिखते हैं। वे दुनिया कैसे काम करती है, इसका वर्णन करने के लिए सुंदर, सुरुचिपूर्ण सूत्रों (formulas) का उपयोग करते हैं, लेकिन ये सूत्र अक्सर गणित के केवल "चित्र" होते हैं—जैसे कि एक पुल का चित्र। लेकिन उस पुल को वास्तव में बनाने के लिए, एक कंप्यूटर को ब्लूप्रिंट की आवश्यकता होती है: विशिष्ट निर्देश, चर (variables), और तर्क जो एक मशीन को यह बता सके कि स्टील पर तनाव की गणना कैसे की जाए। गणित के इस "चित्र" को कंप्यूटर के "ब्लूप्रिंट" में बदलने की इस प्रक्रिया को फॉर्मूला फॉर्मलाइजेशन (Formula Formalization) कहा जाता है।
समस्या यह है कि कंप्यूटर, यहाँ तक कि आर्टिफिशियल इंटेलिजेंस (AI) द्वारा संचालित सुपर-स्मार्ट कंप्यूटर भी, अपने आप में इन ब्लूप्रिंट्स को पढ़ने में बहुत खराब हैं। उन्हें सीखने के लिए उदाहरणों के एक विशाल पुस्तकालय की आवश्यकता होती है—"गणित के चित्र" और "कंप्यूटर ब्लूप्रिंट" के हजारों जोड़े—ताकी वे अनुवाद करना सीख सकें। लेकिन पेच यह है कि अभी तक किसी ने यह पुस्तकालय बनाया नहीं है क्योंकि इसे बनाना अविश्वसनीय रूप से कठिन और उबाऊ काम है। मनुष्यों को हर एक वैज्ञानिक शोध पत्र के प्रत्येक गणितीय प्रतीक को मैन्युअल रूप से कोड में फिर से लिखना पड़ता है, जो एक ऐसा काम है जो इतना उबाऊ है कि यह वैज्ञानिक प्रगति को धीमा कर देता है। यह दुनिया के हर व्यंजन के लिए, एक समय में एक सामग्री के हिसाब से, हाथ से हर रेसिपी को लिखने जैसा है।
यहीं पर MioFFAn नामक एक नया टूल काम आता है। इसे एक हाई-टेक, इंटरैक्टिव नोटबुक के रूप में समझें जिसे गणित को कोड में अनुवाद करने के उबाऊ काम को बहुत तेज़ और कम कष्टदायक बनाने के लिए डिज़ाइन किया गया है। इसके पीछे के शोधकर्ताओं ने केवल एक स्थिर टूल नहीं बनाया; उन्होंने एक "ह्यूमन-इन-द-लूप" (मानव-केंद्रित) सिस्टम बनाया है। इसका अर्थ है कि सॉफ्टवेयर एक स्मार्ट सहायक की तरह कार्य करता है जो AI का उपयोग करके अनुवाद का अनुमान लगाता है, लेकिन फिर एक मानव विशेषज्ञ से गलतियों की जाँच करने और उन्हें ठीक करने के लिए कहता है। यह एक रोबोट होने जैसा है जो आपके लिए पत्र का मसौदा तैयार कर सकता है, लेकिन आपको भेजने से पहले हस्ताक्षर करने और तथ्यों की जांच करने की आवश्यकता होती है। इस टीम-अप दृष्टिकोण का उपयोग करके, लेखक दिखाते हैं कि हम पहले की तुलना में बहुत तेज़ी से गणित-से-कोड के उदाहरणों का वह महत्वपूर्ण पुस्तकालय बनाना शुरू कर सकते हैं, जिससे कंप्यूटर के लिए आधुनिक विज्ञान को चलाने वाले जटिल गणित को समझना आसान हो जाएगा।
पेपर की कहानी: गणित और कोड के बीच एक सेतु बनाना
यह पेपर MioFFAn को पेश करता है, जो वैज्ञानिक दस्तावेजों को एनोटेट (annotate) करने में मदद करने के लिए डिज़ाइन किया गया एक ओपन-सोर्स सॉफ्टवेयर है। इसका मुख्य लक्ष्य फॉर्मूला फॉर्मलाइजेशन को सुगम बनाना है, जो किसी शोध पत्र से एक गणितीय अभिव्यक्ति को लेने और उसे निष्पादन योग्य प्रतीकात्मक कोड (जैसे कि कोड जो आप कंप्यूटर बीजगणित प्रणाली में लिखते हैं) में बदलने की क्रिया है। लेखक तर्क देते हैं कि जबकि हमारे पास दस्तावेजों को स्कैन करने और टेक्स्ट पढ़ने के लिए बेहतरीन उपकरण (OCR) हैं, लेकिन हमारे पास उन स्कैन किए गए सूत्रों को ऐसे कोड में बदलने के लिए "सिमेंटिक गहराई" (semantic depth) की कमी है जिसे कंप्यूटर वास्तव में चला सके।
इसे हल करने के लिए, लेखकों ने MioFFAn को MioGatto नामक एक पुराने टूल के ऊपर बनाया है। उन्होंने महसूस किया कि पुराना टूल एकल गणितीय प्रतीकों (जैसे कि अक्षर ) को पहचानने में तो अच्छा था, लेकिन जटिल प्रतीकों के समूहों (जैसे कि पूरा फलन या टेंसर ) को संभालने में बहुत खराब था और इसमें वास्तविक दुनिया के विज्ञान के लिए आवश्यक लचीले, पदानुक्रमित (hierarchical) एनोटेशन की कमी थी। MioFFAn कई प्रमुख अपग्रेड पेश करके इसे ठीक करता है:
- समूहीकरण और पदानुक्रम (Grouping and Hierarchy): केवल एकल अक्षरों को टैग करने के बजाय, MioFFAn उपयोगकर्ताओं को एक सूत्र के पूरे हिस्सों को एक एकल इकाई के रूप में चुनने की अनुमति देता है। यह एक जटिल अभिव्यक्ति को एक "समूह" के रूप में मानता है जिसे यदि आवश्यक हो तो इसके भागों में तोड़ा जा सकता है।
- अनुकूलन योग्य नियम (Customizable Rules): यह सॉफ्टवेयर एक गिरगिट की तरह है। यह उपयोगकर्ताओं को विभिन्न वैज्ञानिक क्षेत्रों के लिए अपने स्वयं के "टैक्सोनॉमी" (नियम और श्रेणियाँ) परिभाषित करने की अनुमति देता है। उदाहरण के लिए, एक भौतिक विज्ञानी को एक चर को "वेक्टर" के रूप में टैग करने की आवश्यकता हो सकती है, जबकि एक जीवविज्ञानी को इसे "सांद्रता" (concentration) के रूप में टैग करने की आवश्यकता हो सकती है। यह टूल उनकी जरूरतों के अनुसार ढल जाता है।
- संदर्भिक आधार (Contextual Grounding): यह गणितीय प्रतीकों को दस्तावेज़ के उस टेक्स्ट से जोड़ने में मदद करता है जहाँ उन्हें समझाया गया है। यदि कोई पेपर कहता है "माना कि वेग है," तो टूल आपको उस वाक्य को हाइलाइट करने और सूत्र में प्रतीक से जोड़ने में मदद करता है।
- "ह्यूमन-इन-द-लूप" ऑटोमेशन: यह सबसे रोमांचक हिस्सा है। सॉफ्टवेयर में एक फीचर शामिल है जहाँ एक AI (विशेष रूप से, एक लार्ज लैंग्वेज मॉडल, या LLM) पहले एनोटेशन करने की कोशिश करता है। यह सुझाव देता है कि सूत्र के कौन से हिस्से क्या हैं, वेरिएबल्स का क्या अर्थ है, और वे दस्तावेज़ में कहाँ परिभाषित हैं। हालाँकि, मानव उपयोगकर्ता को हटाया नहीं गया है; वे एक पर्यवेक्षक के रूप में कार्य करते हैं। वे AI के सुझावों की समीक्षा करते हैं, त्रुटियों को ठीक करते हैं, और अंतिम परिणाम की पुष्टि करते हैं।
लेखकों ने इस प्रणाली का परीक्षण फाइनाइट एलीमेंट मेथड्स (FEM) नामक एक विशिष्ट वैज्ञानिक क्षेत्र का उपयोग करके किया, जिसका उपयोग यह सिम्युलेट करने के लिए किया जाता है कि कार कैसे टकराती है या एक पुल कैसे झुकता है। उन्होंने सॉफ्टवेयर को FEM के विशिष्ट गणितीय नियमों को समझने के लिए सेट किया और फिर एक "प्रूफ-ऑफ-कॉन्सेप्ट" प्रयोग चलाया। उन्होंने सॉफ्टवेयर में कुछ वैज्ञानिक पेपर डाले और AI को उन्हें एनोटेट करने दिया, फिर AI के काम की तुलना मानव विशेषज्ञों द्वारा बनाए गए "गोल्ड स्टैंडर्ड" से की।
परिणाम आशा और वास्तविकता का मिश्रण थे। AI कुछ चीजों में आश्चर्यजनक रूप से अच्छा था लेकिन अन्य चीजों में संघर्ष करता था। उदाहरण के लिए, जब AI को मूल गणितीय प्रतीकों (जैसे कि ग्रीक अक्षर ) को देखने की अनुमति दी गई, तो इसने सूत्र के हिस्सों की पहचान करने में (लगभग 57.7% कवरेज) बेहतर प्रदर्शन किया, तुलना में जब प्रतीकों को लंबे टेक्स्ट नामों से बदल दिया गया था (जो गिरकर 36.2% रह गया)। हालाँकि, AI अभी भी पूर्ण नहीं था; यह अक्सर दस्तावेज़ में टेक्स्ट परिभाषाओं के सटीक स्थान को पहचानने में संघर्ष करता था, कभी-कभी केवल विशिष्ट वाक्य के बजाय पूरे पैराग्राफ को हाइलाइट कर देता था।
पेपर स्पष्ट रूप से इस विचार को खारिज करता है कि AI वर्तमान में अकेले इस काम को पूरी तरह से कर सकता है। लेखक कहते हैं कि स्वचालित परिणाम "आदर्श होने से बहुत दूर" हैं और उन्हें केवल एक "बेसलाइन" के रूप में उपयोग किया जाना चाहिए जिसे एक मानव विशेषज्ञ तेजी से परिष्कृत करता है। उनका तर्क है कि बिना मानवीय जाँच के पूरी तरह से स्वचालित, एंड-टू-एंड अनुवाद के लिए AI का उपयोग करने से ऐसी त्रुटियां हो सकती हैं जिन्हें पकड़ना कठिन होता है।
अपने मूल्यांकन में, लेखकों ने पाया कि "ओरिजिनल कैरेक्टर्स" वाला दृष्टिकोण (गणितीय प्रतीकों को उनके मूल रूप में रखना) AI के लिए गणित की संरचना को समझने के लिए सबसे अच्छा काम करता है। उन्होंने तीन अलग-अलग AI मॉडलों (NVIDIA का Nemotron, Google का Gemma, और Alibaba का Qwen) की तुलना की और पाया कि Qwen3-4B-Instruct-2507 मॉडल अन्य की तुलना में काफी बेहतर प्रदर्शन करता है, जिसने प्रतीक पहचान में लगभग 33.9% के अगले सर्वश्रेष्ठ मॉडल की तुलना में 57.7% का कवरेज दर हासिल किया।
अंततः, पेपर सुझाव देता है कि MioFFAn बेहतर स्वचालन रणनीतियों को विकसित करने के लिए एक शक्तिशाली "प्लेग्राउंड" है। यह दावा नहीं करता है कि इसने गणित को कोड में अनुवाद करने की समस्या को हमेशा के लिए हल कर दिया है। इसके बजाय, यह एक लचीला ढांचा प्रदान करता है जहाँ शोधकर्ता विभिन्न AI रणनीतियों का परीक्षण कर सकते हैं, देख सकते हैं कि क्या काम करता है, और धीरे-धीरे सिस्टम में सुधार कर सकते हैं। लेखक निष्कर्ष निकालते हैं कि हालांकि वर्तमान स्वचालन केवल एक "अनंतिम" (provisional) कदम है, लेकिन यह मानव-और-AI की टीम-अप भविष्य के स्मार्ट सिस्टम को प्रशिक्षित करने के लिए आवश्यक उच्च-गुणवत्ता वाले डेटासेट बनाने का सबसे प्रभावी तरीका है। वे एक ऐसे भविष्य की कल्पना करते हैं जहाँ यह टूल गणित-से-कोड अनुवादों का एक विशाल, साझा पुस्तकालय बनाने में मदद करेगा, जिससे कंप्यूटर के लिए वैज्ञानिकों को दुनिया की सबसे जटिल समस्याओं को हल करने में मदद करना आसान हो जाएगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।