← नवीनतम पेपर
💻 computer science

AI-Driven Spline-Based Segmentation of Handwritten Physico-Mathematical Documents

यह शोध पत्र हस्तलिखित भौतिक-गणितीय दस्तावेजों के लिए एक एआई-संचालित विभाजन पाइपलाइन प्रस्तुत करता है जो दोलनशील बेसलाइनों (oscillatory baselines) को मॉडल करने और वक्रता-अनुकूलित कटिंग मास्क (curvature-adaptive cutting masks) उत्पन्न करने के लिए आकार-संरक्षण वाले द्विघात स्प्लाइन्स (shape-preserving quadratic splines) का उपयोग करता है, जिससे डाउनस्ट्रीम ओसीआर (OCR) कार्यों के लिए पहचान सटीकता और संरचनात्मक पुनर्निर्माण में वृद्धि होती है।

मूल लेखक: Vasyl Zalizko

प्रकाशित 2026-07-23
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vasyl Zalizko

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बिखरी हुई, हाथ से लिखी नोटबुक पढ़ना सिखाने की कोशिश कर रहे हैं। आपको लग सकता है कि सबसे कठिन काम रोबोट को टेढ़े-मेढ़े अक्षरों या अजीब प्रतीकों को पहचानना सिखाना होगा। लेकिन विज्ञान और गणित की दुनिया में, असली समस्याक्षर स्वयं नहीं हैं; बल्कि वे रेखाएं हैं जिन पर वे लिखे गए हैं। जब कोई छात्र भौतिकी (physics) का सूत्र लिखता है, तो वह पाठ्यपुस्तक की तरह एकदम सीधी, मुद्रित रेखा पर नहीं लिखता। वह एक लहरदार, उछलती हुई, कभी-कभी सर्पिल पथ पर लिखता है जो ऊपर-नीचे, दाएं-बाएं जाता है, या आरेखों (diagrams) के चारों ओर मुड़ जाता है या भिन्नों (fractions) को एक के ऊपर एक रखता है। यदि आप इस बिखरे हुए पन्ने को कंप्यूटर को खिलाने के लिए साफ, आयताकार बक्सों में काटने की कोशिश करते हैं, तो आप अक्षरों के ऊपरी हिस्से को काट देते हैं, महत्वपूर्ण प्रतीकों के बीच से काट देते हैं, या दो अलग-अलग सूत्रों को आपस में जोड़ देते हैं। यह एक घुमावदार नदी को चौकोर बाल्टी में फिट करने की कोशिश करने जैसा है; पानी हर जगह छलक जाता है, और उसका आकार खो जाता है। यह विज्ञान के लिए "ऑप्टिकल कैरेक्टर रिकग्निशन" (OCR) की मूल समस्या है: कंप्यूटर को पन्ने को उसी तरह देखने के लिए मजबूर करना जैसे एक इंसान देखता है, यानी उसकी प्राकृतिक वक्रता (curves) का सम्मान करना, न कि उसे एक कठोर ग्रिड में जबरदस्ती फिट करना।

यह शोध पत्र इस अव्यवस्था को संभालने के एक चतुर नए तरीके का परिचय देता है, जिसे 'स्प्लाइन-बेस्ड लेआउट नॉर्मलाइजेशन' (SBLN) कहा जाता है। पन्ने को सीधे चाकू से काटने के बजाय, शोधकर्ता एक लचीले, आकार-संरक्षण करने वाले "स्प्लाइन" का उपयोग करते हैं—इसे एक चिकने, मुड़ने योग्य रूलर (पटरी) के रूप में सोचें जो लिखावट के सटीक वक्र का अनुसरण करता है। वे "कोकोनवेक्स क्वाड्रेटिक स्प्लाइन" (coconvex quadratic splines) नामक एक विशिष्ट प्रकार के गणित का उपयोग करते हैं ताकि बिना किसी नकली उभार या लहर के लेखन के लहरदार आधार (baseline) का पता लगाया जा सके। एक बार जब उनके पास यह सटीक वक्र आ जाता है, तो वे उस वक्र के साथ पन्ने को काटते हैं, जिससे लहरदार रेखाएं सीधी, आसानी से पढ़ी जाने वाली पट्टियों में बदल जाती हैं। फिर वे इन पट्टियों का उपयोग कंप्यूटर विजन मॉडल (एक YOLO डिटेक्टर) को सूत्र और आरेख पहचानने के लिए प्रशिक्षित करने के लिए करते हैं। परिणाम प्रभावशाली हैं: इस वक्र-अनुसरण करने वाली विधि का उपयोग करके, सिस्टम गणित और भौतिकी की सामग्री को खोजने में बहुत बेहतर हो गया, जिससे कुछ प्रकार की त्रुटियों के लिए इसकी 'रिकॉल' (पहचानने की क्षमता) में पुराने, सीधे-कट वाले तरीके की तुलना में 99% तक सुधार हुआ। यह सुझाव देता है कि हमारे लेखन की प्राकृतिक ज्यामिति का सम्मान करके, हम रोबोटों को हमारे नोट्स पढ़ने में बहुत अधिक स्मार्ट बना सकते हैं।

समस्या: गणित के नोट्स का "गोल छेद में चौकोर खूंटी" वाला मामला

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन सुराग एक कागज के टुकड़े पर लिखे गए हैं जिसे कुचला, मोड़ा और फिर से सीधा किया गया है। लेखन केवल बिखरा हुआ ही नहीं है; वह नाच रहा है। हस्तलिखित भौतिकी और गणित की परीक्षाओं में, छात्र सीधी रेखाओं में नहीं लिखते। वे ऐसी आधार रेखाओं पर लिखते हैं जो ऊपर-नीचे होती हैं, मुड़ती हैं और घूमती हैं। कभी-कभी एक सूत्र इतना जटिल होता है कि उसे अपने ऊपर ही ढेर करना पड़ता है, या एक आरेख लेखन को उसके चारों ओर मुड़ने के लिए मजबूर कर देता है।

लंबे समय से, इन दस्तावेजों को पढ़ने की कोशिश करने वाले कंप्यूटर (जिसे OCR कहा जाता है) एक बहुत ही भद्दे उपकरण का उपयोग कर रहे हैं: आयताकार बॉक्स। वे मान लेते हैं कि टेक्स्ट सीधी पंक्तियों में बैठता है, जैसे परेड में सैनिक। वे पन्ने को क्षैजंत पट्टियों में काटने और फिर उन पट्टियों को बक्सों में काटने की कोशिश करते हैं। लेकिन जब आप एक घुमावदार नदी को चौकोर बॉक्स में फिट करने की कोशिश करते हैं, तो आप किनारों को खो देते हैं। आप "y" के ऊपरी हिस्से या "g" के निचले हिस्से को काट देते हैं, या आप गलती से भिन्न (fraction) की रेखा को बीच से काट देते हैं। विज्ञान की दुनिया में, जहाँ एक छोटा सा प्रतीक जैसे वेक्टर एरो या सबस्क्रिप्ट पूरे समीकरण का अर्थ बदल सकता है, ये गलतियाँ विनाशकारी होती हैं। कंप्यूटर एक टूटे हुए मलबे को देखता है और हार मान लेता है।

समाधान: लचीला रूलर

इस शोध पत्र के शोधकर्ताओं ने, जिनका नेतृत्व वासिल ज़ालिज़को (Vasal Zalizko) कर रहे थे, वक्र से लड़ना बंद करने और उसके साथ चलने का निर्णय लिया। उन्होंने स्प्लाइन-बेस्ड लेआउट नॉर्मलाइजेशन (SBLN) नामक एक विधि पेश की।

एक "स्प्लाइन" को एक लचीले रूलर के रूप में सोचें जिसका उपयोग एक ड्राफ्ट्समैन चिकने वक्र खींचने के लिए कर सकता है। इस मामले में, कंप्यूटर उस रूलर के एक विशेष गणितीय संस्करण का उपयोग करता है—एक शेप-प्रिजर्विंग कोकोनवेक्स क्वाड्रेटिक स्प्लाइन। यह केवल कोई भी वक्र नहीं है; यह एक स्मार्ट वक्र है जो बिना भ्रमित हुए लिखावट का पीछा करना जानता है। यह उन बिंदुओं को देखता है जहाँ लेखन शुरू और समाप्त होता है और एक ऐसी रेखा खींचता है जो पाठ के प्राकृतिक आकार को गले लगाती है, यह संरक्षित करते हुए कि रेखा ऊपर की ओर मुड़ रही है (कनवेक्स) या नीचे की ओर (कॉन्केव)। महत्वपूर्ण रूप से, यह उन "लहरों" या नकली उभारों से बचता है जो अक्सर तब होते हैं जब कंप्यूटर सरल गणित के साथ रेखा का अनुमान लगाने की कोशिश करता है।

एक बार जब कंप्यूटर इस पूर्ण, लहरदार रेखा को लेखन के साथ खींच लेता है, तो वह कुछ जादुई करता है: वह उस रेखा के साथ पन्ने को काटता है। सीधी, क्षैजंत पट्टियों के बजाय, यह पन्ने को घुमावदार पट्टियों में काटता है जो लेखक के हाथ का अनुसरण करती हैं। फिर, यह इन पट्टियों को कंप्यूटर के पढ़ने के लिए "सीधा" करता है। यह एक मुड़ी हुई टेप को दीवार से उतारकर मेज पर सीधा बिछाने जैसा है। अचानक, लहरदार टेक्स्ट बिल्कुल सीधा और पढ़ने में आसान दिखने लगता है।

प्रयोग: घुमावदार पाठों के साथ रोबोट को सिखाना

यह जांचने के लिए कि क्या यह विचार काम करता है, टीम ने एक निष्पक्ष मुकाबला तैयार किया। उन्होंने YOLOv8-s (एक प्रकार का कंप्यूटर विजन मॉडल जो छवियों में वस्तुओं को ढूंढता है) नामक एक शक्तिशाली AI डिटेक्टर का उपयोग किया। उन्होंने इस डिटेक्टर को दो तरीकों से प्रशिक्षित किया:

  1. पुराना तरीका: मानक, सीधी आयताकार कट और सामान्य डेटा ट्रिक्स का उपयोग करके।
  2. नया तरीका (SBLN): घुमावदार, स्प्लाइन-निर्देशित कट और "स्प्लाइन-गाइडेड ज्योमेट्रिक ऑग्मेंटेशन" नामक एक विशेष ट्रिक का उपयोग करके।

"ऑग्मेंटेशन" वाला हिस्सा एक रचनात्मक शिक्षक की तरह है। केवल 1,300 हस्तलिखित परीक्षा पृष्ठों को दिखाने के बजाय, सिस्टम ने उन पृष्ठों को लिया, उन्हें घुमावदार पट्टियों में काटा, और फिर 3.4 मिलियन नए, थोड़े अलग संस्करण बनाए। इसने उन पट्टियों को लिखावट के वक्र के साथ धीरे से मोड़कर और घुमाकर ऐसा किया, जिससे बिना किसी मानव द्वारा नए पृष्ठ लिखे जाने के हजारों नए उदाहरण बन गए। इसने कंप्यूटर को गणित के सूत्रों को पहचानने के लिए प्रशिक्षित किया, भले ही वे अजीब कोणों या ऊबड़-खाबड़ रेखाओं पर लिखे गए हों।

परिणाम: गणित पढ़ने के लिए एक बड़ी छलांग

परिणाम स्पष्ट और मजबूत थे। जब कंप्यूटर ने नए स्प्लाइन-आधारित तरीके का उपयोग किया, तो वह एक बहुत बेहतर जासूस बन गया:

  • खोए हुए हिस्सों को ढूंढना: सबसे बड़ा सुधार उन चीजों को खोजने में हुआ जो पहले छूट गई थीं। हस्तलिखित गणितीय पाठ (HW) के लिए, हर एक हिस्से को खोजने की सिस्टम की क्षमता (रिकॉल) 0.552 से बढ़कर 0.886 हो गई। यह 60.5% का सुधार है। गंदे या मिटाए गए लेखन (HWerror) के लिए, इसमें 99.3% का भारी सुधार हुआ, जो केवल 0.403 वस्तुओं को खोजने से बढ़कर 0.803 हो गया।
  • कुल सटीकता: सिस्टम ने 0.925 की उच्च परिशुद्धता (precision) और 0.859 का रिकॉल प्राप्त किया। वस्तुओं को सही ढंग से खोजने के लिए इसका समग्र स्कोर (mAP@0.5) 0.915 था, जो इस तरह के कठिन कार्य के लिए एक बहुत ऊंचा स्तर है।
  • कम गलतियाँ: पुराना तरीका अक्सर "हैलुसिनेशन" (भ्रम) पैदा करता था—ऐसे बॉक्स बनाना जो पन्ने के आर-पार जाते थे या असंबंधित टेक्स्ट को काटते थे। नया तरीका, प्राकृतिक वक्र का पालन करके, इन अजीब गलतियों को रोक देता है। बॉक्स अब वास्तविक लिखावट को गले लगाते हैं, जिससे सूत्र सुरक्षित रहते हैं।

शोध पत्र सुझाव देता है कि यह दृष्टिकोण इसलिए काम करता है क्योंकि यह लहरदार रेखाओं के कारण होने वाले "शोर" (noise) को कम करता है। कंप्यूटर द्वारा अक्षरों को पहचानने की कोशिश करने से पहले ज्यामिति को सीधा करके, गणित की समस्या बहुत आसान हो जाती है। कंप्यूटर को यह अनुमान लगाने की आवश्यकता नहीं है कि रेखा मुड़ी हुई है या सीधी; वह बस एक सीधी रेखा देखता है।

भविष्य के लिए इसका क्या अर्थ है

यह शोध दावा नहीं करता है कि इसने गणित पढ़ने की समस्या को हमेशा के लिए हल कर दिया है, लेकिन यह एक शक्तिशाली नया दिशा दिखाता है। यह दर्शाता है कि हस्तलिखित विज्ञान को पढ़ने में सबसे बड़ी बाधा AI की अक्षरों को पहचानने की क्षमता नहीं है, बल्कि पन्ने को सही ढंग से देखने की उसकी क्षमता है। इन लचीले, आकार-संरक्षण करने वाले स्प्लाइन्स का उपयोग करके, हम एक अराजक, लहरदार पन्ने को एक साफ, पठनीय पन्ने में बदल सकते हैं।

लेखक नोट करते हैं कि हालांकि सिस्टम अब टुकड़ों को खोजने में बहुत अच्छा है, लेकिन इसे अभी भी गणित के अर्थ (जैसे कि एक सही सूत्र और छात्र की एक समान दिखने वाली गलती के बीच अंतर करने) को समझने में मदद की आवश्यकता है। लेकिन पन्ने को सही टुकड़ों में काटने के काम के लिए, यह "घुमावदार रूलर" विधि गेम-चेंजर है। यह सुझाव देता है कि भविष्य में, रोबोटों को हमारे वैज्ञानिक नोट्स पढ़ने के लिए सिखाने हेतु, हमें नोट्स को रोबोट के ग्रिड में फिट करने के लिए मजबूर नहीं करना चाहिए; हमें रोबोट को हमारे लेखन के वक्रों का अनुसरण करना सीखना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →