← नवीनतम पेपर
🤖 machine learning

From Handwriting to Structured Data: Benchmarking AI Digitisation of Handwritten Forms

यह शोध पत्र एक चुनौतीपूर्ण वास्तविक दुनिया के चिकित्सा फॉर्म डिजिटलीकरण कार्य पर 17 अग्रणी मल्टी-मोडल लार्ज लैंग्वेज मॉडल्स का बेंचमार्किंग करता है, जो यह प्रदर्शित करता है कि गूगल और ओपनएआई के नवीनतम मॉडल्स उच्च सटीकता (लगभग 85%) और कम मतिभ्रम (hallucination) दर प्राप्त करते हैं, जिसमें प्रॉम्प्ट ऑप्टिमाइज़ेशन मैक्रो मेट्रिक्स को महत्वपूर्ण रूप से बढ़ाता है, जिससे जटिल हस्तलिखित वर्कफ़्लो के पूर्णतः स्वचालित डिजिटलीकरण की क्षमता प्रमाणित होती है।

मूल लेखक: Nicholas Pather, Joshua Fouché, Sitwala Mundia, Karl-Günter Technau, Thokozile Malaba, Alex Welte, Ushma Mehta, Bruce A. Bassett

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nicholas Pather, Joshua Fouché, Sitwala Mundia, Karl-Günter Technau, Thokozile Malaba, Alex Welte, Ushma Mehta, Bruce A. Bassett

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास लाखों हस्तलिखित मेडिकल रिकॉर्ड्स से भरी एक विशाल, धूल भरी लाइब्रेरी है, जो गर्भवती महिलाओं के बारे में हैं। ये नोट्स स्वास्थ्य प्रवृत्तियों को समझने के लिए अत्यंत महत्वपूर्ण हैं, लेकिन वे कागज पर फंसे हुए हैं। आधुनिक शोध के लिए इनका उपयोग करने हेतु, किसी को इन्हें कंप्यूटर में टाइप करना होगा। पारंपरिक रूप से, यह काम थके हुए टाइपिस्टों की एक सेना को बुलाने जैसा है जो बिखरी हुई लिखावट को पढ़ने की कोशिश करते हैं—एक ऐसी प्रक्रिया जो धीमी, महंगी और मानवीय त्रुटियों से भरी होती है।

यह पेपर एक दौड़ है यह देखने के लिए कि क्या आर्टिफिशियल इंटेलिजेंस (AI) अंततः इन टाइपिस्टों का काम कर सकता है।

लेखकों ने 17 अलग-अलग "सुपर-ब्रेन" (AI मॉडल) का परीक्षण किया यह देखने के लिए कि कौन सा मॉडल इन बिखरे हुए, हस्तलिखित मेडिकल फॉर्म्स को पढ़ सके और उन्हें साफ, डिजिटल डेटा में बदल सके। इन AI मॉडल्स को एक कठिन परीक्षा देने वाले विभिन्न प्रकार के छात्रों के रूप में सोचें।

परीक्षा: एक बिखरा हुआ मेडिकल फॉर्म

यह "परीक्षा" कोई साफ-सुथरा, टाइप किया हुआ टेस्ट नहीं था। यह एक वास्तविक मैटरनिटी केस रिकॉर्ड (Maternity Case Record) था।

  • चुनौती: कल्पना कीजिए एक ऐसे फॉर्म की जहाँ डॉक्टर ने जल्दबाजी में लिखा हो। कुछ तारीखें तिरछी लिखी हैं, कुछ चेकबॉक्स अजीब प्रतीकों के साथ मार्क किए गए हैं, और कुछ नोट्स हाशिए (margins) में या बहुत छोटी जगहों में ठूंसे हुए हैं।
  • जाल: AI को न केवल अक्षरों को पढ़ना था, बल्कि संदर्भ (context) को भी समझना था। उदाहरण के लिए, यदि डॉक्टर ने "NAD" लिखा था, तो AI को पता होना चाहिए कि इसका मतलब "No Abnormalities Detected" (कोई असामान्यता नहीं पाई गई) है, न कि केवल कुछ रैंडम अक्षर। यदि कोई तारीख लंबवत (vertically) लिखी गई थी, तो AI को यह समझना था कि वह एक तारीख है, न कि संख्याओं की कोई सूची।

प्रतियोगी

शोधकर्ताओं ने दो समूहों को एक-दूसरे के खिलाफ खड़ा किया:

  1. "फ्रंटियर" दिग्गज (The "Frontier" Giants): ये बड़ी टेक कंपनियों (जैसे Google, OpenAI और Anthropic) के नवीनतम, सबसे शक्तिशाली और महंगे AI मॉडल हैं। इन्हें ओलंपिक-स्तर के एथलीट के रूप में सोचें जिनके सिर में सुपरकंप्यूटर लगे हैं।
  2. "ओपन सोर्स" अंडरडॉग्स (The "Open Source" Underdogs): ये छोटे, मुफ्त उपयोग के लिए उपलब्ध मॉडल हैं जिन्हें कम्युनिटी द्वारा बनाया गया है। इन्हें प्रतिभाशाली स्थानीय धावकों के रूप में सोचें जो प्रोफेशनल्स के साथ प्रतिस्पर्धा करने की कोशिश कर रहे हैं।

परिणाम: कौन जीता?

1. छोटे धावक लड़खड़ा गए
छोटे, पुराने AI मॉडल (ओपन-सोर्स वाले) बुरी तरह संघर्ष करते दिखे। वे ऐसे छात्रों की तरह थे जो लिखावट ही नहीं पढ़ पा रहे थे। वे बिखरे हुए लेआउट से भ्रमित हो गए और अक्सर या तो हार मान लेते थे या अपनी तरफ से कुछ भी बना देते थे। उनका स्कोर बहुत कम रहा, जिससे यह साबित हुआ कि इस विशिष्ट, बिखरे हुए कार्य के लिए, "जितना बड़ा मॉडल, उतना ही बेहतर।"

2. ओलंपिक एथलीट्स सफल रहे (मुख्यतः)
Google और OpenAI के नवीनतम, बड़े मॉडल आश्चर्यजनक रूप से अच्छा प्रदर्शन करते रहे।

  • ओवरऑल चैंपियन: Gemini 3.1 Pro (Google) ने स्वर्ण पदक जीता। यह सबसे सुसंगत था, इसने सबसे अधिक फील्ड्स को सही ढंग से पढ़ा और फ्री-टेक्स्ट नोट्स में सबसे कम गलतियाँ कीं।
  • प्रिसिजन स्पेशलिस्ट (सटीकता विशेषज्ञ): GPT-5.4 (OpenAI) सबसे विश्वसनीय था। इसने शायद ही कभी "हैलुसिनेशन" (Hallucination - तथ्य गढ़ना) किया। यदि इसे उत्तर नहीं पता था, तो इसकी संभावना कम थी कि यह कुछ मनगढ़ंत बना ले। यह तारीखों को पढ़ने में भी माहिर था, भले ही वे कितनी भी बिखरी हुई क्यों न लिखी गई हों।
  • फॉर्मेटिंग एक्सपर्ट: Claude Sonnet 4.6 नंबरों और स्ट्रक्चर्ड फील्ड्स (जैसे ब्लड प्रेशर रीडिंग या विशिष्ट तारीखों) को संभालने में सबसे अच्छा था।

स्कोर: सर्वश्रेष्ठ मॉडल्स ने लगभग 85% सटीकता प्राप्त की। इसका मतलब है कि उन्होंने 100 में से 85 फील्ड्स सही पढ़े। हालांकि यह पूर्ण नहीं है, लेकिन यह पिछली तकनीक से एक बड़ी छलांग है।

गुप्त हथियार: "प्रॉम्प्ट" (The "Prompt")

शोधकर्ताओं ने पाया कि आप AI से कैसे पूछते हैं, यह इस बात जितना ही मायने रखता है कि आप कौन सा AI उपयोग कर रहे हैं।

  • "अस्पष्ट" प्रॉम्प्ट: यदि आप सिर्फ कहते हैं, "इस फॉर्म को पढ़ो," तो AI भ्रमित हो जाता है।
  • "ऑप्टिमाइज्ड" प्रॉम्प्ट: यदि आप AI को एक सख्त नियम पुस्तिका देते हैं (जैसे, "यदि आप '1' देखें, तो 'User' लिखें; यदि आप '2' देखें, तो 'Former User' लिखें"), तो AI का प्रदर्शन 60% से अधिक बढ़ जाता है।
  • उपमा: यह एक छात्र को अस्पष्ट निर्देश देने ("निबंध लिखो") बनाम एक विस्तृत रूपरेखा और विशिष्ट नियमों के साथ निर्देश देने ("5 पैराग्राफ लिखें, इन 3 शब्दों का उपयोग करें, और कॉमा का प्रयोग न करें") जैसा है। विस्तृत निर्देशों ने AI को बहुत अधिक स्मार्ट बना दिया।

यह क्यों मायने रखता है

यह केवल तेजी से टाइप करने के बारे में नहीं है। दुनिया के कई हिस्सों में (जैसे दक्षिण अफ्रीका, जहाँ यह अध्ययन हुआ), अस्पताल कागजी रिकॉर्ड्स के बोझ तले दबे हुए हैं।

  • समस्या: HIV, तपेदिक (Tuberculosis) और जन्म के परिणामों से संबंधित महत्वपूर्ण डेटा ऐसी लिखावट में कैद है जिसे पढ़ने का किसी के पास समय नहीं है।
  • समाधान: यदि AI इस काम को 85% तक ऑटोमेट कर सकता है, तो डॉक्टर और शोधकर्ता अंततः इस डेटा तक तुरंत पहुँच सकते हैं। वे बीमारियों के प्रकोप को तेजी से पहचान सकते हैं, यह समझ सकते हैं कि कौन सी दवाएं सबसे अच्छा काम करती हैं, और जीवन बचा सकते हैं।

निष्कर्ष (The Bottom Line)

हम एक निर्णायक मोड़ पर पहुँच गए हैं। AI के "सुपर-ब्रेन" अब बिखरे हुए, हस्तलिखित मेडिकल नोट्स को उच्च सटीकता के साथ पढ़ने के लिए पर्याप्त अच्छे हैं। हालांकि वे अभी भी पूर्ण नहीं हैं (वे अभी भी बहुत अधिक बिखरी हुई लिखावट के साथ गलतियाँ करते हैं), वे दुनिया के सबसे मूल्यवान मेडिकल आर्काइव्स को अनलॉक करने के लिए पर्याप्त शक्तिशाली हैं, जिससे धूल भरे कागज जीवन बचाने वाले डिजिटल ज्ञान में बदल सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →