← नवीनतम पेपर
💬 NLP

BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension

यह शोधपत्र BaFCo को प्रस्तुत करता है, जो कि 200 जटिल बांग्ला सरकारी फॉर्मों का एक सूक्ष्म-एनोटेटेड (fine-grained annotated) बेंचमार्क डेटासेट है, जिसका उद्देश्य बांग्ला दस्तावेज़ लेआउट विश्लेषण और मुख्य सूचना निष्कर्षण में मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की वर्तमान सीमाओं का मूल्यांकन करना और उन्हें उजागर करना है।

मूल लेखक: Abu Tyeb Azad, Ishita Sur Apan, Fahim Ahmed, Sumaiya Karim Katha, Ezharuddin Jubaer, Armun Alam, Pranjal Kumar Nandi, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

प्रकाशित 2026-07-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abu Tyeb Azad, Ishita Sur Apan, Fahim Ahmed, Sumaiya Karim Katha, Ezharuddin Jubaer, Armun Alam, Pranjal Kumar Nandi, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास बांग्लादेश के सरकारी फॉर्मों का एक विशाल पुस्तकालय है। ये केवल साधारण रसीदें नहीं हैं; ये जटिल, कई पृष्ठों वाले दस्तावेज़ हैं जो हस्तलिखित नोट्स, आधिकारिक मुहरों, चेकबॉक्स और घनी तालिकाओं से भरे हुए हैं। एक इंसान के लिए, इन्हें पढ़ना एक चुनौती है। एक कंप्यूटर के लिए, यह आँखों पर पट्टी बाँधकर पहेली सुलझाने जैसा है।

यह शोध पत्र BaFCo पेश करता है, जो एक नया "ट्रेनिंग जिम" है जिसे आर्टिफिशियल इंटेलिजेंस (AI) को इन विशिष्ट बांग्ला फॉर्मों को पढ़ना सिखाने के लिए डिज़ाइन किया गया है।

यहाँ सरल उपमाओं (analogies) का उपयोग करके शोध पत्र का विवरण दिया गया है:

1. समस्या: "भाषा का अंतर" (The Language Gap)

AI मॉडल (जैसे ChatGPT या Gemini के पीछे के स्मार्ट दिमाग) को उन छात्रों के रूप में सोचें जिन्होंने अंग्रेजी, फ्रेंच और स्पेनिश में कड़ी मेहनत से पढ़ाई की है। वे इन भाषाओं में दस्तावेज़ पढ़ने में विशेषज्ञ हैं। हालाँकि, बांग्ला एक ऐसी भाषा है जिसे वे मुश्किल से जानते हैं। भले ही 284 मिलियन लोग इसे बोलते हैं, लेकिन AI के सीखने के लिए बहुत कम "पाठ्यपुस्तकें" (datasets) उपलब्ध हैं।

इस कारण से, जब ये AI छात्र एक बांग्ला सरकारी फॉर्म को पढ़ने की कोशिश करते हैं, तो वे भ्रमित हो जाते हैं। वे शायद एक हस्ताक्षर मिस कर देते हैं, एक नंबर गलत पढ़ लेते हैं, या यह समझने में विफल रहते हैं कि कौन सा बॉक्स किस प्रश्न से संबंधित है।

2. समाधान: "BaFCo" प्रशिक्षण नियमावली (The Training Manual)

लेखकों ने इसे ठीक करने के लिए BaFCo बनाया है। इसे विशेष रूप से बांग्ला फॉर्मों के बारे में AI को सिखाने के लिए लिखी गई एक विशेष पाठ्यपुस्तक के रूप में समझें।

  • सामग्री: उन्होंने बैंकिंग, कृषि और भूमि प्रबंधन जैसे क्षेत्रों से 200 वास्तविक, जटिल सरकारी फॉर्म एकत्र किए।
  • विवरण: उन्होंने केवल पृष्ठों को स्कैन नहीं किया; उन्होंने हर एक हिस्से को बड़ी बारीकी से लेबल किया। कल्पना कीजिए कि एक शिक्षक हर एक शब्द, हस्ताक्षर और टेबल सेल के चारों ओर एक बॉक्स बना रहा है, और फिर उस बॉक्स के बारे में एक नोट लिख रहा है कि वह क्या है।
    • उन्होंने देखने के लिए 26 विशिष्ट प्रकार निर्धारित किए (जैसे "Header," "Signature," "Checkbox," या "Table Row")।
    • उन्होंने यह देखने के लिए एक 5-श्रेणी वाला "ईज़ी मोड" (जैसे सभी "टेक्स्ट" को एक साथ समूहबद्ध करना) भी बनाया कि क्या AI सरल निर्देशों के साथ बेहतर प्रदर्शन करता है।
  • गुणवत्ता: उन्होंने काम की सटीकता सुनिश्चित करने के लिए मानव विशेषज्ञों का उपयोग किया, जिससे यह सुनिश्चित हुआ कि "पाठ्यपुस्तक" सटीक है। उन्होंने फॉर्मों को कठिनाई के आधार पर ग्रेड भी दिया: Easy (साधारण सूचियाँ), Medium (कुछ तालिकाएँ), और Hard (मुहरों और लिखावट वाले अव्यवस्थित, बहु-पृष्ठीय दस्तावेज़)।

3. परीक्षण: "AI ओलंपिक्स" (The AI Olympics)

लेखकों ने दुनिया के शीर्ष AI मॉडल (Google, OpenAI, Anthropic और अन्य कंपनियों के "फ्लैगशिप" मॉडल) को BaFCo पाठ्यपुस्तक का उपयोग करके एक परीक्षण में डाला। उन्होंने AI से दो मुख्य प्रश्न पूछे:

  • कार्य A: डॉक्यूमेंट लेआउट एनालिसिस (DLA) - "यह कहाँ है?"

    • उपमा: कल्पना कीजिए कि AI एक भीड़ भरे कमरे को देख रहा है एक सुरक्षा गार्ड है। कार्य विशिष्ट लोगों की ओर लेजर पॉइंटर दिखाना है (जैसे, "लाल टोपी वाले व्यक्ति की ओर इशारा करें")।
    • परिणाम: AI संघर्ष कर रहा था। सबसे स्मार्ट मॉडल भी पृष्ठ पर किसी विशिष्ट बॉक्स या हस्ताक्षर को सटीक रूप से पहचानने में कठिनाई महसूस कर रहे थे। यह ऐसा है जैसे AI कमरे को देख तो सकता है लेकिन सही जगह पर इशारा करने की कोशिश में अपने ही पैरों में उलझ जाता है।
    • मुख्य निष्कर्ष: AI इस कार्य में बहुत बेहतर हो गया जब निर्देश सरल थे (26 श्रेणियों के बजाय 5 श्रेणियों वाला "ईज़ी मोड")।
  • कार्य B: की इन्फॉर्मेशन एक्सट्रैक्शन (KIE) - "यह क्या कहता है?"

    • उपमा: अब AI एक सचिव है। बॉस पूछता है, "ऊपरी दाएं कोने में लिखा नाम क्या है?" AI को बस शब्दों को पढ़ना है और उन्हें टाइप करना है।
    • परिणाम: AI इसमें काफी बेहतर था। वह शब्दों को पढ़ सकता था और उत्तरों को काफी सटीकता से निकाल सकता था।
    • मुख्य निष्कर्ष: दिलचस्प बात यह है कि AI का प्रदर्शन काफी हद तक भाषा पर निर्भर था। कुछ मॉडल बांग्ला फॉर्म पढ़ने में बहुत अच्छे थे लेकिन अंग्रेजी वाले में खराब थे, जबकि अन्य इसके विपरीत थे।

4. आश्चर्यजनक खोजें

शोध पत्र ने कुछ ऐसी चीजें पाईं जो विरोधाभासी लग सकती हैं:

  • ज्यादा सोचने से हमेशा मदद नहीं मिलती: शोधकर्ताओं ने AI से "कदम-दर-कदम सोचने" (Chain-of-Thought तकनीक) या "उच्च तर्क" (high reasoning) मोड का उपयोग करने के लिए कहा। आश्चर्यजनक रूप से, इससे AI पृष्ठ पर बॉक्स खोजने में हमेशा बेहतर नहीं हुआ। कभी-कभी, इसने उन्हें थोड़ा और खराब कर दिया। ऐसा लगता है कि बॉक्स कहाँ हैं, यह खोजने के लिए AI तर्क के माध्यम से "सोचने" के बजाय पैटर्न को "देखने" पर अधिक निर्भर करता है।
  • भाषा खोजने के लिए मायने नहीं रखती, पढ़ने के लिए रखती है: जब AI केवल एक बॉक्स को ढूँढने की कोशिश कर रहा था (DLA), तो इससे कोई फर्क नहीं पड़ता था कि फॉर्म बांग्ला में है या अंग्रेजी में। लेकिन जब AI को टेक्स्ट को पढ़ने और निकालने (KIE) की आवश्यकता थी, तो भाषा ने बहुत बड़ा अंतर पैदा किया।
  • "कोर्स" (Coarse) शॉर्टकट: AI का प्रदर्शन काफी बेहतर हो गया जब कार्य को सरल बनाया गया। यदि आप AI को कहते हैं "सारा टेक्स्ट ढूँढो," तो वह अच्छा काम करता है। यदि आप उसे कहते हैं "विशिष्ट 'Signature' फ़ील्ड बनाम 'Date' फ़ील्ड बनाम 'Name' फ़ील्ड ढूँढो," तो वह भ्रमित हो जाता है।

5. निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि हालांकि AI स्मार्ट हो रहा है, लेकिन उसे बांग्ला जैसी कम संसाधन वाली भाषाओं को समझने में, विशेष रूप से फॉर्म के सटीक लेआउट के मामले में, अभी भी लंबा रास्ता तय करना है।

BaFCo अब अन्य शोधकर्ताओं के उपयोग के लिए उपलब्ध है। यह ट्रेनिंग जिम के दरवाजे सभी के लिए खोलने जैसा है, इस उम्मीद में कि इन विशिष्ट बांग्ला फॉर्मों पर अभ्यास करके, AI अंततः उन्हें पढ़ने में एक मानव विशेषज्ञ जितना कुशल बन जाएगा।

डेटा कहाँ खोजें: लेखकों ने डेटासेट और कोड को Hugging Face पर सार्वजनिक कर दिया है, ताकि कोई भी इसे डाउनलोड कर सके और अपना खुद का AI प्रशिक्षित करने का प्रयास कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →