← नवीनतम पेपर
💬 NLP

ExStrucTiny: A Benchmark for Schema-Variable Structured Information Extraction from Document Images

यह शोध पत्र ExStrucTiny का परिचय देता है, जो एक नवीन बेंचमार्क डेटासेट है जो विविध एंटरप्राइज दस्तावेज़ प्रकारों और लचीले स्कीमा में विजन लैंग्वेज मॉडल्स की समग्र, सूक्ष्म-स्तरीय संरचित सूचना निष्कर्षण करने की क्षमता का मूल्यांकन और सुधार करने के लिए की-एंटिटी एक्सट्रैक्शन, रिलेशन एक्सट्रैक्शन और विजुअल क्वेश्चन अनस्वर्सिंग को एकीकृत करता है।

मूल लेखक: Mathieu Sibue, Andres Muñoz Garza, Samuel Mensah, Pranav Shetty, Zhiqiang Ma, Xiaomo Liu, Manuela Veloso

प्रकाशित 2026-02-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mathieu Sibue, Andres Muñoz Garza, Samuel Mensah, Pranav Shetty, Zhiqiang Ma, Xiaomo Liu, Manuela Veloso

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक केस सुलझाने की कोशिश कर रहे हैं, लेकिन अपराध स्थल के बजाय, आप कागजी कार्रवाई के ढेर को देख रहे हैं: बैंक स्टेटमेंट, बीमा फॉर्म, मेडिकल रिपोर्ट और स्लाइड डेक। आपका काम विशिष्ट सुरागों (जैसे "कुल राशि," "डॉक्टर का नाम," या "जन्म तिथि") को खोजना और उन्हें एक साफ, व्यवस्थित नोटबुक में लिखना है।

लंबे समय तक, कंप्यूटर इसमें खराब थे। वे शब्दों को पढ़ सकते थे, लेकिन वे संरचना या संदर्भ को नहीं समझ पाते थे। यदि आप किसी कंप्यूटर से पूछते, "किसने इस पर हस्ताक्षर किए?" तो वह केवल अनुमान लगा सकता था। यदि आप पूछते, "कुल लागत और टैक्स खोजें," तो वह इस बात को लेकर भ्रमित हो सकता था कि कौन सी संख्याएँ किस श्रेणी से संबंधित हैं।

यह पेपर EXSTRUCTINY पेश करता है, जो एक नया "प्रशिक्षण मैदान" (बेंचमार्क) है जिसे कंप्यूटरों को बेहतर जासूस बनने के लिए सिखाने के लिए डिज़ाइन किया गया है। यहाँ इसका सरल विवरण दिया गया है:

1. समस्या: "कठोर" बनाम "लचीला" जासूस

कल्पित कीजिए दो प्रकार के जासूस:

  • पुराना जासूस (मौजूदा मॉडल): यह जासूस तभी काम करता है जब आप उसे एक सख्त चेकलिस्ट दें। "बॉक्स 4 में 'इनवॉइस नंबर' खोजें।" यदि आप पूछते, "इस दस्तावेज़ का मामला क्या है?" या "कुल लागत खोजें भले ही उस पर 'टोटल' न लिखा हो," तो वे भ्रमित हो जाते हैं। वे विशिष्ट, दोहराव वाले कार्यों के लिए बेहतरीन हैं लेकिन नई स्थितियों में ढलने में बहुत खराब हैं।
  • नया जासूस (आधुनिक AI): ये स्मार्ट, सामान्य-उद्देश्य वाले AI मॉडल हैं। वे लगभग कुछ भी पढ़ सकते हैं। लेकिन, किसी को वास्तव में पता नहीं था कि क्या वे व्यावसायिक दस्तावेजों की अव्यवस्थित वास्तविकता को संभाल सकते हैं जहाँ आप एक साथ 10 अलग-अलग चीजें मांग सकते हैं, या ऐसी चीजें मांग सकते हैं जो वहां मौजूद ही नहीं हैं।

2. समाधान: EXSTRUCTINY (अंतिम प्रशिक्षण पाठ्यक्रम)

लेखकों ने EXSTRUCTINY बनाया, जो 110 विभिन्न दस्तावेजों (फॉर्म, रिपोर्ट, स्लाइड्स) का एक विशाल डेटासेट और AI को पूरा करने के लिए 304 विशिष्ट "मिशन" है।

EXSTRUCTINY को एक AI के लिए जिम के रूप में सोचें। यह केवल AI को हल्का वजन उठाने के लिए नहीं कहता; बल्कि यह उनसे कहता है कि वे:

  • "खाली स्थान भरें" मिशन: "यहाँ एक खाली फॉर्म है। इस इमेज से डेटा लेकर इसे भरें।" (इसे Closed IE with Schema कहा जाता है)।
  • "बस मुझे बता दो" मिशन: "इस दस्तावेज़ को पढ़ें और मुझे उन लोगों के बारे में सब कुछ बताएं जिन्होंने इस पर हस्ताक्षर किए हैं।" (इसे On-Demand IE कहा जाता है)।
  • "यह गायब है" मिशन: " 'आपातकालीन संपर्क' (Emergency Contact) खोजें।" (लेकिन दस्तावेज़ में कोई आपातकालीन संपर्क नहीं है!) AI को यह जानने की आवश्यकता है कि वह एक फर्जी नाम बनाने के बजाय यह कहे कि, "मैं इसे नहीं ढूंढ पा रहा हूँ।"

3. उन्होंने इसे कैसे बनाया: "मानव + रोबोट" असेंबली लाइन

इस डेटासेट को बनाना कठिन था। आप केवल एक रोबोट को सवाल बनाने के लिए नहीं कह सकते क्योंकि वह आलसी या दोहराव वाला हो सकता है।

  • चरण 1 (मानव वास्तुकार): मनुष्यों ने मैन्युअल रूप से कुछ उच्च-गुणवत्ता वाले उदाहरण बनाए ताकि AI को दिखाया जा सके कि "अच्छा" क्या दिखता है।
  • चरण 2 (रोबोट प्रशिक्षु): उन्होंने उन मानवीय उदाहरणों के आधार पर हजारों नए प्रश्न और उत्तर उत्पन्न करने के लिए एक सुपर-स्मार्ट AI (Gemini) का उपयोग किया।
  • चरण 3 (गुणवत्ता नियंत्रण): मनुषनों ने वापस जाकर रोबोट के काम की जांच की, त्रुटियों को ठीक किया और यह सुनिश्चित किया कि "गायब जानकारी" वाले प्रश्न वास्तव में गायब थे।

इससे एक ऐसा डेटासेट बना जो विविध, कठिन और वास्तविक दुनिया की व्यावसायिक समस्याओं के बहुत करीब है।

4. परिणाम: जिम क्लास में कौन जीता?

लेखकों ने कई अलग-अलग AI मॉडल का इस नए जिम पर परीक्षण किया। यहाँ उन्हें क्या मिला:

  • "बड़े" मॉडल जीतते हैं: एक मानव एथलीट की तरह, बड़े AI मॉडल (जिनमें अधिक "मांसपेशियां" या पैरामीटर्स होते हैं) आम तौर पर बेहतर प्रदर्शन करते हैं। वे अधिक जटिल अनुरोधों को संभाल सकते थे।
  • "क्लोज्ड" बनाम "ओपन" अंतर: बड़ी तकनीकी कंपनियों के स्वामित्व वाले मॉडल (जैसे गूगल का Gemini) ओपन-सोर्स मॉडल (जैसे Llama या Qwen) की तुलना में काफी बेहतर प्रदर्शन करते हैं। क्लोज्ड मॉडल अधिक सटीक थे और उनके द्वारा गलत जानकारी (hallucinate) बनाने की संभावना कम थी।
  • "यह कहाँ है?" की समस्या: जबकि AI अधिकांश समय शब्दों को सही बताता था, वे शब्दों के पेज पर स्थान बताने में बहुत खराब थे। यह एक ऐसे छात्र की तरह है जो उत्तर तो सुना सकता है लेकिन किताब में उस वाक्य की ओर इशारा नहीं कर सकता जो उसका प्रमाण है।
  • "बहुत सारी वस्तुओं" का संघर्ष: जब AI से एक बार में बहुत लंबी सूची (जैसे 50 अलग-अलग मान) निकालने के लिए कहा गया, तो इसके प्रदर्शन में गिरावट आई। यह अभिभूत हो गया, जैसे एक वेटर एक साथ 50 प्लेटें ले जाने की कोशिश कर रहा हो।

5. यह क्यों महत्वपूर्ण है

इस पेपर से पहले, हमारे पास यह परीक्षण करने का कोई अच्छा तरीका नहीं था कि क्या AI वास्तव में लचीले तरीके से जटिल दस्तावेजों को समझ सकता है।

  • व्यवसायों के लिए: यह कंपनियों को यह जानने में मदद करता है कि उन्हें अपनी कागजी कार्रवाई को स्वचालित करने के लिए किस AI पर भरोसा करना चाहिए।
  • शोधकर्ताओं के लिए: यह उन्हें एक स्पष्ट लक्ष्य देता है। अब वे जानते हैं कि AI कहाँ विफल हो रहा है (जैसे गायब जानकारी ढूंढना या पेज पर टेक्स्ट का स्थान ढूंढना) ताकि वे इसे ठीक कर सकें।

संक्षेप में: EXSTRUCTINY, AI के लिए एक नया, कठिन एग्जाम है जो उसे केवल "अनुमान लगाने" के बजाय वास्तव में "समझने" और अव्यवस्थित दस्तावेजों से जानकारी को व्यवस्थित करने के लिए मजबूर करता है, ठीक वैसे ही जैसे एक कुशल मानव सहायक करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →