← नवीनतम पेपर
💬 NLP

LLMStructBench: Benchmarking Large Language Model Structured Data Extraction

यह शोध पत्र LLMStructBench प्रस्तुत करता है, जो संरचित JSON निष्कर्षण (structured JSON extraction) पर लार्ज लैंग्वेज मॉडल्स के मूल्यांकन के लिए एक नवीन बेंचमार्क और डेटासेट है, जो यह प्रकट करता है कि संरचनात्मक वैधता सुनिश्चित करने के लिए प्रॉम्प्टिंग रणनीतियों को अनुकूलित करना मॉडल के आकार की तुलना में अधिक महत्वपूर्ण है, साथ ही यह अर्थ संबंधी सटीकता (semantic accuracy) के साथ एक ट्रेड-ऑफ को भी रेखांकित करता है।

मूल लेखक: Sönke Tenckhoff, Mario Koddenbrock, Erik Rodner

प्रकाशित 2026-02-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sönke Tenckhoff, Mario Koddenbrock, Erik Rodner

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त मैनेजर हैं जिन्हें हर दिन सैकड़ों ईमेल प्राप्त होते हैं। कुछ कहते हैं, "मुझे एक लैपटॉप चाहिए," कुछ कहते हैं, "कृपया मेरी छुट्टी मंजूर करें," और कुछ आईटी समस्याओं के बारे में बस उलझी हुई बातें करते हैं। आपको इस सारी जानकारी को एक व्यवस्थित स्प्रेडशीट (एक JSON फ़ाइल) में व्यवस्थित करने की आवश्यकता है ताकि आपका कंप्यूटर इसे स्वचालित रूप से प्रोसेस कर सके।

समस्या क्या है? आपके पास हर ईमेल को पढ़ने और उसमें टाइप करने का समय नहीं है। इसलिए, आप इन कामों के लिए AI सहायकों (लार्ज लैंग्वेज मॉडल्स या LLMs) की एक टीम को काम पर रखते हैं।

यह पेपर, LLMStructBench, इन AI सहायकों के लिए एक विशाल रिपोर्ट कार्ड की तरह है। लेखकों ने यह देखने के लिए एक परीक्षण बनाया कि कौन सा AI वास्तव में बिखरे हुए मानवीय ईमेल को एक पूर्ण, त्रुटि-रहित स्प्रेडशीट में बदलने में अच्छा है।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. परीक्षण: "बिखरा हुआ मेलरूम"

शोधकर्ताओं ने केवल AI से "कोड लिखने" के लिए नहीं कहा। उन्होंने 995 वास्तविक परिदृश्य बनाए (जैसे बीमारी की छुट्टी, उपकरण ऋण, या प्रोजेक्ट विस्तार के लिए नकली ईमेल)।

  • लक्ष्य: AI को ईमेल पढ़ना था और एक सटीक JSON फ़ाइल (डेटा का एक विशिष्ट प्रकार जो कंप्यूटर पसंद करते हैं) आउटपुट करनी थी।
  • ट्विस्ट: उन्होंने 22 अलग-अलग AI मॉडल (छोटे, तेज़ मॉडलों से लेकर विशाल, शक्तिशाली मॉडलों तक) का परीक्षण किया और 5 अलग-अलग तरीके (प्रॉम्प्टिंग रणनीतियाँ) आज़माए।

2. बड़ा आश्चर्य: "यह मांसपेशियों के बारे में नहीं, बल्कि निर्देशों के बारे में है"

आप सोच सकते हैं कि सबसे बड़ा, सबसे महंगा AI (सबसे बड़ा "ओलंपिक वेटलिफ्टर") हमेशा जीतेगा।

  • वास्तविकता: पेपर में पाया गया कि आप सवाल कैसे पूछते हैं, यह इस बात से अधिक महत्वपूर्ण है कि AI कितना बड़ा है।
  • उपमा: कल्पना कीजिए कि आप एक कुशल शेफ (chef) से केक बनाने के लिए कह रहे हैं।
    • यदि आप केवल कहते हैं, "एक केक बनाओ," तो वे एक स्वादिष्ट केक बना सकते हैं, लेकिन शायद वह उस विशिष्ट बॉक्स में फिट न हो जाए जिसकी आपको आवश्यकता है (JSON संरचना)।
    • यदि आप उन्हें एक सख्त रेसिपी और बॉक्स की तस्वीर देते हैं (एक विशिष्ट प्रॉम्प्ट रणनीति), तो एक जूनियर शेफ (एक छोटा AI) भी एक ऐसा केक बना सकता है जो पूरी तरह से फिट बैठता है।
    • इसके विपरीत, यदि आप ओलंपिक वेटलिफ्टर (एक विशाल AI) को अस्पष्ट निर्देश देते हैं, तो वे केक उठाने की कोशिश कर सकते हैं लेकिन उसे फर्श पर गिरा सकते हैं (एक टूटी हुई फ़ाइल बनाना)।

3. गलतियों के दो प्रकार

शोधकर्ताओं ने महसूस किया कि AI के विफल होने के दो तरीके हैं, और वे बहुत अलग हैं:

  • "टूटा हुआ बॉक्स" (संरचनात्मक विफलता - Structural Failure): AI आपको डेटा देने की कोशिश करता है, लेकिन फ़ाइल दूषित हो जाती है, कोई ब्रैकेट गायब होता है, या वह बड़बड़ जैसा दिखता है। कंप्यूटर इसे खोल भी नहीं सकता।

    • उपमा: शेफ आपको सूप की एक प्लेट देता है, लेकिन कटोरा टूटा हुआ है। आप इसे खा नहीं सकते।
    • निष्कर्ष: छोटे AI अक्सर आपको सख्त निर्देश न देने पर कटोरा तोड़ देते हैं। बड़े AI कटोरे को सुरक्षित रखने में बेहतर होते हैं।
  • "गलत सामग्री" (सिमेंटिक त्रुटि - Semantic Error): AI आपको एक पूर्ण, अटूट कटोरा देता है, लेकिन वह चीनी के बजाय नमक से भरा होता है। फ़ाइल पूरी तरह से खुलती है, लेकिन डेटा गलत है।

    • उपमा: शेफ आपको एक आदर्श केक देता है, लेकिन उसने चीनी के बजाय नमक का उपयोग किया है। यह दिखने में सही है, लेकिन इसका स्वाद बहुत खराब है।
    • निष्कर्ष: बड़े AI भी यह गलती करते हैं! वे नियमों का पूरी तरह से पालन कर सकते हैं लेकिन फिर भी अर्थ (meaning) को गलत समझ सकते हैं।

4. जीतने वाली रणनीति: "सुरक्षा जाल" (The Safety Net)

शोधकर्ताओं ने AI को प्रॉम्प्ट करने के विभिन्न तरीकों का परीक्षण किया। उन्होंने पाया कि एक रणनीति (जिसे PJ+ कहा जाता है) एक सुरक्षा जाल की तरह काम करती है।

  • यह कैसे काम करता है: यह AI को एक सख्त टेम्पलेट का पालन करने के लिए मजबूर करता है और इसे उत्तर कैसा दिखना चाहिए, इसका एक उदाहरण देता है।
  • परिणाम: यह रणनीति गारंटी देती है कि AI आपको कभी भी टूटा हुआ कटोरा नहीं देगा (कोई संरचनात्मक त्रुटि नहीं)।
  • कैच (Catch): क्योंकि AI सख्त नियमों का पालन करने पर इतना केंद्रित है, इसलिए कभी-कभी यह सामग्री के बारे में भ्रमित हो जाता है, जिससे अधिक "गलत सामग्री" (सिमेंटिक त्रुटियां) होती हैं।
  • सबक: यदि आपको कंप्यूटर द्वारा फ़ाइल को पढ़ने की आवश्यकता है, तो सुरक्षा जाल (PJ+) का उपयोग करें। यदि आपको डेटा पूरी तरह से सटीक चाहिए, तो आपको सामग्रियों की दोबारा जांच करने के लिए एक इंसान की आवश्यकता हो सकती है।

5. अंतिम निर्णय

  • आकार ही सब कुछ नहीं है: एक छोटा, अच्छी तरह से ट्यून किया गया AI अक्सर एक विशाल, महंगे AI को हरा सकता है यदि आप उसे सही निर्देश देते हैं।
  • ओपन सोर्स तैयार है: सबसे अच्छे ओपन-सोर्स मॉडल (जैसे Gemma और Llama) अब महंगे, क्लोज्ड-सोर्स मॉडलों (जैसे GPT-4o) के लगभग बराबर हैं। अच्छे परिणाम पाने के लिए आपको बहुत पैसा खर्च करने की आवश्यकता नहीं है।
  • बाधा (Bottleneck): AI के लिए सबसे कठिन काम डेटा को फॉर्मेट करना नहीं है; बल्कि अर्थ को समझना है। सबसे अच्छे AI भी बिना मानवीय मदद के तथ्यों को 100% सही समझने में संघर्ष करते हैं।

संक्षेप में: यदि आप चाहते हैं कि आपका AI आपके डेटा को व्यवस्थित करे, तो केवल सबसे महंगा मॉडल न खरीदें। इसके बजाय, इसे देने के लिए सबसे अच्छे निर्देश खोजने में अपना समय बिताएं। एक छोटा AI जिसके पास एक बेहतरीन नक्शा है, वह एक विशाल AI की तुलना में तेजी से मंजिल तक पहुँच जाएगा जिसके पास कोई नक्शा नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →