← नवीनतम पेपर
💬 NLP

Benchmarking Large Language Models on Reference Extraction and Parsing in the Social Sciences and Humanities

यह शोध पत्र सामाजिक विज्ञान और मानविकी के अंतर्गत यथार्थवादी, शोरयुक्त और बहुभाषी स्थितियों में संदर्भ निष्कर्षण (reference extraction) और पार्सिंग (parsing) के मूल्यांकन के लिए एक एकीकृत बेंचमार्क प्रस्तुत करता है, जो यह दर्शाता है कि जहाँ निष्कर्षण संतृप्त हो जाता है, वहीं पार्सिंग एक बाधा बनी रहती है जिसे हाइब्रिड रूटिंग के माध्यम से GROBID जैसे पारंपरिक उपकरणों को कार्य-अनुकूलित लार्ज लैंग्वेज मॉडल्स के साथ जोड़कर सर्वोत्तम रूप से संबोधित किया जा सकता है।

मूल लेखक: Yurui Zhu, Giovanni Colavizza, Matteo Romanello

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yurui Zhu, Giovanni Colavizza, Matteo Romanello

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, वैश्विक पुस्तकालय बनाने की कोशिश कर रहे हैं जहाँ हर किताब, लेख और निबंध उन अन्य कार्यों से जुड़ा हो जिनका वह उल्लेख करता है। ऐसा करने के लिए, आपको एक रोबोट की आवश्यकता है जो एक दस्तावेज़ को पढ़ सके, प्रत्येक उद्धरण (दूसरे कार्यों को दिए गए "शौक-आउट्स") को खोज सके, और उन्हें लेखक के नाम, शीर्षक, वर्ष और प्रकाशक के साथ करीने से फाइल कर सके।

यह रेफरेंस एक्सट्रैक्शन एंड पार्सिंग (संदर्भ निष्कर्षण और पार्सिंग) का काम है।

लंबे समय तक, इस काम के लिए हमने जो रोबोट बनाए थे, वे ऐसे अत्यधिक प्रशिक्षित पुस्तकालयाध्यक्षों की तरह थे जो केवल अंग्रेजी बोलते थे और केवल साफ-सुथरी, आधुनिक पाठ्यपुस्तकों को पढ़ते थे। वे तब पूरी तरह से काम करते हैं जब उद्धरण पुस्तक के अंत में एक व्यवस्थित सूची के रूप में होते हैं। लेकिन वे सामाजिक विज्ञान और मानविकी (SSH) की अव्यवस्थता का सामना करने पर पूरी तरह भ्रमित हो जाते हैं।

SSH की दुनिया में, उद्धरण छिपे हुए खजाने के नक्शों की तरह होते हैं:

  • वे फुटनोट्स (पृष्ठ के नीचे छोटे टेक्स्ट) में दबे होते हैं।
  • वे एक साथ कई अलग-अलग भाषाओं (अंग्रेजी, जर्मन, इतालवी, आदि) में लिखे होते हैं।
  • वे अजीब संक्षिप्त रूपों (abbreviations) और पुराने ढंग की शैलियों का उपयोग करते हैं जो सदी या देश के अनुसार बदल जाते हैं।

यह शोध पत्र वास्तव में नई पीढ़ी के रोबोटों के लिए एक तनाव परीक्षण (stress test) है: लार्ज लैंग्वेज मॉडल्स (LLMs)। लेखक यह देखना चाहते थे कि क्या ये "सुपर-स्मार्ट AI दिमाग" पुराने विशिष्ट रोबोटों की तुलना में SSH की इस बहुभाषी, फुटनोट-भरी अराजकता को बेहतर ढंग से संभाल सकते हैं।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. तीन टेस्ट ट्रैक

लेखकों ने केवल एक प्रकार के दस्तावेज़ का परीक्षण नहीं किया। उन्होंने तीन अलग-अलग भूभागों के साथ एक "ड्राइविंग कोर्स" बनाया:

  • CEX (हाईवे): साफ, अंग्रेजी जर्नल लेख। यह आसान लेन है जहाँ पुराने रोबोट आमतौर पर अच्छा प्रदर्शन करते हैं।
  • EXCITE (ऑफ-रोड): जर्मन और अंग्रेजी दस्तावेज़ जिनमें फुटनोट्स में छिपे उद्धरण, मिश्रित लेआउट और संक्षिप्त रूप हैं। यह कीचड़ भरा, ऊबड़-खाबड़ इलाका है।
  • LinkedBooks (जंगल): मानविकी संदर्भों में जंगली शैलीगत विविधताएं और कई भाषाएं। यह घना, भ्रमित करने वाला जंगल है।

2. दावेदार

  • पुराना गार्ड (GROBID): इसे एक विशेष फोर्कलिफ्ट के रूप में सोचें। यह मानक बक्सों (साफ अंग्रेजी उद्धरणों) को हिलाने में अविश्वसनीय रूप से तेज़ और कुशल है। लेकिन यदि आप इसे गलत आकार का, टेप से लिपटा हुआ, या किसी विदेशी भाषा में लिखा हुआ बॉक्स देते हैं, तो यह उसे गिरा देता है।
  • नए बच्चे (DeepSeek, Mistral, Qwen जैसे LLMs): इन्हें बहुमुखी स्विस आर्मी नाइफ के रूप में सोचें। वे सामान्यज्ञ (generalists) हैं। वे लगभग कुछ भी पढ़ सकते हैं, संदर्भ समझ सकते हैं और कई भाषाएं संभाल सकते हैं। लेकिन, वे कभी-कभी "विचलित" हो सकते हैं या यदि उन्हें सही मार्गदर्शन न मिले तो तथ्य बना सकते हैं।

3. परिणाम: कौन जीता?

"खोजने" का कार्य (Extraction):

  • उपमा: टेक्स्ट में उद्धरणों को ढूंढना।
  • परिणाम: बड़े AI मॉडल (LLMs) मेटल डिटेक्टर की तरह हैं। एक बार जब वे पर्याप्त बड़े हो जाते हैं, तो वे लगभग सब कुछ ढूंढ लेते हैं। चाहे वह एक साफ सूची हो या फुटनोट, वे उद्धरणों को आसानी से पहचान लेते हैं। पुराना फोर्कलिफ्ट (GROBID) यहाँ ठीक है, लेकिन AI अधिक विश्वसनीय है।

"फाइलिंग" का कार्य (Parsing):

  • उपमा: मिले हुए उद्धरण को "लेखक", "शीर्षक", "तिथि" में तोड़ना।
  • परिणाम: यह वह जगह है जहाँ पुराना फोर्कलिफ्ट (GROBID) केवल अपने घरेलू क्षेत्र (साफ अंग्रेजी) पर चमकता है। लेकिन जैसे ही आप "ऑफ-रोड" या "जंगल" (जर्मन फुटनोट, मिश्रित भाषाएं) में जाते हैं, फोर्कलिफ्ट टूट जाता है।
  • AI मॉडल इस मामले में बहुत बेहतर हैं। वे बहुभाषी अनुवादकों की तरह हैं जो यह समझ सकते हैं कि एक जर्मन फुटनोट में "Ebd." का अर्थ "Ibid." (वही स्रोत) है और इसे सही ढंग से फाइल कर सकते हैं।

"पूरा काम" (End-to-End):

  • उपमा: बिना किसी मदद के शुरू से अंत तक पूरा काम करना।
  • परिणाम: AI मॉडल आम तौर पर अधिक मजबूत होते हैं, लेकिन उनकी एक कमजोरी है: वे थक जाते हैं। यदि दस्तावेज़ बहुत बड़ा है, तो AI भ्रमित (hallucinate) होने लग सकता है या अपना उत्तर बीच में ही छोड़ सकता है (जैसे परीक्षा में समय समाप्त होने पर छात्र)। फोर्कलिफ्ट तेज़ है लेकिन कम लचीला है।

4. गुप्त हथियार

लेखकों ने दो तरीके खोजे जिनसे AI को और भी बेहतर बनाया जा सकता है:

  • LoRA ("विशेष प्रशिक्षण"):
    कल्पना कीजिए कि आप एक सामान्यज्ञ AI को विशेष रूप से "मानविकी फुटनोट्स कैसे पढ़ें" पर एक क्रैश कोर्स दे रहे हैं। इसे LoRA कहा जाता है। यह स्विस आर्मी नाइफ को वाइन की बोतल खोलने के लिए एक विशेष अटैचमेंट देने जैसा है।

    • परिणाम: इस प्रशिक्षण की एक छोटी मात्रा ने AI को जटिल SSH दस्तावेजों को संभालने में काफी बेहतर बना दिया, और अक्सर विशेष फोर्कलिफ्ट को भी पीछे छोड़ दिया।
  • सेगमेंटेशन ("चंकिंग" रणनीति):
    AI को एक बार में 100 पन्नों की किताब पढ़ने के लिए कहने के बजाय (जिससे वह चक्कर खा सकता है), लेखकों ने किताब को छोटे अध्यायों में तोड़ दिया।

    • परिणाम: यह एक छात्र को एक पृष्ठ पढ़ने, उसका सारांश देने और फिर अगले पृष्ठ पर जाने के लिए कहने जैसा है। यह AI को अभिभूत होने से रोकता है और अंतिम परिणाम को बहुत अधिक सटीक बनाता है।

5. अंतिम निर्णय: हाइब्रिड दृष्टिकोण

शोध पत्र निष्कर्ष निकालता है कि हमें केवल एक रोबोट नहीं चुनना चाहिए। हमें एक स्मार्ट ट्रैफिक सिस्टम (रूटिंग) बनाना चाहिए:

  • परिदृश्य A: आपके पास एक साफ, अंग्रेजी PDF है जिसमें अंत में बिब्लियोग्राफी है।
    • कार्रवाई: इसे फोर्कलिफ्ट (GROBID) के पास भेजें। यह इस काम के लिए तेज़, सस्ता और उत्तम है।
  • परिदृश्य B: आपके पास एक जटिल, बहुभाषी दस्तावेज़ है जिसमें हर जगह फुटनोट्स हैं।
    • कार्रवाई: इसे प्रशिक्षित AI (LoRA के साथ LLM) के पास भेजें। यह धीमा है, लेकिन यह काम खराब नहीं करेगा।

संक्षेप में:
पुराने उपकरण "साफ" दुनिया के लिए महान हैं, लेकिन सामाजिक विज्ञान और मानविकी अव्यवस्थित हैं। नए AI उपकरण उस अव्यवस्था को संभालने के लिए पर्याप्त लचीले हैं, खासकर यदि हम उन्हें थोड़ा विशेष प्रशिक्षण दें और बड़े कार्यों को छोटे टुकड़ों में विभाजित करें। भविष्य एक उपकरण चुनने के बारे में नहीं है; यह एक स्मार्ट सिस्टम बनाने के बारे में है जो जानता है कि किस काम के लिए किस उपकरण का उपयोग करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →