Benchmarking Large Language Models on Reference Extraction and Parsing in the Social Sciences and Humanities
यह शोध पत्र सामाजिक विज्ञान और मानविकी के अंतर्गत यथार्थवादी, शोरयुक्त और बहुभाषी स्थितियों में संदर्भ निष्कर्षण (reference extraction) और पार्सिंग (parsing) के मूल्यांकन के लिए एक एकीकृत बेंचमार्क प्रस्तुत करता है, जो यह दर्शाता है कि जहाँ निष्कर्षण संतृप्त हो जाता है, वहीं पार्सिंग एक बाधा बनी रहती है जिसे हाइब्रिड रूटिंग के माध्यम से GROBID जैसे पारंपरिक उपकरणों को कार्य-अनुकूलित लार्ज लैंग्वेज मॉडल्स के साथ जोड़कर सर्वोत्तम रूप से संबोधित किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, वैश्विक पुस्तकालय बनाने की कोशिश कर रहे हैं जहाँ हर किताब, लेख और निबंध उन अन्य कार्यों से जुड़ा हो जिनका वह उल्लेख करता है। ऐसा करने के लिए, आपको एक रोबोट की आवश्यकता है जो एक दस्तावेज़ को पढ़ सके, प्रत्येक उद्धरण (दूसरे कार्यों को दिए गए "शौक-आउट्स") को खोज सके, और उन्हें लेखक के नाम, शीर्षक, वर्ष और प्रकाशक के साथ करीने से फाइल कर सके।
यह रेफरेंस एक्सट्रैक्शन एंड पार्सिंग (संदर्भ निष्कर्षण और पार्सिंग) का काम है।
लंबे समय तक, इस काम के लिए हमने जो रोबोट बनाए थे, वे ऐसे अत्यधिक प्रशिक्षित पुस्तकालयाध्यक्षों की तरह थे जो केवल अंग्रेजी बोलते थे और केवल साफ-सुथरी, आधुनिक पाठ्यपुस्तकों को पढ़ते थे। वे तब पूरी तरह से काम करते हैं जब उद्धरण पुस्तक के अंत में एक व्यवस्थित सूची के रूप में होते हैं। लेकिन वे सामाजिक विज्ञान और मानविकी (SSH) की अव्यवस्थता का सामना करने पर पूरी तरह भ्रमित हो जाते हैं।
SSH की दुनिया में, उद्धरण छिपे हुए खजाने के नक्शों की तरह होते हैं:
- वे फुटनोट्स (पृष्ठ के नीचे छोटे टेक्स्ट) में दबे होते हैं।
- वे एक साथ कई अलग-अलग भाषाओं (अंग्रेजी, जर्मन, इतालवी, आदि) में लिखे होते हैं।
- वे अजीब संक्षिप्त रूपों (abbreviations) और पुराने ढंग की शैलियों का उपयोग करते हैं जो सदी या देश के अनुसार बदल जाते हैं।
यह शोध पत्र वास्तव में नई पीढ़ी के रोबोटों के लिए एक तनाव परीक्षण (stress test) है: लार्ज लैंग्वेज मॉडल्स (LLMs)। लेखक यह देखना चाहते थे कि क्या ये "सुपर-स्मार्ट AI दिमाग" पुराने विशिष्ट रोबोटों की तुलना में SSH की इस बहुभाषी, फुटनोट-भरी अराजकता को बेहतर ढंग से संभाल सकते हैं।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. तीन टेस्ट ट्रैक
लेखकों ने केवल एक प्रकार के दस्तावेज़ का परीक्षण नहीं किया। उन्होंने तीन अलग-अलग भूभागों के साथ एक "ड्राइविंग कोर्स" बनाया:
- CEX (हाईवे): साफ, अंग्रेजी जर्नल लेख। यह आसान लेन है जहाँ पुराने रोबोट आमतौर पर अच्छा प्रदर्शन करते हैं।
- EXCITE (ऑफ-रोड): जर्मन और अंग्रेजी दस्तावेज़ जिनमें फुटनोट्स में छिपे उद्धरण, मिश्रित लेआउट और संक्षिप्त रूप हैं। यह कीचड़ भरा, ऊबड़-खाबड़ इलाका है।
- LinkedBooks (जंगल): मानविकी संदर्भों में जंगली शैलीगत विविधताएं और कई भाषाएं। यह घना, भ्रमित करने वाला जंगल है।
2. दावेदार
- पुराना गार्ड (GROBID): इसे एक विशेष फोर्कलिफ्ट के रूप में सोचें। यह मानक बक्सों (साफ अंग्रेजी उद्धरणों) को हिलाने में अविश्वसनीय रूप से तेज़ और कुशल है। लेकिन यदि आप इसे गलत आकार का, टेप से लिपटा हुआ, या किसी विदेशी भाषा में लिखा हुआ बॉक्स देते हैं, तो यह उसे गिरा देता है।
- नए बच्चे (DeepSeek, Mistral, Qwen जैसे LLMs): इन्हें बहुमुखी स्विस आर्मी नाइफ के रूप में सोचें। वे सामान्यज्ञ (generalists) हैं। वे लगभग कुछ भी पढ़ सकते हैं, संदर्भ समझ सकते हैं और कई भाषाएं संभाल सकते हैं। लेकिन, वे कभी-कभी "विचलित" हो सकते हैं या यदि उन्हें सही मार्गदर्शन न मिले तो तथ्य बना सकते हैं।
3. परिणाम: कौन जीता?
"खोजने" का कार्य (Extraction):
- उपमा: टेक्स्ट में उद्धरणों को ढूंढना।
- परिणाम: बड़े AI मॉडल (LLMs) मेटल डिटेक्टर की तरह हैं। एक बार जब वे पर्याप्त बड़े हो जाते हैं, तो वे लगभग सब कुछ ढूंढ लेते हैं। चाहे वह एक साफ सूची हो या फुटनोट, वे उद्धरणों को आसानी से पहचान लेते हैं। पुराना फोर्कलिफ्ट (GROBID) यहाँ ठीक है, लेकिन AI अधिक विश्वसनीय है।
"फाइलिंग" का कार्य (Parsing):
- उपमा: मिले हुए उद्धरण को "लेखक", "शीर्षक", "तिथि" में तोड़ना।
- परिणाम: यह वह जगह है जहाँ पुराना फोर्कलिफ्ट (GROBID) केवल अपने घरेलू क्षेत्र (साफ अंग्रेजी) पर चमकता है। लेकिन जैसे ही आप "ऑफ-रोड" या "जंगल" (जर्मन फुटनोट, मिश्रित भाषाएं) में जाते हैं, फोर्कलिफ्ट टूट जाता है।
- AI मॉडल इस मामले में बहुत बेहतर हैं। वे बहुभाषी अनुवादकों की तरह हैं जो यह समझ सकते हैं कि एक जर्मन फुटनोट में "Ebd." का अर्थ "Ibid." (वही स्रोत) है और इसे सही ढंग से फाइल कर सकते हैं।
"पूरा काम" (End-to-End):
- उपमा: बिना किसी मदद के शुरू से अंत तक पूरा काम करना।
- परिणाम: AI मॉडल आम तौर पर अधिक मजबूत होते हैं, लेकिन उनकी एक कमजोरी है: वे थक जाते हैं। यदि दस्तावेज़ बहुत बड़ा है, तो AI भ्रमित (hallucinate) होने लग सकता है या अपना उत्तर बीच में ही छोड़ सकता है (जैसे परीक्षा में समय समाप्त होने पर छात्र)। फोर्कलिफ्ट तेज़ है लेकिन कम लचीला है।
4. गुप्त हथियार
लेखकों ने दो तरीके खोजे जिनसे AI को और भी बेहतर बनाया जा सकता है:
LoRA ("विशेष प्रशिक्षण"):
कल्पना कीजिए कि आप एक सामान्यज्ञ AI को विशेष रूप से "मानविकी फुटनोट्स कैसे पढ़ें" पर एक क्रैश कोर्स दे रहे हैं। इसे LoRA कहा जाता है। यह स्विस आर्मी नाइफ को वाइन की बोतल खोलने के लिए एक विशेष अटैचमेंट देने जैसा है।- परिणाम: इस प्रशिक्षण की एक छोटी मात्रा ने AI को जटिल SSH दस्तावेजों को संभालने में काफी बेहतर बना दिया, और अक्सर विशेष फोर्कलिफ्ट को भी पीछे छोड़ दिया।
सेगमेंटेशन ("चंकिंग" रणनीति):
AI को एक बार में 100 पन्नों की किताब पढ़ने के लिए कहने के बजाय (जिससे वह चक्कर खा सकता है), लेखकों ने किताब को छोटे अध्यायों में तोड़ दिया।- परिणाम: यह एक छात्र को एक पृष्ठ पढ़ने, उसका सारांश देने और फिर अगले पृष्ठ पर जाने के लिए कहने जैसा है। यह AI को अभिभूत होने से रोकता है और अंतिम परिणाम को बहुत अधिक सटीक बनाता है।
5. अंतिम निर्णय: हाइब्रिड दृष्टिकोण
शोध पत्र निष्कर्ष निकालता है कि हमें केवल एक रोबोट नहीं चुनना चाहिए। हमें एक स्मार्ट ट्रैफिक सिस्टम (रूटिंग) बनाना चाहिए:
- परिदृश्य A: आपके पास एक साफ, अंग्रेजी PDF है जिसमें अंत में बिब्लियोग्राफी है।
- कार्रवाई: इसे फोर्कलिफ्ट (GROBID) के पास भेजें। यह इस काम के लिए तेज़, सस्ता और उत्तम है।
- परिदृश्य B: आपके पास एक जटिल, बहुभाषी दस्तावेज़ है जिसमें हर जगह फुटनोट्स हैं।
- कार्रवाई: इसे प्रशिक्षित AI (LoRA के साथ LLM) के पास भेजें। यह धीमा है, लेकिन यह काम खराब नहीं करेगा।
संक्षेप में:
पुराने उपकरण "साफ" दुनिया के लिए महान हैं, लेकिन सामाजिक विज्ञान और मानविकी अव्यवस्थित हैं। नए AI उपकरण उस अव्यवस्था को संभालने के लिए पर्याप्त लचीले हैं, खासकर यदि हम उन्हें थोड़ा विशेष प्रशिक्षण दें और बड़े कार्यों को छोटे टुकड़ों में विभाजित करें। भविष्य एक उपकरण चुनने के बारे में नहीं है; यह एक स्मार्ट सिस्टम बनाने के बारे में है जो जानता है कि किस काम के लिए किस उपकरण का उपयोग करना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।