← नवीनतम पेपर
💻 computer science

Digging Up Citations: FOSSIL, a Dataset and Workflow for Reference Extraction in Law and the Humanities

यह शोधपत्र FOSSIL प्रस्तुत करता है, जो एक बहुभाषी डेटासेट और उसके साथ संलग्न वर्कफ़्लो है जिसे कानून और मानविकी विद्वत्ता में पादटिप्पणी-आधारित उद्धरणों (footnote-based citations) के निष्कर्षण को बेहतर बनाने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि एक विशिष्ट पाइपलाइन मानक उपकरणों की तुलना में निष्कर्षण गुणवत्ता को लगभग दोगुना कर देती है, जबकि क्रॉस-रेफरेंस और मिश्रित-सामग्री वाली पादटिप्पणियों को संभालने में शेष चुनौतियों पर भी प्रकाश डालती है।

मूल लेखक: Luca Foppiano, Christian Boulanger

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luca Foppiano, Christian Boulanger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पुस्तकालय को व्यवस्थित करने की कोशिश कर रहे हैं। प्राकृतिक विज्ञानों (जैसे जीव विज्ञान या भौतिकी) में, पुस्तकों की एक बहुत ही व्यवस्थित और पूर्वानुमानित संरचना होती है: मुख्य कहानी अध्यायों में होती है, और सभी "स्रोत नोट" (source notes) अंत में एक साफ, क्रमांकित सूची के रूप में रखे होते हैं। यह एक रेसिपी की तरह है जहाँ सामग्री को खाना बनाने के निर्देशों से अलग सूचीबद्ध किया जाता है। कंप्यूटर इन रेसिपी को पढ़ने में बहुत कुशल होते हैं।

हालाँकि, विधि (Law) और मानविकी (इतिहास, दर्शन, साहित्य) में, "स्रोत नोट" बहुत अस्त-व्यस्त होते हैं। वे पाठ के भीतर ही दबे होते हैं, अक्सर नीचे के हाशिए (फुटनोट्स) में, लेखक के व्यक्तिगत विचारों, स्पष्टीकरणों और क्रॉस-रेफरेंस के साथ मिले हुए। यह एक ऐसी रेसिपी की तरह है जहाँ सामग्री वाक्यों के अंदर छिपी होती है जैसे, "दो कप मैदा डालें (जो मैंने मंगलवार को बाजार से खरीदा था, देखें पृष्ठ 4) और चलाते रहें।"

यह शोध पत्र, जिसका शीर्षक "Digging Up Citations: FOSSIL" है, कानून और मानविकी की किताबों में इन छिपे हुए तत्वों (सामग्री) को खोजने और व्यवस्थित करने का एक बेहतर तरीका बनाने के बारे में है।

यहाँ उन्होंने क्या किया, इसका सरल उपमाओं के साथ विवरण दिया गया है:

1. समस्या: "ब्लैक बॉक्स" और "अव्यवस्थित बेसमेंट"

लेखक बताते हैं कि मौजूदा कंप्यूटर प्रोग्राम (मॉडल्स) व्यवस्थित "प्राकृतिक विज्ञान" शैली पर प्रशिक्षित हैं। जब वे विधि और मानविकी के फुटनोट्स को पढ़ने की कोशिश करते हैं, तो वे भ्रमित हो जाते हैं क्योंकि डेटा मिला-जुला होता है।

वे यह भी नोट करते हैं कि शक्तिशाली AI उपकरण (जैसे बड़े व्यावसायिक चैटबॉट्स) कभी-कभी इसे सुलझा सकते हैं, लेकिन वे जोखिम भरे हैं। वे एक हाई-टेक उत्खनन मशीन (excavator) को किराए पर लेने जैसा है जो ऐसी कंपनी से ली गई है जो कल ही बंद हो सकती है, और अपने साथ आपका डेटा भी ले जा सकती है। लेखक एक ऐसा टूल चाहते थे जो खुला (open) हो, मुफ्त हो, और हमेशा उनके पास रहे।

2. समाधान: "FOSSIL" प्रोजेक्ट

टीम ने इन उद्धरणों (citations) को खोद निकालने के लिए एक पूर्ण टूलकिट बनाया है। वे इस डेटासेट को FOSSIL (Footnote-based Open-access SSH Scientific Instance Labels) कहते हैं। इसे एक विशाल, व्यवस्थित "पहले और बाद के" उदाहरणों के संग्रह के रूप में समझें जो कंप्यूटर को अव्यवस्थित फुटनोट्स पढ़ना सिखाते हैं।

उन्होंने चार मुख्य चीजें बनाईं:

  • एक डिजिटल वर्कबेंड (PDF-TEI Editor): एक वेब टूल जो मनुष्यों और कंप्यूटरों को साथ मिलकर काम करने की अनुमति देता है। यह एक तरफ मूल PDF और दूसरी तरफ संरचित डेटा दिखाता है, जिससे लोग गलतियों को सुधार सकते हैं और कंप्यूटर को सिखा सकते हैं कि उसे क्या खोजना है।
  • एक प्रशिक्षण नियमावली (The Workflow): सात लोगों की एक टीम (जिसमें विशेषज्ञ और छात्र शामिल हैं) द्वारा डेटा को साफ करने और लेबल करने का एक चरण-दर-चरण मार्गदर्शक।
  • एक खजाने का भंडार (The Dataset): उन्होंने कानून, इतिहास और सामाजिक विज्ञान के 96 शैक्षणिक लेख एकत्र किए। इन लेखों में फुटनोट्स में छिपे 7,600 से अधिक संदर्भ हैं। महत्वपूर्ण रूप से, यह डेटा "ओपन लाइसेंस" वाला है, जिसका अर्थ है कि कोई भी कानूनी परेशानी के बिना इसका उपयोग कर सकता है।
  • एक विशेष इंजन (Grobid Specialization): उन्होंने एक मौजूदा ओपन-सोर्स टूल जिसे Grobid कहा जाता है (जो एक मानक लाइब्रेरी स्कैनर की तरह है), उसे एक "विशेष लेंस" दिया ताकि वह विशेष रूप से विधि और मानविकी के जटिल फुटनोट्स पर ध्यान केंद्रित कर सके।

3. चुनौती: यह इतना कठिन क्यों है?

शोध पत्र बताता है कि इन क्षेत्रों में फुटनोट्स पेचीदा होते हैं क्योंकि वे एक साथ पाँच अलग-अलग काम करते हैं:

  1. केवल एक टिप्पणी (कोई उद्धरण नहीं)।
  2. लेखक के बारे में एक बायो नोट।
  3. पुस्तकों की एक साफ सूची।
  4. एक "देखें भी" (see also) नोट जो किसी पिछले फुटनोट की ओर इशारा करता है (जैसे "देखें नोट 5")।
  5. उपरोक्त सभी का एक अराजक मिश्रण।

यह मेल के एक ढेर को छाँटने की कोशिश करने जैसा है जहाँ कुछ लिफाफों में पत्र हैं, कुछ में चेक हैं, कुछ में फोटो हैं, और कुछ में तीनों का मिश्रण है, और वे सभी अलग-अलग भाषाओं और लिखावट शैलियों में लिखे गए हैं।

4. परिणाम: "अनुपलब्ध" से "प्राप्त" तक

टीम ने अपने नए विशेष इंजन का परीक्षण पुराने, मानक संस्करण के विरुद्ध किया।

  • पुराना तरीका: मानक टूल बहुत चयनात्मक था। यदि उसे कोई संदर्भ मिल जाता है, तो वह उसे पहचानने में लगभग सटीक था (उच्च परिशुद्धता/precision), लेकिन वह वास्तविक संदर्भों में से 70-80% को मिस कर देता था क्योंकि वे मानक वैज्ञानिक उद्धरणों की तरह नहीं दिखते थे (कम रिकॉल/recall)। यह एक ऐसे मेटल डिटेक्टर की तरह था जो केवल सोने के सिक्कों के लिए बीप करता है लेकिन चांदी के सिक्कों को अनदेखा कर देता है।
  • नया तरीका: विशेष "FOSSIL" संस्करण ने दोगुने संदर्भ खोजे।
    • इसने प्रकाशन तिथियों को खोजने की दर 21% से बढ़ाकर 71% कर दी।
    • इसने लेखक के नामों को खोजने की दर 23% से बढ़ाकर 60% कर दी।
    • कुल मिलाकर, निष्कर्षण (extraction) की गुणवत्ता लगभग दोगुनी हो गई (स्कोर 0.36 से बढ़कर 0.72 हो गया)।

5. निष्कर्ष

पत्र निष्कर्ष निकालता है कि आप इस समस्या को ठीक करने के लिए केवल एक मानक टूल की सेटिंग्स को "ट्वीक" नहीं कर सकते; आपको एक ऐसे टूल की आवश्यकता है जो विशेष रूप से विधि और मानविकी के फुटनोट्स की जटिल वास्तविकता पर प्रशिक्षित हो।

FOSSIL अब एक मील का पत्थर है। यह साबित करता है कि सही डेटा और एक विशेष कार्यप्रवाह के साथ, कंप्यूटर अंततः इन जटिल फुटनोट्स को सटीक रूप से पढ़ना शुरू कर सकते हैं। लेखक इस कार्य को अधिक भाषाओं तक विस्तारित करने और यहाँ तक कि "देखें नोट 5" को वापस मूल नोट 5 से स्वचालित रूप से जोड़ने जैसी कठिन समस्याओं को हल करने की योजना बना रहे हैं।

संक्षेप में: उन्होंने एक बेहतर फावड़ा और एक नक्शा बनाया है ताकि उन उद्धरणों को खोद निकाला जा सके जो पहले अकादमिक फुटनोट्स के कीचड़ में दबे हुए थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →