← नवीनतम पेपर
💬 NLP

The GELATO Dataset for Legislative NER

यह शोध पत्र GELATO प्रस्तुत करता है, जो 118वीं कांग्रेस के अमेरिकी विधायी विधेयकों का एक नवीन डेटासेट है जिसे टू-लेवल ऑन्टोलॉजी के साथ एनोटेट किया गया है, और यह प्रदर्शित करता है कि फाइन-ट्यून्ड RoBERTa मॉडल LLMs के संयोजन के साथ विधायी नामित इकाई पहचान (नेमड एंटिटी रिकग्निशन) प्रभावी ढंग से करते हैं।

मूल लेखक: Matthew Flynn, Timothy Obiso, Sam Newman

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matthew Flynn, Timothy Obiso, Sam Newman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि अमेरिकी कांग्रेस एक विशाल, अराजक पुस्तकालय की तरह है जहाँ हर साल हजारों नई किताबें (विधेयक/bills) लिखी जाती हैं। ये किताबें एक बहुत ही विशिष्ट, सघन और कानूनी भाषा में लिखी जाती हैं जिसे समझना आम लोगों के लिए—और यहाँ तक कि सामान्य कंप्यूटर प्रोग्रामों के लिए भी—कठिन है।

आप जिस शोध पत्र के बारे में पूछ रहे हैं वह एक नया टूल पेश करता है जिसे GELATO (Government, Executive, Legislative, and Treaty Ontology) कहा जाता है। GELATO को केवल एक डेटासेट के रूप में नहीं, बल्कि एक विशेष चश्मे के रूप में समझें जिसे विशेष रूप से इन विधायी पुस्तकों को पढ़ने के लिए डिज़ाइन किया गया है।

यहाँ बताया गया है कि उन्होंने ये चश्मे कैसे बनाए और ये कैसे काम करते हैं, जिसे सरल भाषा में समझाया गया है:

1. समस्या: "लीगल-ईज़" (Legalese) का कोहरा

सामान्य कंप्यूटर समाचार लेख पढ़ने में बहुत अच्छे होते हैं। वे आसानी से पहचान सकते हैं कि "जॉन स्मिथ" एक व्यक्ति है और "गूगल" एक कंपनी है। लेकिन जब वे एक कांग्रेस विधेयक (Congressional bill) को पढ़ने की कोशिश करते हैं, तो वे भ्रमित हो जाते हैं।

  • क्या "द स्पीकर" (The Speaker) किसी व्यक्ति का नाम है, या यह एक पद का नाम है?
  • क्या "द फंड" (The Fund) पैसे का एक विशिष्ट ढेर है, या केवल एक सामान्य अवधारणा है?
  • क्या "द सीनेट" (The Senate) एक इमारत है, लोगों का एक समूह है, या एक सरकारी निकाय है?

मानक कंप्यूटर मॉडल इस कोहरे में खो जाते हैं क्योंकि उन्हें इस विशिष्ट प्रकार के टेक्स्ट पर प्रशिक्षित नहीं किया गया है।

2. समाधान: एक दो-स्तरीय छँटाई प्रणाली

लेखकों ने जानकारी को टैग करने का एक नया तरीका बनाया है, जिसे वे Two-Level Ontology कहते हैं। कल्पना कीजिए कि आप मिश्रित खिलौनों के ढेर को छाँट रहे हैं।

  • स्तर 1 (बड़े बकेट/डिब्बे): पहले, आप खिलौनों को व्यापक श्रेणियों में छाँटते हैं: लोग, संगठन, दस्तावेज़, क्रियाएं, विचार, और समूह।
  • स्तर 2 (विशिष्ट खिलौने): फिर, आप "लोग" वाले बकेट के अंदर देखते हैं। क्या यह एक कांग्रेस सदस्य है? एक राष्ट्रपति? या सिर्फ एक आम नागरिक? "दस्तावेज़" वाले बकेट में, क्या यह एक विधेयक संख्या (Bill number) है? एक कानून है? या एक रिपोर्ट है?

यह दो-चरणीय प्रक्रिया ही GELATO का मूल है। उन्होंने 118वीं कांग्रेस के 131 वास्तविक विधेयकों को इस प्रणाली के साथ मैन्युअल रूप से लेबल किया, जिससे एक "गोल्ड स्टैंडर्ड" प्रशिक्षण सेट तैयार हुआ।

3. प्रशिक्षण: रोबोटों को सिखाना

शोधकर्ताओं ने दो प्रकार के AI रोबोटों को यह छँटाई करना सिखाया:

  • "पुराने स्कूल" वाला रोबोट (BERT): यह मॉडल एक मेहनती छात्र की तरह है जिसने कड़ी मेहनत से पढ़ाई की है लेकिन उसका शब्दकोश छोटा है। इसने ठीक-ठाक प्रदर्शन किया, लेकिन कानूनी टेक्स्ट की बारीकियों के साथ इसे संघर्ष करना पड़ा।
  • "बड़ा दिमाग" वाला रोबोट (RoBERTa): यह मॉडल उस छात्र की तरह है जिसके पास अपने दिमाग में एक विशाल पुस्तकालय है। इसने संदर्भ (context) को बहुत बेहतर समझा और काफी उच्च स्कोर प्राप्त किया।

परिणाम: "बड़ा दिमाग" वाला रोबोट (RoBERTa) स्तर 1 (बड़े बकेट की पहचान करने) में बहुत अच्छा हो गया। यह आपको बता सकता था, "हे, यह टेक्स्ट का हिस्सा एक व्यक्ति है," और यह उच्च सटीकता के साथ कर सकता था।

4. ट्विस्ट: "विशेषज्ञ सलाहकार" (LLMs)

यहीं पर यह बहुत चतुर है। यहाँ तक कि सबसे अच्छा रोबोट भी कभी-कभी सूक्ष्म विवरणों को मिस कर देता है। इसलिए, लेखकों ने एक दूसरा चरण जोड़ा।

एक बार जब रोबोट एक "व्यक्ति" (स्तर 1) की पहचान कर लेता है, तो वह उस विशिष्ट शब्द को एक Large Language Model (LLM) को भेज देता है—इसे एक अत्यधिक शिक्षित मानव सलाहकार के रूप में समझें।

  • प्रॉम्प्ट (निर्देश): रोबंड सलाहकार से कहता है: "मैंने इस वाक्य में 'स्पीकर' शब्द पाया। संदर्भ के आधार पर, क्या यह एक कांग्रेस सदस्य है, एक पद (Title) है, या सिर्फ एक नाम है?"
  • जादू: सलाहकार अपने विशाल सामान्य ज्ञान का उपयोग करके अंतिम, सटीक निर्णय लेता है।

यह संयोजन एक फैक्ट्री असेंबली लाइन की तरह काम करता है:

  1. रोबोट: पूरे दस्तावेज़ को तेज़ी से स्कैन करने और "बड़े बकेट" खोजने के लिए भारी काम करता है।
  2. सलाहकार: विस्तृत निरीक्षण करता है, रोबोट द्वारा पाए गए आइटमों के सटीक लेबल को परिष्कृत करता है।

5. परिणाम और चुनौतियाँ

  • सफलता: इस दो-चरणीय विधि ने बहुत अच्छा काम किया। सिस्टम जटिल विधायी संस्थाओं (entities) को सटीक रूप से निकाल सकता था, जैसे कि यह पहचानना कि "द फेयरनेस डॉक्ट्रिन" (The Fairness Doctrine) एक विशिष्ट कानूनी सिद्धांत (Abstraction) है न कि केवल एक यादृच्छिक वाक्यांश।
  • रुकावटें:
    • भ्रम: रोबोट कभी-कभी "लोगों के समूहों" (जैसे "Veterans") को "व्यक्तिगत लोगों" के साथ भ्रमित कर देते थे। यह प्रशंसकों की भीड़ को एक अकेले प्रशंसक समझने जैसा है।
    • श्रृंखला प्रतिक्रिया (Chain Reaction): यदि पहला रोबोट गलती करता है (उदाहरण के लिए, वह एक "विधेयक" को केवल एक "दस्तावेज़" समझ लेता है), तो सलाहकार को गलत प्रश्न मिलता है और वह भी गलती करता है। त्रुटियाँ रेखा में नीचे की ओर "कैस्केड" (cascades) होती हैं।

यह क्यों मायने रखता है?

कल्पना कीजिए कि यदि आप अमेरिकी कांग्रेस द्वारा पारित प्रत्येक नए कानून को तुरंत स्कैन कर सकें और स्वचालित रूप से बाहर निकाल सकें:

  • इसे कौन प्रायोजित कर रहा है?
  • कौन सा सरकारी एजेंसी प्रभारी है?
  • किस विशिष्ट फंड का उपयोग किया जा रहा है?
  • किन लोगों के समूह प्रभावित हो रहे हैं?

यह शोध पत्र उस कार्य के लिए एक ब्लूप्रिंट प्रदान करता है। GELATO डेटासेट बनाकर और यह दिखाकर कि तेज़ AI को स्मार्ट AI के साथ कैसे जोड़ा जाए, लेखकों ने एक ऐसा उपकरण बनाया है जो शोधकर्ताओं, पत्रकारों और नीति निर्माताओं को अमेरिकी विधान के घने जंगल को पहले की तुलना में बहुत तेज़ी से नेविगेट करने में मदद कर सकता है।

संक्षेप में: उन्होंने एक विशेष शब्दकोश और एक दो-चरणीय टीम (एक तेज़ स्कैनर + एक स्मार्ट विशेषज्ञ) बनाई है ताकि भ्रमित करने वाले कानूनी विधेयकों को स्पष्ट, व्यवस्थित डेटा में बदला जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →