← नवीनतम पेपर
💻 computer science

Gavel: Agent Meets Checklist for Evaluating LLMs on Long-Context Legal Summarization

यह शोधपत्र गेवल (Gavel) को प्रस्तुत करता है, जो एक व्यापक मूल्यांकन ढांचा है जिसमें संदर्भ-आधारित और संदर्भ-मुक्त एजेंट घटक शामिल हैं, जो लंबे-संदर्भ वाले कानूनी सारांशीकरण पर 12 सीमांत (frontier) एलएलएम (LLMs) का आकलन करने के लिए है, जो यह प्रकट करता है कि मॉडल भ्रमित होने के बजाय महत्वपूर्ण जानकारी छोड़ने की प्रवृत्ति रखते हैं, संदर्भ की लंबाई बढ़ने के साथ जटिल विवरणों के लिए संघर्ष करते हैं, और एजेंट-आधारित दृष्टिकोण प्रतिस्पर्धी प्रदर्शन बनाए रखते हुए टोकन के उपयोग को काफी कम कर देता है।

मूल लेखक: Yao Dou, Benjamin Mamut, Wei Xu

प्रकाशित 2026-07-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yao Dou, Benjamin Mamut, Wei Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत बड़े कानूनी मामले की समीक्षा करने की कोशिश कर रहे एक न्यायाधीश हैं। यह सिर्फ एक दस्तावेज़ नहीं है; यह कागजों का एक ऐसा ढेर है जो इतना मोटा है जैसे एक साथ पांच उपन्यास पढ़ रहा हो, जिसमें कोर्ट फाइलिंग, मोशन और निर्णयों के 1,00,000 से अधिक शब्द शामिल हैं। आपका काम क्या हुआ है, इसका एक संक्षिप्त और स्पष्ट सारांश लिखना है।

अब, कल्पना कीजिए कि आपके पास सुपर-स्मार्ट रोबोटों (लार्ज लैंग्वेज मॉडल्स, या LLMs) की एक टीम है जो दावा करती है कि वे कुछ ही सेकंड में इस पूरे ढेर को पढ़ सकते हैं और आपके लिए सारांश लिख सकते हैं। जिस पेपर के बारे में आप पूछ रहे हैं, GAVEL, अनिवार्य रूप से एक "रिपोर्ट कार्ड" और "ग्रेडिंग का एक नया तरीका" है यह देखने के लिए कि क्या ये रोबोट वास्तव में अच्छा काम कर रहे हैं।

यहाँ बताया गया है कि शोधकर्ताओं ने क्या पाया और उन्होंने इसे कैसे परखा, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "घास के ढेर में सुई" (The Needle in a Haystack)

रोबोटों का परीक्षण ऐसे मामलों पर किया जा रहा है जो अविश्वसनीय रूप से लंबे हैं। इसे ऐसे समझें जैसे किसी रोबोट से कुछ ही सेकंड में पूरी लाइब्रेरी का सारांश लिखने के लिए कहना। शोधकर्ता जानना चाहते थे: क्या ये रोबट वास्तव में पूरी लाइब्रेरी पढ़ते हैं, या वे बस पहले कुछ पन्नों को सरसरी तौर पर देखते हैं और बाकी का अनुमान लगा लेते हैं?

2. समाधान: GAVEL ग्रेडिंग सिस्टम

लेखकों ने रोबोटों को ग्रेड देने के लिए GAVEL नामक एक प्रणाली बनाई। इसके दो मुख्य भाग हैं, जो होमवर्क चेक करने के दो अलग-अलग तरीकों की तरह हैं:

  • GAVEL-REF ("उत्तर कुंजी" विधि):
    कल्पना कीजिए कि एक मानव विशेषज्ञ ने मामले का एक आदर्श सारांश लिखा है। GAVEL-REF इस मानव "गोल्ड स्टैंडर्ड" के विरुद्ध रोबोट के सारांश की तुलना करता है।

    • चेकलिस्ट: यह जाँचता है कि क्या रोबोट ने विशिष्ट तथ्यों का उल्लेख किया है, जैसे "किसने किससे मुकदमा किया?" या "मामला कब दायर किया गया था?" (जैसे यह देखना कि क्या छात्र ने क्विज़ के हर सवाल का जवाब दिया है)।
    • "बचे हुए" तथ्य: कभी-कभी रोबोट कुछ दिलचस्प विवरण जोड़ देता है जो चेकलिस्ट पर नहीं थे। GAVEL जाँचता है कि क्या वे विवरण वास्तव में सत्य हैं या रोबोट ने उन्हें मनगढ़ंत बनाया है।
    • स्टाइल चेक: यह भी ग्रेड देता है कि सारांश कैसा सुनाई देता है। क्या यह एक सहज कहानी की तरह पढ़ता है, या यह एक बिखरी हुई बुलेटेड लिस्ट जैसा दिखता है?
  • GAVEL-AGENT ("जासूस" विधि):
    कभी-कभी, आपके पास तुलना करने के लिए मानव "उत्तर कुंजी" नहीं होती है। इसलिए, GAVEL-AGENT एक जासूस की तरह काम करता है। पूरे कागजों के ढेर को एक साथ पढ़ने के बजाय (जो महंगा और धीमा है), यह रोबोट को उपकरणों का एक सेट देता है।

    • रोबोट कह सकता है, "मुझे फाइलिंग की तारीख ढूँढनी है," और वह उस विशेष पन्ने पर जाने के लिए एक टूल का उपयोग करता है।
    • वह कह सकता है, "मुझे मोशन को पढ़ना है," और वह केवल उसी फाइल को खोलता है।
    • वह सारांश को टुकड़ों में बनाता है, जैसे एक जासूस सुराग इकट्ठा करता है, न कि पूरी लाइब्रेरी को एक बार में निगलने की कोशिश करता है।

3. बड़ी खोजें: रोबोटों ने कहाँ गलती की

जब शोधकर्ताओं ने 12 अलग-अलग टॉप-टियर रोबोटों का इन विशाल कानूनी मामलों पर परीक्षण किया, तो उन्हें कुछ आश्चर्यजनक बातें पता चलीं:

  • वे झूठ बोलने से ज्यादा भूल जाते हैं: सबसे बड़ी समस्या यह नहीं थी कि रोबोट फर्जी तथ्य बना रहे थे (hallucinations)। सबसे बड़ी समस्या यह थी कि वे महत्वपूर्ण विवरणों को भूल गए। यह एक ऐसे छात्र की तरह है जो सारांश तो लिखता है लेकिन कहानी का सबसे महत्वपूर्ण हिस्सा छोड़ देता है क्योंकि वह थक गया या उसने कोई पन्ना छोड़ दिया।
  • "दुर्लभ" तथ्य कठिन होते हैं: रोबोट उन आसान चीजों को खोजने में माहिर थे, जैसे "मामला कब शुरू हुआ?" लेकिन वे दुर्लभ या जटिल चीजों के साथ संघर्ष करते थे, जैसे "क्या उन्होंने मामले को सुलझा लिया?" या "अंतिम समझौता क्या था?" ये आइटम अक्सर गायब थे।
  • लंबे मामले = खराब स्कोर: जैसे-जैसे कागजों का ढेर मोटा होता गया (32,000 शब्दों से 512,000 शब्दों तक), रोबोट बदतर होते गए। यहाँ तक कि सबसे स्मार्ट रोबोट भी विवरणों को मिस करने लगे क्योंकि काम कठिन होता गया।
  • "जासूसी" दृष्टिकोण पैसा बचाता है: GAVEL-AGENT विधि (वह जासूस जो सुरागों की तलाश करता है) अधिक कुशल थी। इसने उन तरीकों की तुलना में 36% से 77% कम "टोकन" (जो बिजली या पैसे के उपयोग की तरह है) का उपयोग किया, जो एक साथ सब कुछ पढ़ने की कोशिश करते थे, जबकि इसने एक अच्छा ग्रेड भी प्राप्त किया।

4. मानव जाँच (Meta-Evaluation)

यह सुनिश्चित करने के लिए कि उनका ग्रेडिंग सिस्टम (GAVEL) निष्पक्ष था, शोधकर्ताओं ने मनुष्यों से रोबोट के काम को ग्रेड कराने में 160 घंटे बिताए। उन्होंने पाया कि उनका स्वचालित सिस्टम बहुत सटीक था और भविष्य के रोबोटों को ग्रेड देने के लिए उपयोग किया जा सकता है, बिना हर बार इंसानों की जरूरत पड़े।

5. क्या यह कहीं और काम करता है?

शोधकर्ताओं ने "जासूसी" विधि (GAVEL-AGENT) का परीक्षण मेडिकल रिव्यूज (स्वास्थ्य उपचारों के बारे में लंबी रिपोर्ट) पर किया। यह वहां भी उतना ही अच्छा काम करता है, संसाधनों की बचत करता है (77% कम टोकन) जबकि सही तथ्यों को ढूंढ लेता है। यह साबित करता है कि यह तरीका केवल वकीलों के लिए नहीं है; यह लंबे दस्तावेज़ों को पढ़ने के लिए एक सामान्य उपकरण है।

सारांश

संक्षेप में, GAVEL एक नया तरीका है यह परीक्षण करने का कि क्या AI वास्तव में बहुत लंबे, जटिल दस्तावेज़ पढ़ सकता है। अध्ययन से पता चला कि हालांकि वर्तमान AI पढ़ने में अच्छा है, लेकिन यह बहुत अधिक जानकारी (विशेष रूप से जब दस्तावेज़ बहुत बड़े हों) को मिस करने लगता है बजाय इसके कि वह मनगढ़ंत बातें बनाए। हालांकि, एक नया "जासूसी-शैली" वाला दृष्टिकोण जहाँ AI एक-एक करके विशिष्ट तथ्यों की तलाश करता है, इन विशाल कार्यों को संभालने का एक बहुत अधिक स्मार्ट और सस्ता तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →