← नवीनतम पेपर
💬 NLP

Chunking German Legal Code

यह शोधपत्र यह प्रदर्शित करता है कि जर्मन वैधानिक कानून पर रिट्रीवल-ऑगमेंटेड जनरेशन के लिए, दस्तावेज़ की अंतर्निहित संरचनात्मक इकाइयों (जैसे कि अनुभागों और उप-अनुभागों) के अनुरूप चंकिंग रणनीतियाँ, अधिक जटिल सिमेंटिक या पदानुक्रमित विधियों की तुलना में उच्च रिकॉल और अधिक कम्प्यूटेशनल दक्षता प्राप्त करके बेहतर प्रदर्शन करती हैं।

मूल लेखक: Max Prior, Natalia Milanova, Andreas Schultz

प्रकाशित 2026-05-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Max Prior, Natalia Milanova, Andreas Schultz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कानूनों के एक विशाल, सदियों पुराने पुस्तकालय (जर्मन सिविल कोड, या BGB) में एक विशिष्ट नियम खोजने की कोशिश कर रहे हैं: (एक सुपर-स्मार्ट AI लाइब्रेरियन (एक Large Language Model) है जो आपके सवालों के जवाब दे सकता है, लेकिन उसका ध्यान बहुत कम समय के लिए रहता है। यदि आप उसे पूरा पुस्तकालय थमा देते हैं, तो वह भ्रमित हो जाता है, बीच के हिस्सों को भूल जाता है, या मनगढ़ंत बातें बनाने लगता है।)

इसे ठीक करने के लिए, आपको पुस्तकालय की किताबों को छोटे, प्रबंधनीय "टुकड़ों" (chunks) में काटना होगा ताकि AI जल्दी से वह सटीक पृष्ठ ढूंढ सके जिसकी उसे आवश्यकता है। यह शोध पत्र यह देखने के लिए एक परीक्षण है कि किताबों को काटने का कौन सा तरीका सबसे अच्छा काम करता है।

यहाँ उनके प्रयोग और निष्कर्षों का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

समस्या: केक को काटने का तरीका

शोधकर्ताओं ने AI को कानूनी पाठ खिलाने के लिए टेक्स्ट को काटने के विभिन्न तरीकों का परीक्षण किया:

  1. "वकील का तरीका" (संरचना-आधारित - Structure-Based): टेक्स्ट को ठीक वहीं काटना जहाँ कानून निर्माताओं ने इसे काटा था—यानी अनुभागों (Sections) और उप-अनुभागों (Subsections) के आधार पर। यह एक केक को उन पहले से बने निशानों के साथ काटने जैसा है जो बेकर ने बनाए थे।
  2. "रोबोट का तरीका" (निश्चित विंडो - Fixed Windows): टेक्स्ट को शब्दों के समान आकार के ब्लॉकों में काटना, यह अनदेखा करते हुए कि वाक्य या नियम कहाँ समाप्त होते हैं। यह एक कुकी कटर का उपयोग करके केक के टुकड़े करने जैसा है; आप एक नियम को बीच से ही काट सकते हैं, जिससे नियम का "ऊपरी हिस्सा" एक प्लेट पर रह जाता है और "निचला हिस्सा" दूसरी प्लेट पर।
  3. "स्मार्ट AI" का तरीका (संदर्भगत/Lumber/RAPTOR): एक सुपर-इंटेलिजेंट AI का उपयोग करना जो अर्थ के आधार पर टेक्स्ट को पढ़ने और काटने का निर्णय ले सके, या दूर-दूर स्थित समान विचारों को एक साथ समूहबद्ध कर सके। यह एक शेफ की तरह है जो अलग-अलग रेसिपी से सामग्री को नए "फ्लेवर बंडल्स" में पुनर्गठित करता है।

प्रयोग

उन्होंने आम लोगों के 525 वास्तविक जीवन के प्रश्न लिए (जैसे "मैं अपनी सुरक्षा जमा राशि (security deposit) वापस कब प्राप्त कर सकता हूँ?") और सिस्टम से सही कानूनी अनुभाग खोजने के लिए कहा। उन्होंने तीन चीजों को मापा:

  • रिकॉल (Recall): क्या सिस्टम ने सही उत्तर ढूँढा?
  • गति (Speed): इसने कितनी तेज़ी से उत्तर ढूँढा?
  • लागत (Cost): पुस्तकालय को व्यवस्थित करने में कितना समय और कंप्यूटर मेमोरी लगी?

परिणाम: इसे सरल रखें

निष्कर्ष आश्चर्यजनक रूप से सीधे थे:

1. "वकील का तरीका" दौड़ जीत गया
वे तरीके जिन्होंने कानून की मूल संरचना का सम्मान किया (अनुभागों और उप-अनुभागों द्वारा काटना) सबसे सटीक थे।

  • क्यों? कानून एक पदानुक्रम (hierarchy) की तरह लिखे जाते हैं। एक "अनुभाग" आमतौर पर एक पूर्ण विचार या नियम होता है। जब आप ठीक वहीं काटते हैं जहाँ कानून निर्माताओं ने काटा था, तो आप "शर्त" (यदि X होता है) और "परिणाम" (तो Y होता है) को एक साथ रखते हैं।
  • उपमा: यदि आप "चॉकलेट केक की रेसिपी" मांग रहे हैं, तो आप पूरी रेसिपी कार्ड चाहते हैं, न कि केवल सामग्री की आधी सूची और पकाने के निर्देशों का आधा हिस्सा।

2. "रोबोट का तरीका" विफल रहा
टेक्स्ट को निश्चित आकार के टुकड़ों में काटना (कानूनी संरचना को अनदेखा करते हुए) सबसे खराब प्रदर्शन करने वाला तरीका था।

  • क्यों? इसने अक्सर एक नियम को बीच में ही काट दिया। AI नियम का "यदि" वाला हिस्सा देख पाता था लेकिन "तब" वाला हिस्सा मिस कर देता था क्योंकि वह अगले टुकड़े में होता था।
  • उपमा: यह एक वाक्य पढ़ने जैसा है जो कहता है, "यदि आप तेज़ गाड़ी चलाते हैं, तो आप..." और फिर अगला पृष्ठ शुरू होता है "...चालान कटवा लेंगे।" यदि AI केवल पहला आधा हिस्सा देखता है, तो उसे परिणाम का पता नहीं चलता।

3. "स्मार्ट AI" के तरीके ज़रूरत से ज़्यादा (Overkill) थे
ऐसे तरीके जिन्होंने समान विचारों को समूहबद्ध करने या अध्यायों का सारांश बनाने के लिए जटिल AI का उपयोग किया (जैसे RAPTOR या Lumber-शैली का चंकिंग), वे साधारण संरचनात्मक कट की तुलना में बेहतर प्रदर्शन नहीं कर सके। वास्तव में, वे अक्सर बदतर थे।

  • क्यों? "वाइब" या विषय के आधार पर अलग-अलग नियमों को एक साथ समूहबद्ध करके, AI ने सीमाओं को धुंधला कर दिया। एक विशिष्ट कानूनी अपवाद एक सामान्य सारांश में खो गया।
  • उपमा: कल्पना कीजिए कि एक लाइब्रेरियन सभी "पैसे" से संबंधित पुस्तकों को एक साथ रखता है। यदि आप एक विशिष्ट टैक्स नियम के बारे में पूछते हैं, तो लाइब्रेरियन आपको एक विशाल बाइंडर थमा देता है जिसमें "पैसे" से संबंधित हर कानून है। आपको उस एक नियम को खोजने के लिए पूरे बाइंडर को खोजना होगा। आपको बस वह विशिष्ट पृष्ठ थमा देना बेहतर है।

4. दक्षता मायने रखती है
जटिल AI तरीकों को सेट करने में बहुत लंबा समय (घंटों या दिनों तक) लगा और उन्हें बहुत अधिक कंप्यूटर मेमोरी की आवश्यकता थी। सरल "वकील का तरीका" सेट करने में तेज़ था और स्टोर करने में सस्ता था।

  • समझौता (Trade-off): फैंसी तरीकों ने संदर्भ जोड़ने के लिए "स्मार्ट" होने की कोशिश की, लेकिन वे सरल संरचनात्मक कट की तुलना में धीमे, महंगे और कम सटीक साबित हुए।

मुख्य निष्कर्ष (The Bottom Line)

कानूनी कोड के साथ काम करते समय, संरचना ही सर्वोपरि है।

शोध पत्र निष्कर्ष निकालता है कि आपको एक कानून पुस्तकालय को व्यवस्थित करने के लिए एक अत्यंत जटिल AI की आवश्यकता नहीं है। कानून निर्माताओं ने पहले से ही नियमों को तार्किक अनुभागों में व्यवस्थित करने का कठिन कार्य कर दिया है। सबसे अच्छी रणनीति यह है कि AI बस उन मूल सीमाओं का सम्मान करे। टेक्स्ट को अलग तरह से काटने या विषयों के आधार पर विचारों को समूहबद्ध करने के माध्यम से संगठन को "सुधारने" की कोशिश करना वास्तव में AI को सही उत्तर खोजने में धीमा और कम सटीक बना देता है।

संक्षेप में: पहिए का पुनरुद्धार (reinvent the wheel) न करें। यदि कानून अध्यायों और अनुभागों में लिखा गया है, तो AI को अध्यायों और अनुभागों द्वारा खोजने दें। यह तेज़ है, सस्ता है, और अधिक बार सही उत्तर देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →