← नवीनतम पेपर
💻 computer science

A Dual-Channel Patent Vectorization Method Based on Claim Structure Analysis

यह शोध पत्र एक द्वि-चैनल पेटेंट वेक्टराइजेशन पद्धति का प्रस्ताव करता है जो सिस्टम-स्तरीय और विवरण-स्तरीय अर्थों को अलग-अलग एनकोड करने के लिए क्लेम संरचना विश्लेषण का लाभ उठाता है, जिन्हें फिर डिकोरिलेशन सुधार के साथ एक गेटेड तंत्र के माध्यम से संलयित किया जाता है ताकि मौजूदा फुल-टेक्स्ट बेसलाइन की तुलना में पेटेंट मिलान सटीकता में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Jiangtao Li, Wenlong Feng, Mengxing Huang, Siling Feng, Fu Gao

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiangtao Li, Wenlong Feng, Mengxing Huang, Siling Feng, Fu Gao

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र की व्याख्या दी गई है।

समस्या: "एक ही आकार सबके लिए" वाला पेटेंट सूप

कल्पना कीजिए कि आप एक विशाल कुकबुक में एक विशिष्ट रेसिपी खोजने की कोशिश कर रहे हैं। पेटेंट को पढ़ने के वर्तमान कंप्यूटर तरीकों के साथ समस्या यह है कि वे हर पेटेंट के साथ एक विशाल, अव्यवस्थित 'सूप के कटोरे' जैसा व्यवहार करते हैं। वे पूरे टेक्स्ट को—मुख्य विचार, विशिष्ट सामग्री, पकाने का समय और सुरक्षा चेतावनियों को—एक ही ब्लेंडर में डाल देते हैं।

शोधकर्ताओं का तर्क है कि यह दृष्टिकोण बारीकियों को छोड़ देता है। एक पेटेंट में, स्वतंत्र दावे (Independent Claims) मुख्य रेसिपी की तरह होते हैं (जैसे, "मैदा और अंडे से बना एक केक")। आश्रित दावे (Dependent Claims) विशिष्ट विवरण और प्रतिबंध होते हैं (जैसे, "मैदा जैविक होना चाहिए," या "ओवन का तापमान ठीक 350°F होना चाहिए")।

जब कंप्यूटर इन सबको एक ही "वेक्टर" (टेक्स्ट का एक डिजिटल फिंगरप्रिंट) में मिला देते हैं, तो मुख्य विचार के शोर में विशिष्ट विवरण खो जाते हैं। यह एक "ग्लूटेन-मुक्त केक" की रेसिपी खोजने की कोशिश करने जैसा है, लेकिन कंप्यूटर केवल "केक" की सामान्य अवधारणा को देखता है, जिससे एक मानक केक और एक विशेष केक के बीच अंतर करना कठिन हो जाता है।

समाधान: एक डुअल-चैनल किचन

इसे ठीक करने के लिए, लेखकों (हैनान विश्वविद्यालय के जियांगटाओ ली और उनकी टीम) ने एक नई प्रणाली बनाई जिसे डुअल-चैनल पेटेंट वेक्टराइजेशन मेथड कहा जाता है। पेटेंट टेक्स्ट को प्रोसेस करने के लिए सब कुछ मिलाने के बजाय, उन्होंने दो अलग-अलग "चैनलों" या कन्वेयर बेल्टों की व्यवस्था की।

चैनल 1: "बड़ी तस्वीर" वाला कन्वेयर (ओवरऑल चैनल)

यह चैनल केवल स्वतंत्र दावों (Independent Claims) को देखता है। इसे "कार्यकारी सारांश" (Executive Summary) या "मुख्य व्यंजन" के रूप में सोचें। यह आविष्कार के मूल सिस्टम-स्तरीय विचार को पकड़ता है। यह इस प्रश्न का उत्तर देता है: यह आविष्कार सामान्यतः क्या है?

चैनल 2: "बारीक विवरण" वाला कन्वेयर (लोकल चैनल)

यह चैनल केवल आश्रित दावों (Dependent Claims) को देखता है। इसे "सामग्री की सूची" या "विशेष निर्देश" के रूप में सोचें। यह विशिष्ट प्रतिबंधों, अतिरिक्त विशेषताओं और तकनीकी विवरणों को पकड़ता है। यह इस प्रश्न का उत्तर देता है: इस विशिष्ट संस्करण को क्या अनूठा बनाता है?

सीक्रेट सॉस: एक "स्मार्ट मिक्सर"

केवल दो अलग-अलग चैनल होने से काम नहीं चलेगा; आपको अंतिम परिणाम प्राप्त करने के लिए अभी भी उन्हें जोड़ना होगा। लेकिन यदि आप उन्हें समान रूप से एक साथ डाल देंगे, तो आपको एक गड़बड़ मिश्रण मिल सकता है। लेखकों ने एक डुअल-चैनल गेटेड कॉनकैटेनेशन फ्यूजन मैकेनिज्म डिजाइन किया है।

इसे एक वॉल्यूम नॉब वाले स्मार्ट मिक्सर के रूप में सोचें।

  1. सिग्नल की सफाई (डिकोरिलेशन): मिलाने से पहले, सिस्टम यह जांचता है कि क्या दोनों चैनल एक ही जानकारी दोहरा रहे हैं। यदि "बड़ी तस्वीर" और "बारीक विवरण" एक ही बात कह रहे हैं, तो सिस्टम "बारीक विवरण" चैनल से डुप्लिकेट भागों को घटा देता है। यह सुनिश्चित करता है कि दूसरा चैनल केवल नए विवरण जोड़ रहा है, न कि पहले वाले की केवल प्रतिध्वनि कर रहा है।
  2. माहौल को समझना (फ्यूजन टेंडेंसी): सिस्टम यह तय करने के लिए कि प्रत्येक चैनल को कितना महत्व दिया जाए, विशिष्ट पेटेंट को देखता है।
    • यदि किसी पेटेंट में बहुत कम कीवर्ड हैं जो उसे परिभाषित करते हैं (उच्च "कीवर्ड कंसंट्रेशन"), तो सिस्टम जानता है कि "बड़ी तस्वीर" सबसे महत्वपूर्ण हिस्सा है। वह चैनल 1 का वॉल्यूम बढ़ा देता है।
    • यदि कोई पेटेंट अद्वितीय, दुर्लभ तकनीकी शब्दों (उच्च "टर्म स्पेसिफिसिटी") से भरा है, तो सिस्टम जानता है कि "बारीक विवरण" महत्वपूर्ण है। वह चैनल 2 का वॉल्यूम बढ़ा देता है।
  3. अंतिम मिश्रण (गेटेड कॉनकैटेनेशन): एक गणितीय "गेट" (ट्रैफिक लाइट की तरह) का उपयोग करके, सिस्टम गतिशील रूप से उस विशिष्ट पेटेंट के लिए मुख्य विचार और विशिष्ट विवरण के सटीक अनुपात का निर्णय लेता है। इसके बाद यह उन्हें एक एकल, उच्च-गुणवत्ता वाले डिजिटल फिंगरप्रिंट में मिला देता है।

परिणाम: एक बेहतर सर्च इंजन

शोधकर्ताओं ने एक वास्तविक पेटेंट डेटाबेस का उपयोग करके पुराने तरीकों (जैसे मानक शब्द गणना या सरल टेक्स्ट औसत) के मुकाबले इस नई विधि का परीक्षण किया।

  • उपमा: कल्पना कीजिए कि आप एक विशिष्ट प्रकार की कार खोज रहे हैं।
    • पुराने तरीके: एक जेनेरिक "सेडान" लौटा सकते हैं क्योंकि उन्होंने इस विवरण को मिस कर दिया कि कार में "टर्बोचार्ज्ड V6 इंजन" है।
    • नया तरीका: क्योंकि इसने "मुख्य विचार" (सेडान) और "विवरण" (टर्बो V6) को अलग लेकिन जुड़े हुए रूप में रखा, इसने आपके द्वारा चाही गई सटीक कार को बहुत अधिक सटीकता से खोज लिया।

निष्कर्ष:

  • नया तरीका सही पेटेंट खोजने में बेहतर था (उच्च प्रिसिजन/Precision)।
  • इसने सबसे अच्छे मिलान को सूची में ऊपर रखा (उच्च MAP और NDCG स्कोर)।
  • ऐसा करने के लिए इसने टेक्स्ट को शब्दों के एक सपाट ब्लॉक के रूप में मानने के बजाय, पेटेंट की कानूनी संरचना (स्वतंत्र बनाम आश्रित दावों) का सम्मान किया।

ट्रेड-ऑफ (समझौता)

पेपर नोट करता है कि इस "स्मार्ट मिक्सर" को चलाने में साधारण "ब्लेंडर" विधियों की तुलना में थोड़ा अधिक कंप्यूटिंग पावर और समय लगता है। हालाँकि, लेखक तर्क देते हैं कि अतिरिक्त समय सार्थक है क्योंकि इसके परिणाम बहुत अधिक सटीक और समान तकनीकों को खोजने के लिए उपयोगी हैं।

संक्षेप में: पेपर का प्रस्ताव है कि पेटेंट को समझने के लिए, आपको इसे एक साथ नहीं पढ़ना चाहिए। आपको "मुख्य विचार" को "विशिष्ट नियमों" से अलग करना चाहिए, डुप्लिकेट्स को साफ करना चाहिए, और फिर उन्हें एक स्मार्ट तरीके से मिलाना चाहिए जो दस्तावेज़ के अनुसार अनुकूलित हो सके। इससे इस बात की बहुत स्पष्ट तस्वीर मिलती है कि आविष्कार वास्तव में क्या है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →