← नवीनतम पेपर
💻 computer science

Large Language Models for Patent Classification: Strengths, Trade-offs, and the Long Tail Effect

यह शोध पत्र यह प्रदर्शित करता है कि जहाँ एन्कोडर-आधारित मॉडल सामान्य श्रेणियों पर कुल पेटेंट वर्गीकरण दक्षता और सटीकता में लार्ज लैंग्वेज मॉडल्स (LLMs) से बेहतर प्रदर्शन करते हैं, वहीं LLMs दुर्लभ और उभरती प्रौद्योगिकियों पर श्रेष्ठ प्रदर्शन प्रदान करते हैं, जो यह सुझाव देता है कि व्यापक और जिम्मेदार पेटेंटोमेट्रिक्स के लिए दोनों विधियों को संयोजित करने वाला एक हाइब्रिड दृष्टिकोण इष्टतम है।

मूल लेखक: Lorenzo Emer, Marco Lippi, Andrea Mina, Andrea Vandin

प्रकाशित 2026-02-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lorenzo Emer, Marco Lippi, Andrea Mina, Andrea Vandin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी तस्वीर: एक विशाल पुस्तकालय को छाँटना

कल्प_ना कीजिए कि दुनिया का पेटेंट कार्यालय करोड़ों किताबों (पेटेंट) वाला एक विशाल पुस्तकालय है। हर किताब को विशिष्ट अलमारियों (श्रेणियों) में व्यवस्थित करने की आवश्यकता है ताकि लोग बाद में उन्हें ढूँढ सकें। इस छँटाई प्रणाली को CPC (कोऑपरेटिव पेटेंट क्लासिफिकेशन) कहा जाता है।

समस्या यह है कि पुस्तकालय बिखरा हुआ है। कुछ अलमारियाँ हज़ारों किताबों से भरी हुई हैं (जैसे "स्मार्टफोन" या "बैटरी" जैसी सामान्य तकनीकें), जबकि अन्य अलमारियों में केवल एक या दो किताबें हैं (दुर्लभ, अजीब, या बिल्कुल नई खोजें)।

यह शोध पत्र एक सरल प्रश्न पूछता है: इन किताबों को छाँटने के लिए कौन सा उपकरण बेहतर है?

  1. "विशेषज्ञ लाइब्रेरियन" (एनकोडर मॉडल): ये वे AI मॉडल हैं जिन्हें विशेष रूप से पेटेंट टेक्स्ट पर प्रशिक्षित किया गया है। वे तेज़ हैं, चलाने में सस्ते हैं, और भीड़भाड़ वाली लोकप्रिय अलमारियों की किताबें खोजने में माहिर हैं।
  2. "प्रतिभाशाली सामान्यज्ञ" (लार्ज लैंग्वेज मॉडल्स या LLMs): ये विशाल AI मॉडल हैं (जैसे वे जिनसे आप चैट करते हैं) जिन्होंने इंटरनेट की हर चीज़ पढ़ी है। वे धीमे और चलाने में महंगे हैं, लेकिन वे उन अजीब, अकेली किताबों को खोजने में बेहतर हो सकते हैं जो खाली अलमारियों में पड़ी हैं।

प्रयोग: पेटेंट छाँटने की एक दौड़

शोधकर्ताओं ने 70,000 अमेरिकी पेटेंटों का एक डेटासेट लिया और दोनों प्रकार के AI का उपयोग करके उन्हें छाँटने का प्रयास किया। उन्होंने "प्रतिभाशाली सामान्यज्ञों" का परीक्षण विभिन्न तरीकों से किया:

  • ज़ीरो-शॉट (Zero-shot): बिना किसी मदद के AI से सीधे छाँटने के लिए कहना।
  • फ्यू-शॉट (Few-shot): AI को पहले कुछ उदाहरण देना कि कैसे छाँटना है।
  • RAG (रिट्रीवल-ऑगमेंटेड जनरेशन): AI को छाँटते समय देखने के लिए शेल्फ परिभाषाओं की एक डिक्शनरी देना।

उन्होंने यह भी परीक्षण किया कि क्या "सामान्यज्ञ" को थोड़ा "सिखाना" (फाइन-ट्यूनिंग) मददगार साबित हुआ।

परिणाम: गति बनाम बुद्धिमत्ता

1. लोकप्रिय अलमारियाँ (बार-बार आने वाली श्रेणियाँ)

विजेता: विशेषज्ञ लाइब्रेरियन।
जब आम तकनीकों (जैसे कंप्यूटर के लिए "G06F") की बात आई, तो विशेष AI एक मशीन की तरह काम कर रहा था। यह अविश्वसनीय रूप से सटीक, तेज़ और बहुत कम बिजली का उपयोग करने वाला था।

  • उपमा: यदि आप एक विशेषज्ञ लाइब्रेरियन से "कॉफी" पर एक किताब खोजने के लिए कहते हैं, तो वह इसे तुरंत उठा लेता है। यदि आप एक ऐसे प्रतिभाशाली व्यक्ति से पूछते हैं जो दुनिया के बारे में सब कुछ जानता है लेकिन कभी लाइब्रेरी में काम नहीं किया है, तो उसे थोड़ा अधिक समय लग सकता है और उसका ध्यान "चाय" या "कैफीन" वाली किताब पर भटक सकता है।

2. खाली अलमारियाँ (दुर्लभ श्रेणियाँ)

विजेता: प्रतिभाशाली सामान्यज्ञ।
जब दुर्लभ, उभरती या अजीब तकनीकों (जैसे किसी विशेष प्रकार का पटाखा या एक नई सामग्री) की बात आई, तो विशेषज्ञ लाइब्रेरियन अक्सर हार मान लेता था या किताब को किसी "लगभग सही" अलमारी में रख देता था। हालाँकि, सामान्यज्ञ ने अपनी व्यापक जानकारी का उपयोग करके सही दुर्लभ श्रेणी का अनुमान अधिक बार लगाया।

  • उपमा: यदि आपके पास "उड़ने वाले टोस्टर" के बारे में एक किताब है, तो विशेषज्ञ लाइब्रेरियन उसे "किचन अप्लायंसेज" में रख सकता है क्योंकि अधिकांश टोस्टर वहीं जाते हैं। सामान्यज्ञ, जिसने विज्ञान कथा उपन्यास और इंजीनियरिंग जर्नल पढ़े हैं, यह समझ सकता है कि यह "एविएशन" या "एक्सपेरिमेंटल टेक" में होना चाहिए।

3. व्यवसाय की लागत

सावधानी: सामान्यज्ञ महंगा है।

  • समय: विशेषज्ञ लाइब्रेरियन ने पूरे बैच को 1-2 मिनट में छाँट दिया। सामान्यज्ञ को 30 मिनट से लेकर 4 घंटे तक का समय लगा।
  • ऊर्जा: विशेषज्ञ लाइब्रेरियन ने कुछ मिनटों के लिए एक बल्ब जितनी बिजली का उपयोग किया। सामान्यज्ञ ने इतनी ऊर्जा का उपयोग किया जिससे कुछ समय के लिए एक छोटा घर रोशन किया जा सके।
  • उपमा: विशेषज्ञ लाइब्रेरियन एक डिलीवरी ड्रोन की तरह है: सस्ता, तेज़ और मानक पैकेजों के लिए एकदम सही। सामान्यज्ञ एक देश भर में ट्रक चलाने के लिए विशेषज्ञ सलाहकारों की एक टीम को काम पर रखने जैसा है: वे जटिल समस्याओं को हल कर सकते हैं, लेकिन इसमें गैस और समय का बहुत खर्च आता है।

निष्कर्ष: आपको दोनों की आवश्यकता है

शोध पत्र यह निष्कर्ष निकालता है कि कोई एक "सर्वश्रेष्ठ" उपकरण नहीं है।

  • विशेषज्ञ लाइब्रेरियन का उपयोग करें उन 90% पेटेंटों के लिए जो सामान्य हैं। यह तेज़, सस्ता और पर्याप्त सटीक है।
  • प्रतिभाशाली सामान्यज्ञ का उपयोग करें उन 10% पेटेंटों के लिए जो दुर्लभ, नए या अजीब हैं। यह उन चीजों को पकड़ लेता है जिन्हें दूसरा AI मिस कर देता है, लेकिन आप लागत के कारण इसके लिए सब कुछ नहीं कर सकते।

यह क्यों महत्वपूर्ण है

यदि आप केवल तेज़, सस्ते AI का उपयोग करते हैं, तो आप "अगली बड़ी चीज़" को मिस कर सकते हैं क्योंकि वह बहुत अजीब या दुर्लभ दिख सकती है। यदि आप केवल महंगे AI का उपयोग करते हैं, तो काम पूरा करने से पहले ही आप बिजली के बिलों के कारण दिवालिया हो जाएंगे।

सबसे अच्छा दृष्टिकोण एक हाइब्रिड (मिश्रित) है: भारी काम के लिए तेज़ AI का उपयोग करें, और फिर अजीब, दुर्लभ या उभरते हुए आविष्कारों की दोबारा जाँच करने के लिए स्मार्ट AI को बुलाएं ताकि यह सुनिश्चित हो सके कि कोई महत्वपूर्ण चीज़ खो न जाए।

संक्षेप में: तेज़ काम करने वाले को स्मार्ट काम करने वाले से बदलने की कोशिश न करें। इसके बजाय, तेज़ काम करने वाले को भारी काम करने दें, और केवल कठिन मामलों के लिए स्मार्ट काम करने वाले को बुलाएं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →