← नवीनतम पेपर
💬 NLP

A Fine-Tuned BERT Classifier for Personal-Letter Titles in Late-Ming and Early-Qing Collected Works

यह शोधपत्र लेप्टोन (Lepton) को प्रस्तुत करता है, जो कि तैंतीस उत्तर-मिंग और प्रारंभिक-किंग साहित्यकारों के 5,438 हस्त-लेबल वाले शीर्षकों पर प्रशिक्षित एक फाइन-ट्यून्ड बर्ट (BERT) क्लासिफायर है, जो व्यक्तिगत पत्रों को भ्रमित करने वाले प्रस्तावनाओं से सफलतापूर्वक अलग करता है और जिसे चाइना बायोग्राफिकल डेटाबेस के माध्यम से मिंग लेटर प्लेटफॉर्म के लिए लगभग 55,000 पत्रों की पहचान करने हेतु तैनात किया गया है।

मूल लेखक: Queenie Luo

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Queenie Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, प्राचीन पुस्तकालय में घूम रहे हैं जो हजारों किताबों से भरा हुआ है। ये केवल साधारण किताबें नहीं हैं; ये 1500 के दशक के अंत से 1700 के दशक की शुरुआत तक के प्रसिद्ध चीनी विद्वानों के संकलित कार्य हैं। प्रत्येक पुस्तक में एक विषय-सूची है, शीर्षकों की एक लंबी सूची है। कुछ शीर्षक कविताओं के लिए हैं, कुछ आधिकारिक रिपोर्टों के लिए हैं, और कुछ व्यक्तिगत पत्रों (personal letters) के लिए हैं।

समस्या यह है कि पुस्तकालय इतना बड़ा है कि कोई भी व्यक्ति पत्रों को खोजने के लिए हर एक शीर्षक को पढ़ नहीं सकता। आपको एक ऐसे लाइब्रेरियन की आवश्यकता है जो सूची को स्कैन कर सके और तुरंत कह सके, "यह एक पत्र है," या "यह कुछ और है।"

"एक जैसा दिखने वाला" (The Look-Alike) समस्या

सबसे कठिन काम स्पष्ट पत्रों को खोजना नहीं है। यह एक व्यक्तिगत पत्र और एक विदाई प्रस्तावना (farewell preface) (एक भाषण जो किसी के शहर छोड़ने पर दिया जाता है) के बीच अंतर करना है।

इसे एक "नमस्ते" टेक्स्ट मैसेज और एक "अलविदा" भाषण के बीच अंतर करने की तरह समझें।

  • पुराना तरीका (The Regex): इतिहासकार पहले एक सरल नियम का उपयोग करते थे: "यदि शीर्षक 'पुस्तक' (書) अक्षर के साथ समाप्त होता है, तो यह एक पत्र है।"
    • दोष: यह ऐसा ही है जैसे कहना: "यदि किसी टेक्स्ट मैसेज के अंत में पूर्ण विराम (.) है, तो वह एक प्रेम पत्र है।" यह वास्तविक पत्रों में से 91% को चूक जाता है क्योंकि अधिकांश प्राचीन पत्र शीर्षकों के अंत में उस विशिष्ट अक्षर का उपयोग नहीं करते हैं। वे अक्सर "उत्तर" (Reply) या "भेजें" (Send) जैसे क्रिया शब्दों से शुरू होते हैं।
  • दूसरा पुराना तरीका: "यदि शीर्षक 'उत्तर' (Reply) जैसी क्रिया से शुरू होता है, तो यह एक पत्र है।"
    • दोष: यह बहुत अधिक गलत अलार्म (false alarms) देता है। विदाई भाषण भी "उत्तर" या "भेजें" जैसी क्रियाओं से शुरू होते हैं। यह एक सुरक्षा गार्ड की तरह है जो हर उस व्यक्ति को रोकता है जो "नमस्ते" कहता है, भले ही वह केवल अपने दोस्त को अलविदा कह रहा हो।

समाधान: "लेप्टन" (Lepton - द स्मार्ट लाइब्रेरियन)

लेखिका, क्वीनी लुओ (Queenie Luo) ने एक डिजिटल लाइब्रेरियन बनाया जिसका नाम लेप्टन (Lepton) है।

लेप्टन एक कंप्यूटर प्रोग्राम है जो BERT नामक तकनीक पर आधारित है (इसे एक सुपर-स्मार्ट छात्र के रूप में सोचें जिसने लाखों आधुनिक चीनी वाक्यों को पढ़ा है और सीखा है कि शब्द एक साथ कैसे जुड़ते हैं)। केवल शीर्षक के शुरू या अंत में एक विशिष्ट अक्षर को देखने के बजाय, लेप्टन पूरी तस्वीर को देखता है।

  • इसने कैसे सीखा: लेखिका ने लेप्टन को लगभग 5,400 शीर्षकों वाला एक प्रशिक्षण मैनुअल दिया जिसे मनुष्यों द्वारा मैन्युअल रूप से लेबल किया गया था। कुछ पत्र थे, कुछ विदाई भाषण थे। लेप्टन ने पैटर्न का अध्ययन किया: "आह, जब मैं 'उत्तर' के बाद किसी व्यक्ति का नाम देखता हूँ, तो वह आमतौर पर एक पत्र होता है। जब मैं 'भेजें' के बाद 'प्रस्तावना' देखता हूँ, तो वह एक भाषण होता है।"
  • परिणाम: लेप्टन इस विशिष्ट कार्य के लिए अविश्वसनीय रूप से कुशल बन गया। परीक्षण में, यह लगभग सटीक था। इसने किसी भाषण को पत्र कहने में कोई गलती नहीं की (100% शुद्धता/precision), और यह केवल कुछ ही वास्तविक पत्रों को चूक पाया।

लेप्टन क्या कर सकता है और क्या नहीं कर सकता

यह जानना महत्वपूर्ण है कि यह उपकरण किस काम के लिए बनाया गया है, ठीक वैसे ही जैसे यह जानना कि हथौड़ा कीलों के लिए है, पेंचों के लिए नहीं।

  • यह क्या करता है: यह विषय-सूची में एक शीर्षक को देखता है और निर्णय लेता है: "क्या यह एक व्यक्तिगत पत्र है या एक विदाई भाषण?"
  • यह क्या नहीं करता है:
    • यह पत्र की वास्तविक सामग्री को नहीं पढ़ता है (यह केवल शीर्षक को देखता है)।
    • यह यह नहीं बताता कि पत्र किसे भेजा गया था या कब लिखा गया था।
    • यह मिंग और किंग राजवंशों से बहुत पहले या बहुत बाद के ग्रंथों पर अच्छी तरह से काम नहीं करता है (यह विशेष रूप से उस युग के लिए प्रशिक्षित है)।
    • यह आधिकारिक सरकारी पत्रों और निजी पारिवारिक नोट्स के बीच अंतर नहीं करता है; यह बस जानता है कि वे "पत्र" हैं।

वास्तविक दुनिया का प्रभाव

लेखिका ने लेप्टन को चाइना बायोग्राफिकल डेटाबेस (CBDB) में काम पर लगाया है। इस उपकरण का उपयोग करके, शोधकर्ता हजारों पुस्तकों को स्कैन करने और स्वचालित रूप से लगभग 55,000 व्यक्तिगत पत्र खोजने में सक्षम हुए हैं।

इसने मिंग लेटर प्लेटफॉर्म (Ming Letter Platform) के निर्माण में मदद की है, जो एक डिजिटल संसाधन है जो इतिहासकारों को 500 साल पहले के विद्वानों के सामाजिक नेटवर्क को मैप करने की अनुमति देता है। एक-एक करके शीर्षकों को पढ़ने में वर्षों बिताने के बजाय, अब उनके पास एक मानचित्र है कि किसने किसे लिखा, और यह सब एक डिजिटल लाइब्रेरियन की बदौलत हुआ जिसने "नमस्ते" और "अलविदा" के बीच अंतर करना सीख लिया है।

इसकी एक कमजोरी

लेप्टन जादुई नहीं है। यह परीक्षण में छह विशिष्ट शीर्षकों पर विफल रहा। ये बहुत छोटे, अजीब शीर्षक थे जो सामान्य नियमों का पालन नहीं करते थे (जैसे कि केवल एक व्यक्ति का नाम)। क्योंकि लेप्टन ने "सामान्य" उदाहरणों से सीखा था, इसलिए वह इन अजीबोगरीब मामलों में भ्रमित हो गया और उसने अनुमान लगाया कि वे भाषण थे। यह एक याद दिलाता है कि भले ही कंप्यूटर स्मार्ट हों, वे उन चीजों के साथ संघर्ष कर सकते हैं जो पैटर्न को तोड़ती हैं।

संक्षेप में: यह शोध पत्र एक विशेष AI टूल बनाने का वर्णन करता है जो एक अत्यधिक प्रशिक्षित लाइब्रेरियन के रूप में कार्य करता है, जो हजारों प्राचीन पुस्तक शीर्षकों के माध्यम से तुरंत व्यक्तिगत पत्रों को खोजने में सक्षम है, जिससे एक ऐसी समस्या हल होती है जिसे सरल कीवर्ड खोज (keyword search) नहीं संभाल सकती थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →