← नवीनतम पेपर
💬 NLP

Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge Augmentation

यह शोध पत्र एक एजेंट-संचालित विजन-लैंग्वेज मॉडल फ्रेमवर्क प्रस्तावित करता है जिसे OB-Radix नामक एक नए विशेषज्ञ-एनोटेटेड डेटासेट द्वारा संवर्धित किया गया है ताकि बार-बार आने वाले चित्रात्मक घटकों के हस्तांतरणीय अर्थों का लाभ उठाकर अधिक सटीक और भाषाई रूप से सटीक परिणामों के माध्यम से ओरेकल बोन स्क्रिप्ट (Oracle Bone Script) के डिकोडिंग में व्याख्या अंतराल को पाटा जा सके।

मूल लेखक: Jianing Zhang, Runan Li, Honglin Pang, Ding Xia, Zhou Zhu, Qian Zhang, Chuntao Li, Xi Yang

प्रकाशित 2026-04-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianing Zhang, Runan Li, Honglin Pang, Ding Xia, Zhou Zhu, Qian Zhang, Chuntao Li, Xi Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसे संदेश को पढ़ने की कोशिश कर रहे हैं जो एक ऐसी भाषा में लिखा गया है जिसे 3,000 वर्षों से बोला नहीं गया है। यह लेखन "A" या "B" जैसे अक्षरों से नहीं बना है, बल्कि कछुए के कवच और जानवरों की हड्डियों पर उकेरी गई छोटी, प्राचीन आकृतियों से बना है। यह ओरेकल बोन स्क्रिप्ट (OBS) है, जो चीनी लेखन का सबसे पुराना रूप है।

समस्या क्या है? केवल एक-तिहाई प्राचीन आकृतियों को ही समझा जा सका है। बाकी सब एक रहस्य हैं। ऐसा क्यों है? क्योंकि प्राचीन लिपिकों ने केवल यादृच्छिक चित्र नहीं बनाए थे; उन्होंने छोटे, पुन: उपयोग करने योग्य "बिल्डिंग ब्लॉक्स" (जैसे एक व्यक्ति के लिए स्टिक फिगर, एक जंगल के लिए पेड़, या युद्ध के लिए भाला) से जटिल पात्रों का निर्माण किया था।

वर्तमान AI इन पूरे पात्रों के अर्थ का अनुमान लगाने की कोशिश करता है, जैसे कि केवल कवर आर्ट को देखकर किसी फिल्म के कथानक का अनुमान लगाना। यह अक्सर विफल हो जाता है क्योंकि यह उनके बिल्डिंग ब्लॉक्स के "व्याकरण" को नहीं समझता है।

यह शोध पत्र AI को इन प्राचीन ग्रंथों को पढ़ना सिखाने का एक स्मार्ट तरीका प्रस्तावित करता है। उन्होंने इसे कैसे किया, यहाँ सरल भाषा में समझाया गया है:

1. नया "लेगो" डेटासेट (OB-Radix)

कल्पना कीजिए कि आपके पास 1,000 अलग-अलग लेगो सेट्स का एक बॉक्स है, लेकिन आपने कभी उनके निर्देश नहीं देखे हैं। पिछले AI मॉडल केवल ईंटों के ढेर को देखकर यह अनुमान लगाने की कोशिश करते थे कि अंतिम किला कैसा दिखता होगा।

शोधकर्ताओं ने OB-Radix नामक एक नया डेटासेट बनाया। इसे एक विशाल, विशेषज्ञ-लिखित निर्देश पुस्तिका के रूप में समझें। केवल तैयार लेगो किले को दिखाने के बजाय, उन्होंने प्रत्येक पात्र को उसके व्यक्तिगत "ईंटों" (घटकों) में तोड़ दिया और लिखा कि प्रत्येक ईंट का क्या अर्थ है।

  • ईंट: एक पेड़ का चित्र।
  • अर्थ: "जंगल" या "लकड़ी"।
  • संबंध: यदि आप एक "पेड़" की ईंट को एक "व्यक्ति" की ईंट के बगल में देखते हैं, तो इसका अर्थ "छाया में आराम करता हुआ व्यक्ति" हो सकता है।

उन्होंने यह सुनिश्चित करने के लिए पुरातत्व विशेषज्ञों के साथ सैकड़ों घंटे बिताए कि ये "निर्देश" 100% सटीक हों।

2. डिटेक्टिव एजेंट (AI फ्रेमवर्क)

AI को अंधाधुंध अनुमान लगाने देने के बजाय, शोधकर्ताओं ने एक डिजिटल डिटेक्टिव टीम बनाई। यह टीम केवल चित्र को नहीं देखती; यह एक सख्त जांच प्रक्रिया का पालन करती है:

  • चरण 1: आँख (विजुअल ग्राउंडिंग): AI प्राचीन ड्राइंग को देखता है और उसके भीतर विशिष्ट "ईंटों" (घटकों) की पहचान करता है। वह पूछता है, "क्या वह एक व्यक्ति है? क्या वह एक हथियार है?"
  • चरण 2: लाइब्रेरियन (नॉलेज रिट्रीवल): एक बार जब ईंटों की पहचान हो जाती है, तो AI अनुमान नहीं लगाता। वह अपने "लाइब्रेरी" (नॉलेज ग्राफ) की ओर दौड़ता है और उन विशिष्ट ईंटों के लिए विशेषज्ञ नोट्स निकालता है। वह सीखता है, "ठीक है, इस ईंट का अर्थ 'व्यक्ति' है, और उस दूसरे का 'भाला'।"
  • चरण 3: डिटेक्टिव (रीजनिंग): अब, AI सुरागों को जोड़ने वाले एक जासूस की तरह कार्य करता है। वह पूछता है, "यदि एक व्यक्ति भाला पकड़े हुए है, तो इसका क्या अर्थ हो सकता है? शायद 'युद्ध'? शायद 'शिकार'?" वह केवल पैटर्न मिलान नहीं, बल्कि तर्क का उपयोग करता है।
  • चरण 4: रिपोर्टर (जेनरेशन): अंत में, AI अपने निष्कर्ष की व्याख्या करते हुए एक रिपोर्ट लिखता है, जिसमें साक्ष्य के रूप में मिली हुई "ईंटों" का उल्लेख करता है।

3. यह गेम-चेंजर क्यों है

शोधकर्ताओं ने इस "डिटेक्टिव टीम" का परीक्षण मानक AI मॉडल के विरुद्ध किया।

  • पुराना तरीका (बेसलाइन): AI पूरी छवि को देखता था और अनुमान लगाता था, "यह 'फसल' जैसा दिखता है।" (यह अक्सर गलत होता था क्योंकि यह विवरणों को छोड़ देता था)।
  • नया तरीका (यह शोध पत्र): AI कहता, "मैं एक 'व्यक्ति' की ईंट और एक 'पेड़' की ईंट देख रहा हूँ। हमारे विशेषज्ञ मैनुअल के अनुसार, पेड़ के नीचे एक व्यक्ति का अर्थ है 'आराम करना'। इसलिए, इस पात्र का अर्थ है 'आराम करना'।"

परिणाम प्रभावशाली थे। नया सिस्टम न केवल अधिक बार सही उत्तर देता था; बल्कि यह अपने तर्क की व्याख्या भी कर सकता था, ठीक वैसे ही जैसे एक मानव विशेषज्ञ करता है। यह अंग्रेजी में अर्थों का अनुवाद करने में भी बेहतर काम करता था, जिससे सिद्ध हुआ कि इसने केवल चीनी शब्दों को ही नहीं, बल्कि भाषा के तर्क को भी समझ लिया है।

निचोड़

यह शोध पत्र एक ऐसे AI को देने जैसा है जिसके पास ऐसे चश्मे हैं जो उसे प्राचीन लेखन की "शारीरिक रचना" (anatomy) देखने में मदद करते हैं। इन रहस्यमय चित्रों को अटूट पहेली के रूप में देखने के बजाय, अब AI समझता है कि वे छोटे, अर्थपूर्ण भागों से बने हैं। एक विजुअल आँख, एक तार्किक मस्तिष्क और विशेषज्ञ ज्ञान की एक विशाल लाइब्रेरी को जोड़कर, हम अंततः मानवता की सबसे पुरानी भाषाओं में से एक के रहस्यों को खोलने के करीब पहुँच रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →