SumTablets: A Transliteration Dataset of Sumerian Tablets
यह शोध पत्र SumTablets प्रस्तुत करता है, जो आधुनिक एनएलपी (NLP) अनुप्रयोगों को सक्षम करने के लिए 91,606 सुमेरियन कीललिपि पट्टिकाओं (cuneiform tablets) को उनके Oracc लिप्यंतरणों (transliterations) के साथ जोड़ने वाला एक व्यापक डेटासेट है, जो यह प्रदर्शित करता है कि फाइन-ट्यून किए गए ऑटोरेग्रेसिव लैंग्वेज मॉडल्स लिप्यंतरण प्रक्रिया को स्वचालित करने में उच्च सटीकता (97.55 chrF) प्राप्त कर सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास प्राचीन मिट्टी की पट्टिकाओं (clay tablets) का एक विशाल पुस्तकालय है, जो एक ऐसी भाषा में लिखी गई है जिसे 4,000 वर्षों से बोला नहीं गया है। ये पट्टिकाएं त्रिकोणीय निशानों से ढकी हुई हैं जिन्हें क्यूनिफॉर्म (cuneiform) कहा जाता है। एक आधुनिक दृष्टि के लिए, वे अमूर्त कला या एक गुप्त कोड की तरह दिखते हैं।
सदियों से, असीरियोलॉजिस्ट (Assyriologists) नामक विशेषज्ञों को इन मिट्टी की पट्टिकाओं की तस्वीरों को ध्यान से देखते हुए और उन त्रिकोणीय निशानों को हमारे द्वारा उपयोग किए जाने वाले लैटिन वर्णमाला में मैन्युअल रूप से अनुवादित करने के लिए घंटों बैठना पड़ा है। इस प्रक्रिया को ट्रांसलिट्रेशन (transliteration) कहा जाता है। यह प्रक्रिया धीमी, उबाऊ और विशेष प्रशिक्षण के कई वर्षों की मांग करती है।
यह शोध पत्र SumTablets नामक एक नए टूल का परिचय देता है जिसका उद्देश्य खेल को बदलना है। यह इसकी कहानी है कि उन्होंने इसे कैसे किया, जिसे सरल शब्दों में समझाया गया है।
1. समस्या: एक गायब कड़ी
सुमेरियन ग्रंथों के मौजूदा डिजिटल अभिलेखों को दो अलग-अलग किताबों के ढेर के रूप में सोचें:
- ढेर A: मिट्टी की पट्टिकाओं की उच्च-गुणवत्ता वाली तस्वीरें या डिजिटल चित्र ( "तस्वीरें")।
- ढेर B: विशेषज्ञों द्वारा उन तस्वीरों के अंग्रेजी जैसे टेक्स्ट में किए गए हस्तलिखित अनुवाद ( "शब्दकोश")।
समस्या क्या है? इन दोनों ढेरों को कभी आपस में जोड़ा नहीं गया। ऐसा कोई एकल डेटासेट नहीं था जो यह दिखा सके कि, "इस विशिष्ट तस्वीर का एक त्रिकोणीय निशान इस विशिष्ट अक्षर के बराबर है।" इस जुड़ाव के बिना, कंप्यूटर खुद तस्वीरों को अनुवादित करना नहीं सीख सकते थे। यह एक रोबोट को नक्शा दिखाने के बिना उसे नक्शा और सड़कों के नाम सिखाने की कोशिश करने जैसा था।
2. समाधान: SumTablets (AI के लिए "रोसेटा स्टोन")
लेखकों ने SumTablets बनाया, जो एक विशाल डेटासेट है जो चित्रों और शब्दों के बीच एक विशाल पुल के रूप में कार्य करता है।
- पैमाना: उन्होंने 91,606 प्राचीन पट्टिकाएं एकत्र कीं।
- सामग्री: उन्होंने 6.9 मिलियन से अधिक व्यक्तिगत त्रिकोणीय निशानों (glyphs) को उनके संबंधित अनुवादों के साथ जोड़ा।
- जादू: उन्होंने केवल कॉपी-पेस्ट नहीं किया; उन्होंने डेटा को साफ किया। उन्होंने विशेषज्ञों द्वारा उपयोग किए जाने वाले अव्यवस्थित नोट्स (जैसे "यह हिस्सा टूटा हुआ है" या "यह हिस्सा गायब है") को विशेष कंप्यूटर कोड में बदल दिया। यह डेटा को इतना "साफ" बनाता है कि कंप्यूटर इससे सीख सके।
SumTablets को AI के लिए एक विशाल फ्लैशकार्ड डेक के रूप में समझें। एक तरफ प्राचीन प्रतीक है; दूसरी तरफ आधुनिक पठन है।
3. उन्होंने कंप्यूटर को कैसे सिखाया (द "शिक्षक" और द "छात्र")
एक बार जब उनके पास फ्लैशकार्ड आ गए, तो उन्होंने कंप्यूटर को अनुवाद करना सिखाने के दो अलग-अलग तरीके आजमाए।
विधि A: "शब्दकोश का अनुमान" (आधार रेखा/Baseline)
कल्पना कीजिए कि आप एक खेल खेल रहे हैं जहाँ आपको एक तस्वीर के आधार पर शब्द का अनुमान लगाना है। आपके पास एक शब्दकोश है जो कहता है, "यह तस्वीर बिल्ली (Cat), बैट (Bat), या चूहा (Rat) हो सकती है।"
- कंप्यूटर तस्वीर को देखता है।
- वह शब्दकोश की जांच करता है।
- वह सबसे आम अनुमान चुनता है कि वह शब्द इतिहास में कितनी बार आया है।
- परिणाम: इसने लगभग 61% शब्द सही बताए। यह एक ऐसे छात्र की तरह है जिसने शब्दकोश तो रट लिया है लेकिन वाक्य के संदर्भ को नहीं समझता।
विधि B: "सुपर-रीडर" (न्यूरल मॉडल)
यहीं पर यह शोध पत्र रोमांचक हो जाता है। उन्होंने एक ट्रांसफॉर्मर मॉडल (Transformer model) का उपयोग किया (वही प्रकार का AI मस्तिष्क जो ChatGPT जैसे टूल्स के पीछे है)।
- चुनौती: ये AI मॉडल आमतौर पर 100+ आधुनिक भाषाएं (जैसे फ्रेंच, चीनी और स्पेनिश) बोलते हैं। सुमेरियन एक "भाषा अलगाव" (language isolate) है—इसका कोई जीवित संबंधी नहीं है। यह एक बहुभाषी को एक ऐसी भाषा बोलने के लिए सिखाने जैसा है जो पूरी तरह से एक अलग ग्रह से है।
- चाल: शोधकर्ताओं ने AI को शून्य से नहीं सिखाया। उन्होंने एक ऐसा मॉडल लिया जो पहले से ही कई भाषाओं में व्याकरण और वाक्य संरचना को समझना जानता था, और उन्होंने इसे अपने SumTablets फ्लैशकार्ड का उपयोग करके "फाइन-ट्यून" (fine-tuned) किया।
- परिणाम: AI ने त्रिकोणीय निशानों के एक क्रम को देखना और 97.5% सटीकता के साथ अनुवाद की भविष्यवाणी करना सीख लिया।
4. यह क्यों महत्वपूर्ण है
वर्तमान असीरियोलॉजी की स्थिति को एक ऐसी दुनिया के रूप में सोचें जहाँ केवल मुट्ठी भर लोग प्राचीन मानचित्र पढ़ सकते हैं, और उन्हें हर सड़क को हाथ से बनाना पड़ता है।
- SumTablets से पहले: एक विशेषज्ञ एक पट्टिका का मैन्युअल रूप से अनुवाद करने में 3 घंटे बिताता है।
- SumTablets के साथ: AI सेकंडों में एक ड्राफ्ट अनुवाद तैयार कर सकता है। विशेषज्ञ फिर केवल एक प्रूफरीडर (proofreader) के रूप में कार्य करता है, जो काम को शुरू से करने के बजाय गलतियों के लिए AI के काम की जांच करता है।
यह विशेषज्ञों की जगह नहीं लेता है; यह उन्हें एक सुपरपावर देता है। यह उन्हें उबाऊ, दोहराव वाले काम से मुक्त करता है ताकि वे अधिक दिलचस्प चीजों पर ध्यान केंद्रित कर सकें: प्राचीन दुनिया के इतिहास, राजनीति और कहानियों को समझना।
निष्कर्ष
लेखकों ने प्राचीन सुमेरियन चित्रों को उनके आधुनिक अनुवादों से जोड़ने वाला पहला विशाल, स्वच्छ डेटासेट बनाया। उन्होंने साबित किया कि एक मृत, अद्वितीय भाषा के लिए, जिसके बहुत कम वक्ता हैं, आधुनिक AI इसे लगभग पूरी तरह से पढ़ना सीख सकता है।
यह दुनिया के सर्वश्रेष्ठ पुरातत्वविदों को ऐसे चश्मे देने जैसा है जो प्राचीन मिट्टी के निशानों को तुरंत पठनीय टेक्स्ट में बदल देते हैं, जिससे वे इतिहास को खोजने में अधिक समय बिता पाते हैं और कोड को समझने में कम।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।