← नवीनतम पेपर
💬 NLP

SumTablets: A Transliteration Dataset of Sumerian Tablets

यह शोध पत्र SumTablets प्रस्तुत करता है, जो आधुनिक एनएलपी (NLP) अनुप्रयोगों को सक्षम करने के लिए 91,606 सुमेरियन कीललिपि पट्टिकाओं (cuneiform tablets) को उनके Oracc लिप्यंतरणों (transliterations) के साथ जोड़ने वाला एक व्यापक डेटासेट है, जो यह प्रदर्शित करता है कि फाइन-ट्यून किए गए ऑटोरेग्रेसिव लैंग्वेज मॉडल्स लिप्यंतरण प्रक्रिया को स्वचालित करने में उच्च सटीकता (97.55 chrF) प्राप्त कर सकते हैं।

मूल लेखक: Cole Simmons, Richard Diehl Martinez, Dan Jurafsky

प्रकाशित 2026-02-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cole Simmons, Richard Diehl Martinez, Dan Jurafsky

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास प्राचीन मिट्टी की पट्टिकाओं (clay tablets) का एक विशाल पुस्तकालय है, जो एक ऐसी भाषा में लिखी गई है जिसे 4,000 वर्षों से बोला नहीं गया है। ये पट्टिकाएं त्रिकोणीय निशानों से ढकी हुई हैं जिन्हें क्यूनिफॉर्म (cuneiform) कहा जाता है। एक आधुनिक दृष्टि के लिए, वे अमूर्त कला या एक गुप्त कोड की तरह दिखते हैं।

सदियों से, असीरियोलॉजिस्ट (Assyriologists) नामक विशेषज्ञों को इन मिट्टी की पट्टिकाओं की तस्वीरों को ध्यान से देखते हुए और उन त्रिकोणीय निशानों को हमारे द्वारा उपयोग किए जाने वाले लैटिन वर्णमाला में मैन्युअल रूप से अनुवादित करने के लिए घंटों बैठना पड़ा है। इस प्रक्रिया को ट्रांसलिट्रेशन (transliteration) कहा जाता है। यह प्रक्रिया धीमी, उबाऊ और विशेष प्रशिक्षण के कई वर्षों की मांग करती है।

यह शोध पत्र SumTablets नामक एक नए टूल का परिचय देता है जिसका उद्देश्य खेल को बदलना है। यह इसकी कहानी है कि उन्होंने इसे कैसे किया, जिसे सरल शब्दों में समझाया गया है।

1. समस्या: एक गायब कड़ी

सुमेरियन ग्रंथों के मौजूदा डिजिटल अभिलेखों को दो अलग-अलग किताबों के ढेर के रूप में सोचें:

  • ढेर A: मिट्टी की पट्टिकाओं की उच्च-गुणवत्ता वाली तस्वीरें या डिजिटल चित्र ( "तस्वीरें")।
  • ढेर B: विशेषज्ञों द्वारा उन तस्वीरों के अंग्रेजी जैसे टेक्स्ट में किए गए हस्तलिखित अनुवाद ( "शब्दकोश")।

समस्या क्या है? इन दोनों ढेरों को कभी आपस में जोड़ा नहीं गया। ऐसा कोई एकल डेटासेट नहीं था जो यह दिखा सके कि, "इस विशिष्ट तस्वीर का एक त्रिकोणीय निशान इस विशिष्ट अक्षर के बराबर है।" इस जुड़ाव के बिना, कंप्यूटर खुद तस्वीरों को अनुवादित करना नहीं सीख सकते थे। यह एक रोबोट को नक्शा दिखाने के बिना उसे नक्शा और सड़कों के नाम सिखाने की कोशिश करने जैसा था।

2. समाधान: SumTablets (AI के लिए "रोसेटा स्टोन")

लेखकों ने SumTablets बनाया, जो एक विशाल डेटासेट है जो चित्रों और शब्दों के बीच एक विशाल पुल के रूप में कार्य करता है।

  • पैमाना: उन्होंने 91,606 प्राचीन पट्टिकाएं एकत्र कीं।
  • सामग्री: उन्होंने 6.9 मिलियन से अधिक व्यक्तिगत त्रिकोणीय निशानों (glyphs) को उनके संबंधित अनुवादों के साथ जोड़ा।
  • जादू: उन्होंने केवल कॉपी-पेस्ट नहीं किया; उन्होंने डेटा को साफ किया। उन्होंने विशेषज्ञों द्वारा उपयोग किए जाने वाले अव्यवस्थित नोट्स (जैसे "यह हिस्सा टूटा हुआ है" या "यह हिस्सा गायब है") को विशेष कंप्यूटर कोड में बदल दिया। यह डेटा को इतना "साफ" बनाता है कि कंप्यूटर इससे सीख सके।

SumTablets को AI के लिए एक विशाल फ्लैशकार्ड डेक के रूप में समझें। एक तरफ प्राचीन प्रतीक है; दूसरी तरफ आधुनिक पठन है।

3. उन्होंने कंप्यूटर को कैसे सिखाया (द "शिक्षक" और द "छात्र")

एक बार जब उनके पास फ्लैशकार्ड आ गए, तो उन्होंने कंप्यूटर को अनुवाद करना सिखाने के दो अलग-अलग तरीके आजमाए।

विधि A: "शब्दकोश का अनुमान" (आधार रेखा/Baseline)

कल्पना कीजिए कि आप एक खेल खेल रहे हैं जहाँ आपको एक तस्वीर के आधार पर शब्द का अनुमान लगाना है। आपके पास एक शब्दकोश है जो कहता है, "यह तस्वीर बिल्ली (Cat), बैट (Bat), या चूहा (Rat) हो सकती है।"

  • कंप्यूटर तस्वीर को देखता है।
  • वह शब्दकोश की जांच करता है।
  • वह सबसे आम अनुमान चुनता है कि वह शब्द इतिहास में कितनी बार आया है।
  • परिणाम: इसने लगभग 61% शब्द सही बताए। यह एक ऐसे छात्र की तरह है जिसने शब्दकोश तो रट लिया है लेकिन वाक्य के संदर्भ को नहीं समझता।

विधि B: "सुपर-रीडर" (न्यूरल मॉडल)

यहीं पर यह शोध पत्र रोमांचक हो जाता है। उन्होंने एक ट्रांसफॉर्मर मॉडल (Transformer model) का उपयोग किया (वही प्रकार का AI मस्तिष्क जो ChatGPT जैसे टूल्स के पीछे है)।

  • चुनौती: ये AI मॉडल आमतौर पर 100+ आधुनिक भाषाएं (जैसे फ्रेंच, चीनी और स्पेनिश) बोलते हैं। सुमेरियन एक "भाषा अलगाव" (language isolate) है—इसका कोई जीवित संबंधी नहीं है। यह एक बहुभाषी को एक ऐसी भाषा बोलने के लिए सिखाने जैसा है जो पूरी तरह से एक अलग ग्रह से है।
  • चाल: शोधकर्ताओं ने AI को शून्य से नहीं सिखाया। उन्होंने एक ऐसा मॉडल लिया जो पहले से ही कई भाषाओं में व्याकरण और वाक्य संरचना को समझना जानता था, और उन्होंने इसे अपने SumTablets फ्लैशकार्ड का उपयोग करके "फाइन-ट्यून" (fine-tuned) किया।
  • परिणाम: AI ने त्रिकोणीय निशानों के एक क्रम को देखना और 97.5% सटीकता के साथ अनुवाद की भविष्यवाणी करना सीख लिया।

4. यह क्यों महत्वपूर्ण है

वर्तमान असीरियोलॉजी की स्थिति को एक ऐसी दुनिया के रूप में सोचें जहाँ केवल मुट्ठी भर लोग प्राचीन मानचित्र पढ़ सकते हैं, और उन्हें हर सड़क को हाथ से बनाना पड़ता है।

  • SumTablets से पहले: एक विशेषज्ञ एक पट्टिका का मैन्युअल रूप से अनुवाद करने में 3 घंटे बिताता है।
  • SumTablets के साथ: AI सेकंडों में एक ड्राफ्ट अनुवाद तैयार कर सकता है। विशेषज्ञ फिर केवल एक प्रूफरीडर (proofreader) के रूप में कार्य करता है, जो काम को शुरू से करने के बजाय गलतियों के लिए AI के काम की जांच करता है।

यह विशेषज्ञों की जगह नहीं लेता है; यह उन्हें एक सुपरपावर देता है। यह उन्हें उबाऊ, दोहराव वाले काम से मुक्त करता है ताकि वे अधिक दिलचस्प चीजों पर ध्यान केंद्रित कर सकें: प्राचीन दुनिया के इतिहास, राजनीति और कहानियों को समझना।

निष्कर्ष

लेखकों ने प्राचीन सुमेरियन चित्रों को उनके आधुनिक अनुवादों से जोड़ने वाला पहला विशाल, स्वच्छ डेटासेट बनाया। उन्होंने साबित किया कि एक मृत, अद्वितीय भाषा के लिए, जिसके बहुत कम वक्ता हैं, आधुनिक AI इसे लगभग पूरी तरह से पढ़ना सीख सकता है।

यह दुनिया के सर्वश्रेष्ठ पुरातत्वविदों को ऐसे चश्मे देने जैसा है जो प्राचीन मिट्टी के निशानों को तुरंत पठनीय टेक्स्ट में बदल देते हैं, जिससे वे इतिहास को खोजने में अधिक समय बिता पाते हैं और कोड को समझने में कम।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →