← नवीनतम पेपर
💬 NLP

CzechDocs: A Multiway Parallel Dataset of Formatted Documents for Minority Languages in Czechia

यह शोध पत्र CzechDocs को प्रस्तुत करता है, जो चेक और अल्पसंख्यक भाषाओं में स्वरूपित (formatted) दस्तावेज़ों का एक मल्टीवे समानांतर डेटासेट है, जिसे उन मशीन अनुवाद प्रणालियों का मूल्यांकन करने और उन्हें उन्नत करने के लिए डिज़ाइन किया गया है जो दस्तावेज़ लेआउट को संरक्षित करने में सक्षम हैं।

मूल लेखक: Josef Jon, Ondřej Bojar

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Josef Jon, Ondřej Bojar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक खूबसूरती से सजाया गया केक है। केक स्वयं वह टेक्स्ट है जिसे आप अनुवादित करना चाहते हैं (इसका "स्वाद"), लेकिन फ्रॉस्टिंग, मोमबत्तियाँ, छोटे झंडे और फैंसी पाइपिंग ही फॉर्मेटिंग टैग्स (जैसे HTML कोड, बोल्ड टेक्स्ट, या लिंक्स) हैं।

लंबे समय तक, जब कंप्यूटर इन केलों को अनुवाद करने की कोशिश करते थे, तो वे अक्सर केक खा जाते थे, सजावट को अनदेखा कर देते थे, और फिर मोमबत्तियों को वापस रखने के लिए अंदाज़ा लगाने की कोशिश करते थे। कभी-कभी वे मोमबत्तियाँ फ्रॉस्टिंग में रख देते थे, कभी प्लेट पर, या कभी वे उन्हें पूरी तरह से भूल जाते थे। इससे अंतिम उत्पाद अव्यवस्थित और टूटा हुआ दिखता था।

CzechDocs एक नया टूल है जिसे चार्ल्स यूनिवर्सिटी के शोधकर्ताओं द्वारा इस समस्या को ठीक करने के लिए बनाया गया है। यहाँ उन्होंने क्या किया और उन्हें क्या मिला, इसका एक सरल विवरण दिया गया है:

1. समस्या: "अर्जेंट केक" (तत्काल आवश्यकता वाला केक)

शोधकर्ताओं ने एक वास्तविक दुनिया की आवश्यकता देखी। जब 2022 में हजारों यूक्रेनी शरणार्थी चेक गणराज्य पहुंचे, तो सरकारी वेबसाइटों, कानूनी फॉर्मों और स्वास्थ्य गाइडों को अनुवादित करने की तत्काल आवश्यकता थी। ये केवल सादा टेक्स्ट नहीं हैं; ये जटिल दस्तावेज़ हैं जिनमें बटन, लिंक और विशिष्ट लेआउट होते हैं। यदि अनुवाद लेआउट को तोड़ देता है, तो जानकारी बेकार या पढ़ने में कठिन हो जाती है।

2. समाधान: एक नया "केक पैन" (डेटासेट)

टीम ने 77 अद्वितीय दस्तावेज़ों (जैसे सरकारी फॉर्म और शैक्षिक मार्गदर्शिकाएँ) का एक विशाल संग्रह बनाया जो एक साथ कई भाषाओं में मौजूद हैं।

  • सामग्री: उन्होंने इन्हें वास्तविक चेक वेबसाइटों से एकत्र किया।
  • फॉर्मेट: दस्तावेज़ तीन आकारों में आते हैं: HTML (वेब पेज), DOCX (वर्ड फ़ाइलें), और PDF (प्रिंटेड ब्रोशर)।
  • भाषाएँ: जबकि मुख्य ध्यान चेक और यूक्रेनी पर है, उन्होंने अंग्रेजी, वियतनामी, रूसी और अन्य भाषाएँ भी शामिल की हैं।
  • जादू: उन्होंने इन दस्तावेज़ों को सावधानीपूर्वक साफ किया ताकि चेक भाषा में प्रत्येक वाक्य का अन्य भाषाओं में एक सटीक मिलान वाला वाक्य हो, जिसमें सटीक समान फॉर्मेटिंग टैग भी शामिल हों। यह एक मास्टर ब्लूप्रिंट होने जैसा है जहाँ सभी संस्करणों में हर मोमबत्ती और फ्रॉस्टिंग का घुमाव पूरी तरह से संरेखित है।

3. प्रयोग: केक कैसे बेक करें?

शोधकर्ताओं ने आधुनिक AI (लार्ज लैंग्वेज मॉडल्स) का उपयोग करके इन "सजाए गए केलों" को अनुवादित करने के दो अलग-अलग तरीकों का परीक्षण करने के लिए इस डेटासेट का उपयोग किया:

  • विधि A: "छीलना और पुनर्गठित करना" (Detag-and-Project)
    कल्पना कीजिए कि आप केक से सारी मोमबत्तियाँ और फ्रॉस्टिंग हटा देते हैं, एक बेकर को सादा केक अनुवाद करने के लिए देते हैं, और फिर एक रोबोटिक हाथ का उपयोग करके उन मोमबत्तियों को ठीक उसी जगह वापस चिपकाने की कोशिश करते हैं जहाँ वे पहले थीं।

    • परिणाम: यह पारंपरिक तरीका है। यह ठीक काम करता है, लेकिन रोबोटिक हाथ कभी-कभी निशाना चूक जाता है।
  • विधि B: "दिखाना और बताना" (Direct Tagged Input)
    कल्पना कीजिए कि आप बेकर को पूरा सजाया हुआ केक देते हैं और कहते हैं, "केक का स्वाद अनुवाद करें, लेकिन कृपया मोमबत्तियों और फ्रॉस्टिंग को बिल्कुल वहीं रहने दें।"

    • परिणाम: शोधकर्ताओं ने परीक्षण किया कि क्या AI पूरे हिस्से को देख सकता है और इसे स्वाभाविक रूप से कर सकता है। उन्होंने पाया कि यदि आप AI को एक विशिष्ट निर्देश (एक "प्रॉम्ट") देते हैं कि वह सजावट के प्रति सावधान रहे, तो वह आश्चर्यजनक रूप से अच्छा काम करता है।

4. निष्कर्ष: सबसे अच्छा केक किसने बनाया?

उन्होंने अपने डेटासेट पर दो अलग-अलग AI "बेकर्स" (एक OpenAI से और एक Cohere से) का परीक्षण किया।

  • फैसला: दोनों विधियाँ अच्छी तरह से काम करती थीं, लेकिन उनकी ताकत अलग-अलग थी।
    • "छीलना और पुनर्गठित करना" विधि सजावट को सही जगह पर वापस लाने में बहुत सुसंगत थी, लेकिन कभी-कभी टेक्स्ट का स्वयं का अनुवाद थोड़ा कम स्वाभाविक था।
    • "दिखाना और बताना" विधि (AI की प्राकृतिक क्षमता का उपयोग करना) ने बहुत उच्च गुणवत्ता वाला टेक्स्ट अनुवाद तैयार किया। जब शोधकर्ताओं ने AI को टैग्स को बनाए रखने के लिए एक विशिष्ट निर्देश दिया, तो इसने बिना किसी रोबोटिक हाथ की मदद के संरचना को सुरक्षित रखने में उत्कृष्ट कार्य किया।
  • आश्चर्य: AI को इसके लिए विशेष रूप से प्रशिक्षित करने की आवश्यकता नहीं थी; इसे बस स्पष्ट रूप से बताया जाना था कि क्या करना है।

5. आगे क्या है?

शोधकर्ताओं ने अपने डेटासेट के "साफ किए गए" भाग (वैलिडेशन सेट) को अन्य वैज्ञानिकों के उपयोग के लिए तुरंत जारी कर दिया है। वे एक "सीक्रेट टेस्ट सेट" (अंतिम परीक्षा) को भविष्य की प्रतियोगिता के लिए सुरक्षित रख रहे हैं जहाँ विभिन्न टीमें यह देखने के लिए प्रतिस्पर्धा करेंगी कि कौन इन सजाए गए दस्तावेज़ों को सबसे अच्छा अनुवाद कर सकता है।

संक्षेप में: उन्होंने उच्च गुणवत्ता वाली वास्तविक दुनिया की बहुभाषी दस्तावेज़ों की एक लाइब्रेरी बनाई है ताकि कंप्यूटर को यह सिखाया जा सके कि फॉर्मेटिंग को तोड़े बिना टेक्स्ट का अनुवाद कैसे किया जाए। उन्होंने पाया कि आधुनिक AI बहुत अच्छा है यदि आप बस उससे सजावट को बरकरार रखने के लिए विनम्रता से कहें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →