← नवीनतम पेपर
🤖 AI

Align and Shine: Building High-Quality Sentence-Aligned Corpora for Multilingual Text Simplification

यह शोध पत्र क्राउड-सोर्स्ड तुलनीय डेटा को संसाधित करने और वाक्य-स्तर के संरेखण तंत्र को लागू करने के माध्यम से कैटलन, अंग्रेजी, फ्रेंच, इतालवी और स्पेनिश के लिए टेक्स्ट सरलीकरण हेतु एक सार्वजनिक रूप से उपलब्ध, उच्च-गुणवत्ता वाला, वाक्य-संरेखित बहुभाषी संग्रह (कॉर्पस) बनाने की एक कार्यप्रणाली प्रस्तुत करता है।

मूल लेखक: Kenji Hilasaca, Nouran Khallaf, Serge Sharoff

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kenji Hilasaca, Nouran Khallaf, Serge Sharoff

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास जटिल, वयस्क-स्तरीय विश्वकोश लेखों (विकिपीडिया) का एक विशाल पुस्तकालय है और उसी भाषा में लिखे गए बच्चों के विश्वकोश लेखों (विकिडिया) का एक छोटा, सरल पुस्तकालय है। दोनों पुस्तकालय समान विषयों पर कवर करते हैं, लेकिन बच्चों के संस्करण छोटे, पढ़ने में आसान और सरल शब्दों वाले हैं।

इस शोध पत्र का लक्ष्य इन दोनों पुस्तकालयों के बीच एक परफेक्ट मैचिंग गेम बनाना है। शोधकर्ता प्रत्येक वाक्य को उसके अनुरूप "बाल संस्करण" के साथ जोड़ने (pair करने) का प्रयास कर रहे हैं ताकि कंप्यूटर यह सीख सके कि कठिन पाठ को सरल पाठ में कैसे बदला जाए।

यहाँ उन्होंने इसे सरल भाषा में समझाया है:

1. समस्या: "जिग्सॉ पहेली" टूटी हुई है

आमतौर पर, यदि आप चाहते हैं कि कंप्यूटर को टेक्स्ट को सरल बनाना सिखाया जाए, तो आपको एक ऐसी सूची की आवश्यकता होती है जहाँ हर जटिल वाक्य को उसके सरल संस्करण के साथ पूरी तरह से जोड़ा गया हो। लेकिन अधिकांश भाषाओं (जैसे कैटलन, स्पैनिश या इतालवी) के लिए ऐसी सूचियाँ मौजूद नहीं हैं।

शोधकर्ताओं ने वयस्क और बच्चों के लेखों को आपस में मिलाने की कोशिश करके अपनी खुद की सूची बनाने का प्रयास किया। हालाँकि, यह मुश्किल है क्योंकि:

  • "लंबाई" का जाल: आप केवल इस आधार पर वाक्यों को नहीं मिला सकते कि वे कितने लंबे हैं। वयस्क पुस्तक का एक लंबा, जटिल वाक्य बच्चों की पुस्तक में तीन छोटे वाक्यों में विभाजित हो सकता है, या एक पूरा पैराग्राफ एक वाक्य में संक्षिप्त किया जा सकता है।
  • "कॉपी-पेस्ट" का जाल: कभी-कभी, बच्चों की पुस्तक वयस्क पुस्तक से किसी वाक्य को शब्द-दर-शब्द कॉपी करती है। यह "सरलीकरण" नहीं है; यह केवल नकल करना है। कंप्यूटर को बदलावों को सीखने की आवश्यकता है, न कि नकलों को।

2. समाधान: एक स्मार्ट मैचमेकर

टीम ने SentAlign नामक एक प्रणाली बनाई जो एक सुपर-स्मार्ट मैचमेकर के रूप में कार्य करती है। उन्होंने यह देखने के लिए तीन अलग-अलग "मस्तिष्क" (AI मॉडल) का परीक्षण किया कि शब्दों को गिनने के बजाय वाक्यों के अर्थ को समझने में कौन सा सबसे अच्छा है।

इन तीन मस्तिष्कों को अलग-अलग प्रकार के पुस्तकालयाध्यक्षों (librarians) के रूप में सोचें:

  • LaBSE: एक पुस्तकालयाध्यक्ष जो अनुवादों को मिलाने में विशेषज्ञ है। वे यह देखने में माहिर हैं कि दो वाक्य एक ही अर्थ रखते हैं या नहीं, भले ही उनके शब्द पूरी तरह से अलग हों।
  • BGE-M3: एक पुस्तकालकार जो एक विशाल डेटाबेस में विशिष्ट उत्तर खोजने में विशेषज्ञ है। वे अंग्रेजी में बहुत अच्छे हैं लेकिन अन्य भाषाओं के साथ भ्रमित हो जाते हैं।
  • SONAR: एक पुस्तकालयाध्यक्ष जो 200 से अधिक भाषाएँ बोलता है लेकिन थोड़ा सामान्य विशेषज्ञ (generalist) है। वे सब कुछ थोड़ा-थोड़ा जानते हैं लेकिन इस विशिष्ट कार्य के लिए आवश्यक सूक्ष्म अंतरों को पकड़ने में उतने तेज नहीं हैं।

3. प्रयोग: "स्वीट स्पॉट" की खोज

शोधकर्ताओं ने केवल पुस्तकालयाध्यक्षों को अनुमान लगाने के लिए नहीं छोड़ा। उन्होंने एक सख्त नियम पुस्तिका ("गोल्ड स्टैंडर्ड") बनाई जहाँ मानव विशेषज्ञों ने यह देखने के लिए कुछ वाक्यों को मैन्युअल रूप से मिलाया कि कौन सही था।

उन्होंने पाया कि मैचमेकर्स को एक गोल्डिलॉक्स ज़ोन (थ्रेशोल्ड सेटिंग) की आवश्यकता होती है:

  • बहुत सख्त: यदि कंप्यूटर मांग करता है कि वाक्य लगभग समान हों, तो वह वास्तविक सरलीकरण (जैसे जब एक लंबे वाक्य को दो में विभाजित किया जाता है) को छोड़ देता है।
  • बहुत ढीला: यदि कंप्यूटर किसी भी चीज़ को स्वीकार कर लेता है जो सुनने में कुछ हद तक समान लगती है, तो यह उन वाक्यों को मिलाने लगता है जो एक ही विषय के बारे में बात करते हैं लेकिन अलग-अलग बातें कहते हैं (उदाहरण के लिए, "बिल्ली चटाई पर बैठी है" को "कुत्ता चाँद पर भौंक रहा है" के साथ जोड़ना क्योंकि दोनों जानवरों के बारे में हैं)।

उन्होंने पाया कि अधिकांश भाषाओं (कैटलन, स्पैनिश, फ्रेंच, इतालवी) के लिए LaBSE सबसे अच्छा पुस्तकालयाध्यक्ष था, जबकि BGE-M3 अंग्रेजी के लिए सबसे अच्छा था।

4. परिणाम: एक स्वच्छ, उच्च-गुणवत्ता वाला डेटासेट

अपने सिस्टम को ट्यून करने के बाद, उन्होंने मेल खाए गए वाक्य युग्मों का एक विशाल, स्वच्छ डेटासेट बनाया।

  • फ़िल्टर: उन्होंने संभावित मिलानों में से लगभग 95% को हटा दिया। क्यों? क्योंकि वे केवल उन परफेक्ट उदाहरणों को चाहते थे जहाँ अर्थ वही रहता है, लेकिन कठिनाई कम हो जाती है। वे चाहते थे कि कंप्यूटर को सरल बनाना सिखाया जाए, न कि कॉपी करना
  • प्रमाण: उन्होंने अंतिम सूची की जाँच की और पुष्टि की कि "बच्चे" वाले वाक्य वास्तव में सरल थे (कम जटिल व्याकरण संरचनाएं) लेकिन वे वयस्क वाक्यों के बिल्कुल समान अर्थ बनाए रखते थे।

5. यह क्यों महत्वपूर्ण है

यह शोध पत्र पहली बार है जब कैटलन और स्पैनिश जैसी भाषाओं के लिए एक बड़े, उच्च-गुणवत्ता वाले "प्रशिक्षण मैनुअल" का निर्माण किया गया है। इससे पहले, शोधकर्ताओं के पास मुख्य रूप से केवल अंग्रेजी के लिए ये उपकरण थे।

इस डेटासेट को सार्वजनिक रूप से जारी करके, लेखक डेवलपर्स को "ट्रेनिंग व्हील्स" (सहायक उपकरण) दे रहे हैं। अब, जो कोई भी बच्चों, भाषा सीखने वालों या पढ़ने में कठिनाई वाले लोगों की मदद करने वाले उपकरण बना रहा है, वह शून्य से शुरू करने के बजाय इस उच्च-गुणवत्ता वाले, पूर्व-मैच किए गए डेटा का उपयोग करके अपने कंप्यूटर को प्रशिक्षित कर सकता है।

संक्षेप में: उन्होंने पांच भाषाओं के लिए जटिल और सरल पाठों के बीच एक पुल बनाया, यह पता लगाया कि बिना गिरे इस पुल को पार करने का सबसे अच्छा तरीका क्या है, और अपने ब्लूप्रिंट को सभी के उपयोग के लिए खुला छोड़ दिया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →