← नवीनतम पेपर
💬 NLP

Transferring Natural Language Datasets Between Languages Using Large Language Models for Modern Decision Support and Sci-Tech Analytical Systems

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स का उपयोग करके भाषाओं के बीच एनोटेटेड डेटासेट को स्थानांतरित करने के लिए एक पाइपलाइन का प्रस्ताव करता है, जो अंग्रेजी DEFT कॉर्पस को रूसी में अनुवादित करके एक दुर्लभ शब्द-परिभाषा माइनिंग संसाधन बनाने की अपनी प्रभावशीलता को प्रदर्शित करता है जो वैज्ञानिक रुझान विश्लेषण और निर्णय लेने में सहायता करता है।

मूल लेखक: Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास अंग्रेजी की किताबों का एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय है जहाँ हर महत्वपूर्ण शब्द (जैसे "photosynthesis" या "inflation") को हाइलाइट किया गया है, और उसके ठीक बगल में उसकी परिभाषा लिखी गई है। यह पुस्तकालय उन कंप्यूटरों के लिए एक खजाना है जो विज्ञान और तकनीक को समझना सीखने की कोशिश कर रहे हैं। हालाँकि, यह पुस्तकालय केवल अंग्रेजी में मौजूद है।

समस्या यह है? रूसी भाषा में इसके समान कोई पुस्तकालय नहीं है। इसे शून्य से बनाने का मतलब होगा कि हजारों लोगों की एक टीम को हर किताब को पढ़ने, शब्दों को खोजने और उन्हें अपने हाथों से लिखने के लिए काम पर रखना। इसमें अनंत समय लगेगा और बहुत अधिक लागत आएगी।

बड़ा विचार: "स्मार्ट ट्रांसलेटर" का शॉर्टकट
इस शोध पत्र के लेखकों ने पूछा: क्या हम एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल या LLM) का उपयोग एक ऐसे अनुवादक के रूप में कर सकते हैं जो न केवल शब्दों का अनुवाद करता है, बल्कि हाइलाइट्स और परिभाषाओं को भी उनके साथ स्थानांतरित करता है?

इसे इस तरह सोचिए: कल्पना कीजिए कि आपके पास एक शहर का नक्शा है जिसमें सभी प्रसिद्ध लैंडमार्क लाल घेरे से चिह्नित हैं। आप उसी शहर का एक नक्शा चाहते हैं, लेकिन एक अलग भाषा में। एक सामान्य अनुवादक केवल सड़क के नाम नई भाषा में लिखेगा, जिससे लाल घेरे गलत जगहों पर तैरते रह जाएंगे। लेखक चाहते थे कि एक ऐसा AI हो जो कह सके, "ठीक है, मैं अंग्रेजी में 'Eiffel Tower' के चारों ओर लाल घेरा देख रहा हूँ। फ्रेंच में, वह 'Tour Eiffel' है। मैं लाल घेरे को 'Tour Eiffel' के चारों ओर लपेटने के लिए स्थानांतरित कर दूँगा।"

उन्होंने इसका परीक्षण कैसे किया
उन्होंने एक विशिष्ट अंग्रेजी डेटासेट लिया जिसे DEFT कहा जाता है (जो वैज्ञानिक शब्दों और उनकी परिभाषाओं से भरा है) और इसे कई अलग-अलग AI मॉडलों (जैसे ChatGPT, Llama, DeepSeek, और Qwen) का उपयोग करके रूसी भाषा में "ट्रांसफर" करने की कोशिश की।

उन्होंने दो मुख्य दृष्टिकोणों का परीक्षण किया:

  1. "गणित" वाला दृष्टिकोण: उन्होंने AI को बताया, "शब्द वर्ण 10 पर शुरू होता है और वर्ण 20 पर समाप्त होता है। पाठ का अनुवाद करें, फिर मुझे रूसी शब्द के लिए नए वर्ण नंबर बताएं।"
    • परिणाम: AI भ्रमित हो गया। यह किसी से दीवार में ईंटों की गिनती करने के लिए कहने जैसा है जबकि वे साथ ही साथ दीवार को दूसरे रंग में फिर से बना रहे हों। AI गिनती खो देता था या नंबर गलत बताता था।
  2. "शब्द पहचानें" वाला दृष्टिकोण: उन्होंने निर्देशों को बदल दिया। नंबरों के बजाय, उन्होंने कहा, "यहाँ एक अंग्रेजी वाक्य है जिसमें हाइलाइट किया गया शब्द है। यहाँ उसका रूसी अनुवाद है। कृपया रूसी शब्द को हाइलाइट करें जो अंग्रेजी वाले शब्द से मेल खाता है।"
    • परिणाम: यह बहुत बेहतर काम कर गया! यह AI से जटिल गणित करने के बजाय केवल मिलते-जुलते चित्र की ओर इशारा करने के लिए कहने जैसा था।

परिणाम

  • सबसे अच्छा अनुवादक: DeepSeek AI मॉडल ने "हाइलाइट्स" (एनोटेशन) को सही ढंग से स्थानांतरित करने में सबसे अच्छा काम किया। इसने लगभग 94% बार सही उत्तर दिया।
  • गुणवत्ता: परिणामी रूसी डेटासेट एकदम सटीक नहीं है। लेखक इसे "गोल्ड ग्रेड" के बजाय "सिल्वर ग्रेड" कहते हैं। यह 100% सटीक नहीं है, लेकिन यह एक ठोस शुरुआत के लिए पर्याप्त अच्छा है। यह एक किताब के ड्राफ्ट जैसा है जो 90% पूरा हो चुका है; आपको बस शेष 10% त्रुटियों को ठीक करने के लिए एक मानव संपादक की आवश्यकता है, जो पूरी किताब को शून्य से लिखने की तुलना में बहुत तेज़ है।
  • नए मॉडल को प्रशिक्षित करना: उन्होंने इस नए, AI-अनुवादित रूसी डेटासेट का उपयोग एक छोटे, सरल AI (एक BERT मॉडल) को प्रशिक्षित करने के लिए किया। इस नए रूसी AI ने परिभाषाओं और शब्दों को पहचानने में काफी हद तक महारत हासिल की, जिससे यह सिद्ध हुआ कि "सिल्वर" डेटा कंप्यूटर को कुछ नया सिखाने के लिए पर्याप्त उपयोगी था।

यह क्यों महत्वपूर्ण है
लेखक बताते हैं कि यह तरीका "अल्प-संसाधन वाली" भाषाओं (ऐसी भाषाएँ जिनके पास पर्याप्त डिजिटल डेटा नहीं है) के लिए गेम-चेंजर है। शून्य से एक डेटासेट बनाने के लिए वर्षों प्रतीक्षा करने के बजाय, शोधकर्ता इन "स्मार्ट ट्रांसलेटर्स" का उपयोग करके जल्दी से एक ड्राफ्ट डेटासेट बना सकते हैं। यह रूस के वैज्ञानिकों और निर्णय लेने वालों को विज्ञान और तकनीक के रुझानों का विश्लेषण बहुत तेज़ी से करने में मदद करता है।

उन्होंने क्या नहीं किया
शोध पत्र अपनी सीमाओं के बारे में बहुत विशिष्ट है:

  • उन्होंने केवल अंग्रेजी-से-रूसी का परीक्षण किया।
  • उन्होंने यह परीक्षण नहीं किया कि क्या AI एक मानव अनुवादक से बेहतर काम कर सकता है (वे स्वीकार करते हैं कि मानव अनुवादक अभी भी बेहतर हैं)।
  • उन्होंने मूल कार्य के सबसे कठिन हिस्से (शब्दों को परिभाषाओं से जोड़ना) पर परीक्षण नहीं किया, इसे भविष्य के कार्य के लिए छोड़ दिया।

संक्षेप में, यह शोध पत्र दिखाता है कि हालांकि AI अभी भी पूर्ण नहीं है, फिर भी यह अंग्रेजी से रूसी में ज्ञान को "कॉपी-पेस्ट" करने के लिए एक शक्तिशाली उपकरण है, जो शोधकर्ताओं के समय और प्रयास की भारी बचत करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →