← नवीनतम पेपर
💬 NLP

Failure-Aware Long-Form Translation: Design and Implementation of a Recoverable LLM Translation System

यह शोध पत्र एक रिकवरेबल (recoverable) लॉन्ग-फॉर्म ट्रांसलेशन सिस्टम के डिज़ाइन और कार्यान्वयन को प्रस्तुत करता है जो आउटपुट रिलीज़ को विलंबित करके, असेंबल किए गए परिणामों को मान्य करके, और व्यवधानों या फ़िल्टरिंग के बावजूद उपयोगी टेक्स्ट वितरण सुनिश्चित करने के लिए प्रोवेनेंस ट्रैकिंग के साथ एक संरचित रिट्राय प्रोटोकॉल का उपयोग करके API-स्तरीय विफलताओं को कम करता है।

मूल लेखक: Yanlin Yu

प्रकाशित 2026-08-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanlin Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबी, जादुई कहानी की किताब पढ़ रहे हैं जिसे एक रोबोट आपके लिए वास्तविक समय में लिख रहा है। आपने रोबोट से एक भाषा से दूसरी भाषा में 40 पन्नों के उपन्यास का अनुवाद करने के लिए कहा है। कंप्यूटर विज्ञान की दुनिया में, इसे "लॉन्ग-फॉर्म ट्रांसलेशन" (दीर्घ-रूप अनुवाद) कहा जाता है। यह केवल शब्दों को बदलने के बारे में नहीं है; यह पूरी कहानी को पैराग्राफ-दर-पैराग्राफ सही रखने के बारे में है, बिना अपनी जगह खोए। लेकिन यहाँ एक पेचीदा हिस्सा है; कभी-कभी रोबोट अपना काम अंदर से तो पूरी तरह से कर लेता है, लेकिन जो कहानी वह आपको देता है वह टूटी हुई होती है। शायद उसने गलती से आपके द्वारा दिए गए निर्देशों को ही दोहरा दिया, शायद वह एक वाक्य के बीच में ही रुक गया, या शायद उसने चुपचाप किताब का आधा हिस्सा छोड़ दिया और आपको सिर्फ अंत दे दिया। यह शोध पत्र विज्ञान के उस कोने में रहता है जहाँ हम इन एआई (AI) रोबोटों के लिए "सुरक्षा जाल" बनाने की कोशिश करते हैं। यह एक सरल लेकिन महत्वपूर्ण प्रश्न पूछता है: यदि रोबोट कचरा उगलना शुरू कर देता है या बीच वाक्य में रुक जाता है, तो हम उस बुरी चीज़ को आपकी स्क्रीन पर आने से कैसे रोकें, जबकि हमारे पास पहले से मौजूद अच्छी चीज़ को बचा सकें?

यह शोध पत्र, जिसका शीर्षक "फेलियर-अवेयर लॉन्ग-फॉर्म ट्रांसलेशन" (विफलता-जागरूक दीर्घ-रूप अनुवाद) है, वास्तव में एक बहुत ही स्मार्ट और बहुत ही सतर्क अनुवादक प्रणाली का ब्लूप्रिंट है। लेखक, यानलिन यू (Yanlin Yu) ने महसूस किया कि सिर्फ इसलिए कि एक रोबोट कहता है "मैं हो गया!", इसका मतलब यह नहीं है कि काम वास्तव में उपयोग करने योग्य है। इसलिए, उन्होंने एक ऐसी प्रणाली डिजाइन की है जो पाठक और रोबोट के बीच एक सख्त संपादक की तरह खड़ी रहती है। रोबोट को हर शब्द को बोलने के क्षण में चिल्लाने देने के बजाय, यह प्रणाली पहले 64 वर्णों को एक "वेटिंग रूम" (प्रतीक्षा कक्ष) में रखती है। यह जाँच करती है कि कहीं रोबोट गलती से अपना ही होमवर्क तो नहीं पढ़ रहा है या प्रॉम्प्ट को दोहरा तो नहीं रहा है। यदि पहले कुछ शब्द संदिग्ध दिखते हैं, तो सिस्टम उन्हें निगल लेता है और किसी दूसरे रोबोट के साथ फिर से प्रयास करता है ताकि इससे पहले कि आप कोई गड़बड़ी देखें, उसे ठीक किया जा सके।

यदि रोबोट एक पैराग्राफ के बीच में ही कट जाता है—शायद इंटरनेट में रुकावट आई या रोबोट थक गया—तो सिस्टम पूरे पन्ने को फेंककर फिर से शुरू नहीं करता। वह बर्बादी होगी! इसके बजाय, यह लिखे गए टेक्स्ट को देखता है, अंतिम पूर्ण वाक्य या पैराग्राफ को ढूँढता है जो समझ में आता है, और उस हिस्से को सुरक्षित रखता है। फिर यह अगले रोबोट को बताता है, "यहाँ से तुम रुके थे; कृपया यहाँ से जारी रखें।" इसे "बाउंड्री-सेफ रिकवरी" (सीमा-सुरक्षित पुनर्प्राप्ति) कहा जाता है। यह बिल्कुल वैसा ही है जैसे यदि आप एक रेत का महल बना रहे हों और एक लहर ऊपर के बुर्ज को बहा ले जाए; आप पूरे महल को गिराकर फिर से शुरू नहीं करेंगे। आप बस गीली रेत के किनारे को चिकना करेंगे और उसी ठोस आधार के ऊपर अगला बुर्ज बनाना शुरू कर देंगे।

यह शोध पत्र एक "फेलियर मैट्रिक्स" (विफलता मैट्रिक्स) भी पेश करता है, जो उन चीजों की एक चेकलिस्ट की तरह है जो गलत हो सकती हैं। यह एक ऐसे रोबोट के बीच अंतर करता है जिसके पास बस समय समाप्त हो गया (एक "ट्रांसपोर्ट" विफलता) और एक ऐसे रोबोट के बीच जिसने विनम्र लेकिन बेकार उत्तर दिया (एक "आउटपुट" विफलता)। सिस्टम का एक सख्त नियम है: यदि एक रोबोट विफल होता है, तो यह एक अलग रोबोट को आज़माता है, लेकिन केवल कुछ ही बार। यदि सभी स्मार्ट रोबोट विफल हो जाते हैं, तो यह काम पूरा करने के लिए एक सरल, तेज़ मशीन अनुवादक पर स्विच कर देता है, लेकिन यह स्पष्ट रूप से उस हिस्से को "मशीन-निर्मित" के रूप में चिह्नित करता है ताकि आपको अंतर पता चल सके।

लेखक ने इस प्रणाली का परीक्षण 38 विशिष्ट परिदृश्यों के साथ किया, जिसमें वे मामले भी शामिल थे जहाँ रोबोट को अपने निर्देशों को दोहराने के लिए बहकाया गया था या अचानक रुक गया था। इन परीक्षणों में, सिस्टम ने 14 अलग-अलग प्रकार के "बुरे" आउटपुट को सफलतापूर्वक पकड़ा, इससे पहले कि वे किसी इंसान द्वारा देखे जा सकें। इसने 31 वर्णों के टेक्स्ट को भी बचाया जो पूर्ण रीस्टार्ट में खो जाते। यह शोध पत्र यह दावा नहीं करता कि यह पूरी दुनिया के लिए एकदम सही अनुवादक है, न ही यह कहता है कि यह सुंदर साहित्य बनाने में सबसे अच्छा है। इसके बजाय, यह साबित करता है कि यह विशिष्ट "सुरक्षा प्रोटोकॉल" बिल्कुल वैसे ही काम करता है जैसा इसे डिज़ाइन किया गया है: यह बुरी चीज़ों को छिपाए रखता है, अच्छी चीज़ों को बचाता है, और कभी भी पाठक को यह अनुमान लगाने नहीं देता कि पर्दे के पीछे क्या गलत हुआ। यह एक ऐसी प्रणाली है जिसे सबसे तेज़ बनने के लिए नहीं, बल्कि आपके पढ़ने के अनुभव का सबसे विश्वसनीय संरक्षक बनने के लिए बनाया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →