Telegraph English: Semantic Prompt Compression via Structured Symbolic Rewriting
टेलीग्राफ इंग्लिश (TE) एक नवीन प्रॉम्प्ट-कंप्रेशन प्रोटोकॉल है जो प्राकृतिक भाषा को परमाणु तथ्य पंक्तियों के एक प्रतीक-समृद्ध, संरचित बोली में पुनर्गठित करता है, जो LLMLingua-2 जैसे मौजूदा टोकन-डिलीशन तरीकों की तुलना में विभिन्न मॉडलों में बेहतर सटीकता और सिमेंटिक इंडेक्सिंग क्षमताओं को प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक मित्र का बहुत लंबा, शब्द-प्रधान पत्र है। आपको इसे किसी और को भेजना है, लेकिन आप डाक व्यय (टोकन) बचाना चाहते हैं और यह भी सुनिश्चित करना चाहते हैं कि प्राप्तकर्ता मुख्य भागों को समझे बिना भटकाव का शिकार न हो जाए।
वर्तमान में, इसे करने का मानक तरीका (जिसे LLMLingua-2 कहा जाता है) "रेडैक्शन" (संपादन द्वारा शब्दों को हटाना) के खेल जैसा है। आप एक लाल पेन लेते हैं और 50% शब्दों को काट देते हैं, इस उम्मीद में कि शेष वाक्य अभी भी अर्थपूर्ण रहेंगे। समस्या यह है कि आप गलती से "क्योंकि" या "इसलिए" जैसे शब्द काट सकते हैं, जिससे पाठक को यह अनुमान लगाने के लिए मजबूर होना पड़ता है कि विचार आपस में कैसे जुड़े हैं। या आप एक विशिष्ट संख्या काट सकते हैं जो कहानी का सबसे महत्वपूर्ण हिस्सा हो सकती है।
यह शोध पत्र एक नई विधि पेश करता है जिसे टेलीग्राफ इंग्लिश (Telegraph English - TE) कहा जाता है। केवल शब्दों को काटने के बजाय, TE आपके पूरे पत्र को एक अत्यंत कुशल, कोड जैसी भाषा में पुनर्गणना (rewrite) करने वाले एक मास्टर ट्रांसलेटर की तरह कार्य करता है।
यह कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग किया गया है:
1. "रेडैक्शन" बनाम "रीराइट" (संपादन बनाम पुनर्लेखन)
- पुराना तरीका (टोकन विलोपन/Token Deletion): कल्पना कीजिए कि आप हर दूसरे शब्द को काटकर एक उपन्यास का संपादन कर रहे हैं। आप अंत में ऐसा कुछ प्राप्त कर सकते हैं: "बिल्ली बैठी थी... चटाई पर।" यह छोटा तो है, लेकिन प्रवाह टूट गया है। यदि आप "नहीं" शब्द को काट देते हैं, तो अर्थ पूरी तरह से बदल जाता है।
- नया तरीका (टेलीग्राफ इंग्लिश): कल्पना कीजिए कि आप उसी उपन्यास को संक्षिप्त संकेतों (shorthand) का उपयोग करके बुलेट पॉइंट्स के रूप में फिर से लिख रहे हैं।
- मूल: "जॉनसन और सहयोगियों (2023) के शोध के अनुसार, चिकित्सा निदान के लिए मशीन लर्निंग तकनीकों के अनुप्रयोग के परिणामस्वरूप प्रारंभिक पहचान दर में 27.5% की वृद्धि हुई और साथ ही पारंपरिक तरीकों की तुलना में गलत सकारात्मकता (false positives) में लगभग 12% की कमी आई।"
- टेलीग्राफ इंग्लिश:
ML→MEDICAL-DIAGNOSTICS: EARLY-DETECTION+27.5% ∧FALSE-POSITIVE-12% [JOHNSON:2023] - परिणाम: वाक्य 68 शब्दों से घटकर 14 "टोकन" में आ गया है, लेकिन प्रत्येक तथ्य, संख्या और संबंध स्पष्ट रूप से लेबल के साथ वहीं मौजूद है।
2. "लेगो ब्रिक" (Lego Brick) का लाभ
शोध पत्र का दावा है कि TE के पास एक विशेष शक्ति है: संपीड़न (Compression) और संगठन (Organization) एक साथ होते हैं।
- पुराना तरीका: जब आप किसी टेक्स्ट को रेडेक्ट (संपादित) करते हैं, तो आपको शब्दों का एक बिखरा हुआ ढेर मिलता है। यदि आप बाद में किसी विशिष्ट तथ्य को खोजना चाहते हैं, तो आपको उस पूरे बिखरे हुए ढेर को फिर से पढ़ना होगा।
- नया तरीका: TE टेक्स्ट को "एटॉमिक फैक्ट लाइन्स" (Atomic Fact Lines) में तोड़ देता है। इसे इस तरह सोचें जैसे आप मिट्टी के एक बड़े, बिखरे हुए ब्लॉक को व्यक्तिगत, लेबल किए गए लेगो ब्रिक्स (Lзо ब्रिक्स) में बदल रहे हैं।
- प्रत्येक पंक्ति एक एकल तथ्य है।
- प्रत्येक पंक्ति टैग की गई है (जैसे,
PAST:,LIKELY:,CITATION:)। - क्योंकि प्रत्येक पंक्ति एक स्व-निहित तथ्य है, आप तुरंत केवल "तिथियाँ" या केवल "संख्याएँ" निकाल सकते हैं बिना पूरे दस्तावेज़ को दोबारा पढ़े। यह एक ऐसे पुस्तकालय की तरह है जहाँ हर किताब को उसकी रीढ़ (spine) पर विषय के आधार पर पहले से ही छाँटा गया है।
3. यह "स्मार्ट" और "कमजोर" कंप्यूटरों के लिए बेहतर क्यों है
शोधकर्ताओं ने पांच अलग-अलग AI मॉडल (बहुत स्मार्ट से लेकर छोटे और सस्ते तक) पर इसका परीक्षण किया।
- स्मार्ट मॉडल्स के लिए: TE पुराने तरीके के समान ही प्रदर्शन करता है, लेकिन आधे खर्च के साथ।
- छोटे मॉडल्स के लिए: यहीं TE चमकता है। छोटे AI मॉडल कभी-कभी शब्दों के गायब होने पर "खाली स्थान भरने" में संघर्ष करते हैं।
- उपमा: यदि आप एक छोटे बच्चे को एक पहेली (puzzle) देते हैं जिसके आधे हिस्से गायब हैं (टोकन विलोपन), तो वे चित्र का गलत अनुमान लगा सकते हैं। यदि आप उन्हें एक ऐसी पहेली देते हैं जहाँ हर हिस्सा स्पष्ट रूप से लेबल किया गया और जुड़ा हुआ है (टेलीग्राफ इंग्लिश), तो वे इसे पूरी तरह से हल कर सकते हैं।
- शोध पत्र ने पाया कि जटिल, विवरण-प्रधान प्रश्नों पर, TE ने छोटे मॉडल्स को पुराने तरीके की तुलना में 11% अधिक बार सही उत्तर देने में मदद की।
4. "एक बार पुनर्लेखन, हमेशा प्रबंधनीय" का नियम
शोध पत्र एक अवधारणा पेश करता है जिसे "एक बार संपीड़ित करें, निरंतर प्रबंधित करें" (Compress Once, Manage Continuously) कहा जाता है।
- पुराना तरीका: आप भेजने के लिए टेक्स्ट को एक बार कंप्रेस करते हैं। यदि AI एक लंबा उत्तर उत्पन्न करता है, तो वह उत्तर एक विशाल, असंपीडित टेक्स्ट के रूप में वापस आता है। यदि आपको वह उत्तर तीसरे व्यक्ति को भेजना है, तो आपको उसे फिर से कंप्रेस करना होगा।
- नया तरीका: क्योंकि TE टेक्स्ट को संरचित "तथ्य ईंटों" (fact bricks) में बदल देता है, इसलिए AI का उत्तर भी TE में लिखा जा सकता है। इसका मतलब है कि पूरी बातचीत संपीड़ित और व्यवस्थित रहती है। आपको कुछ भी पुन: कंप्रेस करने की आवश्यकता नहीं है; संरचना पहले से ही निर्मित है।
कमी (सीमाएं)
शोध पत्र इसकी कमियों के बारे में ईमानदार है:
- इसे एक "अनुवादक" की आवश्यकता है: अपने टेक्स्ट को टेलीग्राफ इंग्लिश में बदलने के लिए, आपको पहले एक AI मॉडल चलाना होगा। इसमें समय और पैसा लगता है। यदि आप एक ऐसा संदेश भेज रहे हैं जिसे केवल एक बार पढ़ा जाएगा और फिर कभी उपयोग नहीं किया जाएगा, तो यह अतिरिक्त चरण सार्थक नहीं हो सकता है।
- केवल अंग्रेजी: यह विशिष्ट "शॉर्टहैंड" अंग्रेजी के लिए डिज़ाइन किया गया है। यह उन भाषाओं के लिए तुरंत काम नहीं करेगा जिनके संरचनात्मक स्वरूप बहुत भिन्न हैं (जैसे चीनी या अरबी) जब तक कि बड़े पुनर्गठन की आवश्यकता न हो।
- सख्त नियम: यह प्रणाली बहुत कठोर है। यह तथ्यों को विशिष्ट प्रारूपों में डाल देती है। यदि इनपुट पहले से ही बहुत छोटा और सघन है, तो सिस्टम वास्तव में इसे लंबा बना सकता है क्योंकि यह किसी भी जानकारी को हटाने से इनकार करता है (शुद्धता, संक्षिप्तता से अधिक महत्वपूर्ण है)।
निष्कर्ष
टेलीग्राफ इंग्लिश केवल टेक्स्ट को छोटा करने के बारे में नहीं है; यह टेक्स्ट को स्मार्टर बनाने के बारे में है। यह मानव भाषा के बिखरे हुए, प्राकृतिक प्रवाह के बदले एक स्वच्छ, संरचित, प्रतीक-समृद्ध प्रारूप का उपयोग करता है जो कंप्यूटर के लिए पढ़ना, संग्रहीत करना और याद रखना आसान है। यह किसी दस्तावेज़ की "क्षतिग्रस्त प्रति" को तथ्यों के एक "संरचित डेटाबेस" में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।