← नवीनतम पेपर
💬 NLP

The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora

यह शोध पत्र यह तर्क देता है कि प्री-ट्रेनिंग कॉर्पोरा में मॉडल व्यवहार को प्रभावित करने वाला महत्वपूर्ण चर विशिष्ट नोटेशन के बजाय संरचनात्मक घोषणाओं (structural announcements) की उपस्थिति है, और एक नए डेटा प्रारूप का प्रस्ताव करता है जो इन घोषणाओं को प्रतिवर्ती साइडकारों (reversible sidecars) में अलग करता है जबकि फिडेलिटी संरक्षण के बजाय क्षमता-संचालित प्रारूप विकल्पों को प्राथमिकता देता है।

मूल लेखक: E. M. Freeburg

प्रकाशित 2026-08-11
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: E. M. Freeburg

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

अदृश्य मानचित्र और रोबोट पाठक

कल्पना कीजिए कि आप एक रोबोट को पढ़ना सिखा रहे हैं। आप उसे केवल एक किताब थमा नहीं देते; बल्कि आप उसे शब्दों का एक विशाल, अनंत प्रवाह खिलाते हैं, जिसे छोटे-छोटे टुकड़ों में विभाजित किया गया है, ताकि रोबोट यह सीख सके कि शब्द एक साथ कैसे जुड़ते हैं। आधुनिक AI मॉडल इसी तरह प्रशिक्षित होते हैं। लेकिन एक छिपा हुआ मुद्दा है: उस टेक्स्ट को तैयार करने का तरीका हमारी सोच से कहीं अधिक महत्वपूर्ण है।

एक किताब को एक शहर की तरह समझें। शब्द इमारतें हैं, लेकिन अध्याय के शीर्षक, पृष्ठ संख्या और "अध्याय 1" जैसे हेडर सड़क के संकेत और मानचित्र के मार्कर हैं। वे आपको बताते हैं कि आप कहाँ हैं और कब आप एक नए पड़ोस में पहुँच गए हैं। लंबे समय तक, वैज्ञानिकों ने यह माना कि यदि वे टेक्स्ट को साफ कर देते हैं—यानी, उसे एक सहज, सादे शब्दों के प्रवाह में बदलने के लिए अव्यवस्थित फॉर्मेटिंग को हटा देते हैं—तो रोबोट ठीक से सीख जाएगा। उन्हें लगा कि वे "संकेत" केवल सजावट थे। लेकिन क्या होगा अगर वे संकेत वास्तव में पाठ का सबसे महत्वपूर्ण हिस्सा हों? क्या होगा अगर रोबोट कहानी नहीं सीख रहा है, बल्कि केवल अगले शब्द का अनुमान लगाने के लिए संकेतों को रट रहा है? यह शोध पत्र जांच करता है कि क्या हम अनजाने में अपने रोबोटों को उसके मानचित्र (स्ट्रक्चर) को हटाकर कहानी की संरचना को अनदेखा करना सिखा रहे हैं।


महान "सफाई" की गलती

इस शोध पत्र के लेखक, ई. एम. फ्रीबर्ग (E. M. Freeberg) ने AI प्रशिक्षण के तरीके में एक अजीब अंतर की जांच करने का निर्णय लिया। उन्होंने देखा कि जबकि हमें पता है कि किताबों को टेक्स्ट में बदलने के लिए हम किन उपकरणों का उपयोग करते हैं, हम वास्तव में यह कभी नहीं मापते कि वे उपकरण पीछे क्या छोड़ जाते हैं। यह एक ऐसे शेफ की तरह है जो जानता है कि उसने सब्जियों को काटने के लिए किस चाकू का उपयोग किया था, लेकिन यह कभी नहीं जाँचता कि सब्जियाँ अभी भी साबुत हैं या वे पेस्ट बन गई हैं।

समस्या को समझने के लिए, लेखक ने एक क्लासिक पुस्तक, मोबी-डिक (Moby-Dick) को देखा। अपने मूल रूप में, इस पुस्तक में 143 पंक्तियाँ "फर्नीचर" (जैसे अध्याय संख्या, शीर्षक और हेडर) की हैं। यदि आप उन सभी को हटा देते हैं, तो आपके पास 283,267 शब्दों का एक सहज, निरंतर प्रवाह बचता है। एक मानव पाठक के लिए, यह ठीक दिखता है; आप अभी भी कहानी का अनुसरण कर सकते हैं। लेकिन एक रोबोट के लिए, यह एक दुःस्वप्न है। रोबोट को हर कुछ हज़ार शब्दों के बाद "यहाँ नया अध्याय है!" जैसा संकेत देखने की आदत होती है। जब वह संकेत गायब हो जाता है, तो रोबोट को यह अनुमान लगाने के लिए संघर्ष करना पड़ता है कि कहानी कहाँ बदल रही है। यह एक ऐसे शहर में गाड़ी चलाने की तरह है जहाँ सभी सड़क के संकेतों को पेंट करके मिटा दिया गया हो।

यह शोध पत्र "क्लीन-विंडो सर्वाइवल" (Clean-Window Survival) नामक एक नया तरीका पेश करता है। कल्पना कीजिए कि एक खिड़की है जो 8,192 शब्दों चौड़ी है। यदि आप इस खिड़की को टेक्स्ट पर स्लाइड करते हैं, तो "सर्वाइवल" उस प्रतिशत को दर्शाता है जब खिड़की टेक्स्ट के ऐसे हिस्से पर स्लाइड करती है जिसमें कोई भी संरचनात्मक संकेत (जैसे हेडर या बुलेट पॉइंट्स) नहीं हैं।

  • प्रसिद्ध C4 डेटासेट (वेब टेक्स्ट का एक विशाल संग्रह) में, सर्वाइवल रेट 0.889 है। इसका मतलब है कि रोबोट बिना किसी संकेत वाले टेक्स्ट के लंबे हिस्से देखता है।
  • एक नया डेटासेट जो विजन मॉडल्स द्वारा कन्वर्ट किए गए PDF से बना है (Dolma 3), उसमें सर्वाइवल रेट गिरकर 0.153 हो जाता है। यहाँ, रोबोट लगातार संकेतों, हेडर और फॉर्मेटिंग के शोर से घिरा रहता है।

लेखक ने पाया कि "दुर्लभ संसाधन" संकेतों के बिना टेक्स्ट नहीं है; बल्कि संकेतों के बिना लंबा टेक्स्ट है। अधिकांश वेब टेक्स्ट छोटा और अस्त-व्यस्त होता है। लेकिन किताबें लंबी और सुसंगत होती हैं। समस्या यह है कि आधुनिक AI प्रशिक्षण उन लंबे, बिना संकेतों वाले हिस्सों तक पहुँच खो रहा है, और उनकी जगह ऐसा टेक्स्ट ले रहा है जो फॉर्मेटिंग के माध्यम से लगातार "मेरी ओर देखो!" चिल्ला रहा है।

बड़ी खोज: यह संकेत (Sign) है, प्रतीक (Symbol) नहीं

लेखक ने यह पता लगाने के लिए कि रोबोट वास्तव में किस चीज़ की परवाह करता है, कई चतुर प्रयोग किए। उन्होंने एक ही टेक्स्ट के तीन अलग-अलग संस्करणों का परीक्षण किया:

  1. मार्क्ड (Marked): पूर्ण फॉर्मेटिंग वाला टेक्स्ट (जैसे, ## अध्याय 1)।
  2. फ्लैट (Flat): वह टेक्स्ट जिसमें फॉर्मेटिंग प्रतीकों को हटा दिया गया है, लेकिन शब्द रखे गए हैं (जैसे, केवल "अध्याय 1" शब्द अपनी ही एक लाइन में)।
  3. साइलेंट (Silent): वह टेक्स्ट जिसमें "अध्याय 1" वाली लाइन को पूरी तरह से हटा दिया गया है, जिससे एक खाली स्थान बच गया है।

यहाँ चौंकाने वाला परिणाम सामने आया: रोबोट को प्रतीकों (Symbols) की परवाह नहीं थी।
जब उन्होंने फैंसी ## को एक साधारण टेक्स्ट लाइन से बदला, तो रोबोट के प्रदर्शन में कोई बदलाव नहीं आया। इससे कोई फर्क नहीं पड़ा कि संकेत एक हैशटैग था या केवल एक साधारण वाक्य। रोबोट दोनों ही स्थितियों में खुश था।

हालाँकि, जब उन्होंने पूरी लाइन को ही हटा दिया ( "साइलेंट" संस्करण), तो रोबोट भ्रमित हो गया। अगले शब्दों की भविष्यवाणी करना मापने योग्य रूप से कठिन हो गया। रोबोट को यह जानने के लिए उस छोटे से "घोषणा" वाली लाइन की आवश्यकता थी कि एक नया खंड शुरू हो रहा है।

इससे एक बड़ी उपलब्धि मिली: रोबलेट संकेत की शैली (Markdown symbols) से नहीं सीख रहा है, बल्कि वह घोषणा की उपस्थिति से सीख रहा है। संकेत एक संकेत (cue) के रूप में कार्य करता है जो कहता है, "जो कर रहे हो उसे रोको; यहाँ एक नई सीमा है।" यदि आप संकेत हटा देते हैं, तो रोबोट को संरचना को खुद समझने के लिए बहुत अधिक मेहनत करनी पड़ती है।

"प्योर फ्रेम" (Pure Frame) समाधान

लेखक डेटा तैयार करने का एक नया तरीका प्रस्तावित करते हैं जिसे "प्योर फ्रेम" कहा जाता है।
कल्पना कीजिए कि आपके पास एक पुस्तक है। आप सभी अनुच्छेदों (paragraphs) को सही क्रम में रखते हैं। लेकिन आप प्रत्येक अध्याय का शीर्षक, हेडर और "भाग एक" जैसे लेबल को हटा देते हैं। आप उन्हें खाली स्थान से बदल देते हैं—सिर्फ एक खाली लाइन।

  • ऐसा क्यों करें? ताकि रोबोट को कहानी से संरचना को निष्कर्ष निकालने के लिए मजबूर किया जा सके, न कि केवल संकेत बोर्ड को पढ़ने के लिए।
  • क्या यह सुरक्षित है? हाँ। लेखक ने एक "साइडकार" फ़ाइल बनाई है जो हर हटाई गई लाइन को सहेजती है। इसका मतलब है कि आप बाद में मूल पुस्तक को पूरी तरह से पुनर्गठित कर सकते हैं। यह प्रतिवर्ती (reversible) है।

उन्होंने 27 सार्वजनिक डोमेन पुस्तकों पर इसका परीक्षण किया। "प्योर फ्रेम" संस्करण मूल से 0.713% कम टोकन वाला था क्योंकि उन्होंने हेडर हटा दिए थे। लेकिन इससे भी महत्वपूर्ण बात यह है कि "क्लीन-विंडो सर्वाइवल" दर बढ़कर 1.000 हो गई। इसका मतलब है कि रोबोट अब विचार के एक लंबे, अटूट प्रवाह में नेविगेट करने के लिए मजबूर है, जो बिल्कुल वही है जिसे लेखक का मानना है कि उसे बेहतर ढंग से सीखने की आवश्यकता है।

जो रोबोट नहीं करते

शोध पत्र ने यह भी जाँच की कि क्या रोबोट टेक्स्ट को खुद "ठीक" करेंगे। यदि आप किसी रोबोट को बिना अध्याय शीर्षकों वाली कहानी देते हैं, तो क्या वह उन्हें वापस लिखना शुरू कर देगा?

  • उत्तर: नहीं।
    जब शोधकर्ताओं ने बेस मॉडल्स (कच्चे, अन-ट्यून्ड रोबोट्स) को हटाए गए अध्याय शीर्षक के बाद कहानी जारी रखने के लिए कहा, तो उन्होंने शीर्षक को वापस नहीं डाला। उन्होंने संरचना को फिर से बनाने की कोशिश भी नहीं की। वे बस लिखते रहे। यह सुझाव देता है कि हेडर देखने की आदत वह है जो हम उन्हें प्रशिक्षण के दौरान देते हैं, न कि कुछ ऐसा जिसे वे स्वाभाविक रूप से आविष्कार करते हैं।

निष्कर्ष: चुनें जो आप सिखाना चाहते हैं

यह शोध पत्र AI प्रशिक्षण के भविष्य के लिए एक साहसिक सुझाव के साथ समाप्त होता है। वर्तमान में, डेटा वैज्ञानिक उन उपकरणों को चुनते हैं जो फिडेलिटी (Fidelity)—यानी, उपकरण मूल दस्तावेज़ के स्वरूप को कितनी सटीकता से संरक्षित करता है—पर आधारित होते हैं। लेखक का तर्क है कि हमें उपकरणों को क्षमता (Capability) के आधार पर चुनना चाहिए—यानी, हम रोबोट को कौन सा विशिष्ट कौशल सिखाना चाहते हैं।

यदि हम चाहते हैं कि रोबोट लंबी, जटिल कहानियों को समझ सकें, तो हमें उन्हें ऐसा टेक्स्ट खिलाना बंद कर देना चाहिए जो फॉर्मेटिंग के साथ लगातार "नया खंड!" चिल्ला रहा है। इसके बजाय, हमें उन्हें "प्योर फ्रेम" खिलाना चाहिए—साफ, अटूट टेक्स्ट जो उन्हें कहानी की संरचना को खुद समझने के लिए कठिन परिश्रम करने के लिए मजबूर करता है।

लेखक स्वीकार करते हैं कि यह एक परिकल्पना है जिसे एक अंतिम, महंगे परीक्षण की आवश्यकता है: इस नए प्रारूप पर एक रोबोट को प्रशिक्षित करके यह देखना कि क्या वह वास्तव में स्मार्ट बनता है। लेकिन अब तक के प्रमाण बताते हैं कि जो "संकेत" हम जोड़ रहे हैं, वे शायद फायदे से ज्यादा नुकसान कर रहे हैं, क्योंकि वे एक बैसाखी के रूप में कार्य कर रहे हैं जो रोबोट को अपने दम पर चलना सीखने से रोकते हैं।

संक्षेप में: शोध पत्र का तर्क है कि पुस्तक की संरचना के दृश्य "संकेतों" को हटाकर, हम वास्तव में AI को केवल विषय सूची (table of contents) को रटने के बजाय कहानी को बेहतर ढंग से समझने के लिए प्रशिक्षित कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →