← नवीनतम पेपर
💬 NLP

A Continuous-Time Markov Chain Framework for Insertion Language Models

यह शोध पत्र इवेंशन लैंग्वेज मॉडल्स (Insertion Language Models) के लिए एक सिद्धांतपूर्ण डिफ्यूजन-शैली का डिनोइजिंग ऑब्जेक्टिव प्राप्त करने हेतु एक निरंतर-समय मार्कोव चेन फ्रेमवर्क स्थापित करता है, जो यह प्रदर्शित करता है कि पूर्व विधियाँ इस दृष्टिकोण के विशेष मामले हैं और साथ ही प्रतिस्पर्धी प्रदर्शन और उन्नत सैंपलिंग लचीलापन भी प्राप्त करती हैं।

मूल लेखक: Dhruvesh Patel, Benjamin Rozonoyer, Soumitra Das, Tahira Naseem, Tim G. J. Rudner, Andrew McCallum

प्रकाशित 2026-06-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dhruvesh Patel, Benjamin Rozonoyer, Soumitra Das, Tahira Naseem, Tim G. J. Rudner, Andrew McCallum

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपके पास एक बहुत सख्त नियम है: आपको हर शब्द को क्रम में लिखना होगा, पहले अक्षर से लेकर आखिरी अक्षर तक। यह अधिकांश वर्तमान एआई भाषा मॉडल (जिन्हें "ऑटोरेग्रेसिव" मॉडल कहा जाता है) के काम करने का तरीका है। वे एक ट्रेन की तरह हैं जो केवल एक ही ट्रैक पर आगे बढ़ सकती है। यदि ट्रेन शुरुआत में ही कहीं फंस जाती है या गलत मोड़ ले लेती है, तो पूरे सफर को ठीक करना कठिन हो जाता है।

अन्य मॉडल अधिक लचीले होने की कोशिश करते हैं और वाक्य के बीच में शब्दों का अनुमान लगाकर खाली जगहों को भरते हैं (जैसे कि "मास्क्ड डिफ्यूजन मॉडल्स")। हालांकि, वे कभी-कभी यह समझने में संघर्ष कर सकते हैं कि वाक्य कितना लंबा होना चाहिए या वे घटनाओं के क्रम के बारे में भ्रमित हो सकते हैं।

यह पेपर एआई को लिखने का सिखाने का एक नया तरीका पेश करता है, जिसे डिफ्यूजन-बेस्ड इंसर्शन लैंग्वेज मॉडल्स (DILMs) कहा जाता है। यह कैसे काम करता है, इसे सरल उपमाओं का उपयोग करके यहाँ समझाया गया है:

मुख्य विचार: "कैंची और गोंद" का खेल

लेखक एआई को लिखना सिखाने के लिए एक उल्टा खेला जाने वाला खेल कल्पित करते हैं।

  1. नॉयजिंग प्रक्रिया (कैंची):
    कल्पना कीजिए कि आपके पास एक पूर्ण, संपूर्ण वाक्य है: "The quick brown fox jumps over the lazy dog."
    एआई का शिक्षक कैंची लेता है और यादृच्छिक (रैंडम) रूप से एक-एक करके शब्द काटना शुरू करता है।
  • पहले, वह "lazy" को काट देता है।
  • फिर "brown" को काटता है।
  • फिर "jumps" को।
  • अंततः, आपके पास केवल कुछ शब्द या खाली स्थान बच जाता है।
    यह काटने की प्रक्रिया का वर्णन करने के लिए पेपर एक गणितीय ढांचे का उपयोग करता है जिसे कंटीन्यूअस-टाइम मार्कोव चेन कहा जाता है। इसे एक सटीक, वैज्ञानिक तरीके के रूप में समझें कि, "हम शब्दों को एक स्थिर, अनुमानित दर पर हटाएंगे जब तक कि वाक्य पूरी तरह खत्म न हो जाए।"
  1. सीखने की प्रक्रिया (गोंद):
    अब, एआई को इस खेल को उलटे क्रम में खेलना है। वह खाली स्थान (या बचे हुए कुछ शब्दों) से शुरू करता है और उसे शब्दों को वापस कैसे भरना है, यह समझना होता है।
  • केवल अगला शब्द अनुमान लगाने के बजाय, एआई कहीं भी शब्द डाल (insert) सकता है।
  • वह "The" और "quick" के बीच "brown" रख सकता है।
  • वह "over" और "dog" के बीच "lazy" रख सकता है।
  • वह एक साथ अलग-अलग अंतराल में कई शब्द भी डाल सकता है।

यह विशेष क्यों है?

पेपर का दावा है कि यह विधि दो दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ती है:

  • लचीलापन: "ट्रैक पर चलने वाली ट्रेन" मॉडल के विपरीत, यह एआई वाक्य के बीच में गलतियों को सुधार सकता है या विवरण जोड़ सकता है बिना पूरी चीज़ को शुरू से दोबारा लिखे।
  • कब रुकना है, यह जानना: इन "खाली जगह भरने वाले" मॉडलों के साथ एक आम समस्या यह है कि उन्हें पता नहीं चलता कि वाक्य कब समाप्त हुआ। वे शब्दों को अनंत काल तक जोड़ते रह सकते हैं या बहुत जल्दी रुक सकते हैं।
    • लेखकों ने इसे हल करने के लिए एआई को "बची हुई लंबाई" (length-to-go) का अनुमान लगाना सिखाया है। कल्पना कीजिए कि एआई के पास एक छोटा सा ईंधन गेज (fuel gauge) है। जैसे-जैसे वह शब्द डालता है, ईंधन गेज नीचे गिरता जाता है। जब गेज शून्य पर पहुँचता है, तो एआई को पता चल जाता है, "ठीक है, वाक्य पूरा हो गया है," और वह स्वाभाविक रूप से रुक जाता है।

नए मॉडल के दो संस्करण

यह पेपर इस "डालने" (insertion) के दो विशिष्ट तरीके प्रस्तावित करता है:

  1. DILM-S (सिंगल इंसर्शन): एआई एक बार में एक स्थान और एक शब्द चुनकर डालता है। यह एक-एक करके लेगो (Lego) ब्रिक को सावधानी से रखने जैसा है। यह बहुत सटीक है।
  2. DILM-M (मल्टीपल इंसर्शन): एआई सभी खाली स्थानों को एक साथ देखता है और एक साथ कई अंतराल भर सकता है। यह लेगो ब्रिक्स की एक मुट्ठी पकड़कर उन्हें एक साथ फिट करने जैसा है। यह तेज़ है।

उन्होंने क्या पाया?

शोधकर्ताओं ने अपने नए मॉडलों का दो प्रकार के कार्यों पर परीक्षण किया:

  1. योजना बनाने के कार्य (द "स्टार ग्राफ" गेम):
    एक मानचित्र की कल्पना करें जिसमें एक केंद्रीय केंद्र (hub) है और उससे कई रास्ते निकल रहे हैं। एआई को एक शुरुआती बिंदु से अंतिम बिंदु तक सही रास्ता खोजने का काम दिया गया है।
  • परिणाम: नए मॉडल (DILM-S और DILM-M) इसमें लगभग पूर्ण थे। वे मानक "ट्रैक पर चलने वाले" मॉडलों और अन्य "खाली जगह भरने वाले" मॉडलों की तुलना में बहुत बेहतर थे। वे पूरी तस्वीर देख सकते थे और सही मार्ग की योजना बना सकते थे।
  1. कहानियां लिखना (लैंग्वेज मॉडलिंग):
    उन्होंने समाचार लेख और सामान्य टेक्स्ट लिखने के लिए मॉडलों का परीक्षण किया।
  • परिणाम: नए मॉडल सुसंगत टेक्स्ट लिखने में मौजूदा सर्वोत्तम मॉडलों के समान ही थे।
  • बड़ा बोनस: लेखकों ने पाया कि उनके इस नए तरीके के साथ, आप गति बनाम गुणवत्ता के बीच तालमेल बिठा सकते हैं। यदि आप एआई को शब्दों को डालने के लिए अधिक "चरण" (steps) लेने देते हैं (अधिक समय), तो लेखन बेहतर होता है। यदि आप जल्दबाजी करते हैं, तो यह तेज़ होता है लेकिन थोड़ा कम सटीक होता है। यह उपयोगकर्ताओं को अपनी ज़रूरत के अनुसार ट्यून करने के लिए एक 'नॉब' प्रदान करता है।

सारांश

संक्षेप में, यह पेपर "खाली जगह भरने" की अव्यवस्थित, प्रयास-और-त्रुटि वाली प्रक्रिया को एक ठोस गणितीय आधार देता है। शब्दों को काटने और चिपकाने के निरंतर खेल की तरह इस प्रक्रिया को मानकर, उन्होंने एक ऐसा एआई बनाया है जो किसी भी क्रम में लिख सकता है, जो बिल्कुल जानता है कि कब रुकना है, और जिसे उपयोगकर्ता की आवश्यकता के अनुसार तेज़ या बहुत उच्च-गुणवत्ता वाला बनाने के लिए ट्यून किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →