← नवीनतम पेपर
💬 NLP

SONAR-LLM: Autoregressive Transformer that Thinks in Sentence Embeddings and Speaks in Tokens

यह शोध पत्र SONAR-LLM को प्रस्तुत करता है, जो एक डिकोडर-ओनली ट्रांसफॉर्मर है जो SONAR स्पेस के भीतर निरंतर वाक्य एम्बेडिंग (continuous sentence embeddings) की भविष्यवाणी करके टेक्स्ट उत्पन्न करता है और साथ ही टोकन-लेवल क्रॉस-एन्ट्रॉपी ऑब्जेक्टिव के माध्यम से प्रशिक्षित होता है, जिससे यह लार्ज कॉन्सेप्ट मॉडल्स के सिमेंटिक एब्स्ट्रैक्शन को ऑटोरेग्रेसिव टोकन प्रेडिक्शन की दक्षता और लाइकलीहुड-आधारित प्रशिक्षण के साथ जोड़ता है।

मूल लेखक: Nikita Dragunov, Temurbek Rahmatullaev, Elizaveta Goncharova, Nikita Kurdiukov, Aysel Mirzoeva, Anna Borisiuk, Andrey Kuznetsov, Anton Razzhigaev

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nikita Dragunov, Temurbek Rahmatullaev, Elizaveta Goncharova, Nikita Kurdiukov, Aysel Mirzoeva, Anna Borisiuk, Andrey Kuznetsov, Anton Razzhigaev

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कहानी लिखना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका (Standard LLMs): ईंट-दर-ईंट बनाने वाला मिस्त्री
वर्तमान के अधिकांश AI मॉडल एक बहुत तेज़, बहुत सूक्ष्म ईंट बिछाने वाले मिस्त्री की तरह हैं। एक दीवार (एक कहानी) बनाने के लिए, वे एक बार में एक ईंट (एक शब्द या "टोकन") रखते हैं। वे रुकते हैं, सोचते हैं, एक ईंट रखते हैं, फिर रुकते हैं, सोचते हैं, एक और ईंट रखते हैं।

  • फायदे: वे बहुत सटीक होते हैं।
  • नुकतें: यदि आप एक गगनचुंबी इमारत (एक बहुत लंबा दस्तावेज़) बनाना चाहते हैं, तो यह प्रक्रिया बहुत लंबा समय लेती है। यह धीमा है क्योंकि उन्हें हर एक छोटे से टुकड़े के लिए रुककर सोचना पड़ता है।

"LCM" का तरीका (पिछला प्रयोग): स्वप्नद्रष्टा (The Dreamer)
हाल ही में, शोधकर्ताओं ने "लार्ज कॉन्सेप्ट मॉडल" (LCM) नामक एक नया दृष्टिकोण आज़माया। ईंटें बिछाने के बजाय, यह मॉडल वाक्यों में "सपने" देखने की कोशिश करता है। यह कल्पना करता है कि अगला वाक्य क्या होगा—विचारों के एक सुचारू, निरंतर बादल (एक एम्बेडिंग) के रूप में, न कि विशिष्ट शब्दों के रूप में।

  • फायदे: यह छोटी ईंटों को छोड़ देता है और सीधे बड़े चित्र पर छलांग लगाता है। यह लंबी कहानियों के लिए तेज़ है।
  • नुकतें: क्योंकि यह केवल "विचारों के बादलों" में सपने देख रहा है, इसलिए यह कभी-कभी वास्तविक शब्दों को गलत कर देता है। यह एक ऐसे चित्रकार की तरह है जो जानता है कि सूर्यास्त कैसा महसूस होता है, लेकिन नारंगी और लाल के बिल्कुल सही शेड्स मिलाने में संघर्ष करता है। इसका प्रशिक्षण भी अस्थिर था, जैसे एक डगमगाती सीढ़ी पर संतुलन बनाने की कोशिश करना।

नया तरीका (SONAR-LLM): ब्लूप्रिंट के साथ वास्तुकार (The Architect)
यह पेपर SONAR-LLM पेश करता है। यह दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ता है।

सोचिए कि SONAR-LLM एक वास्तुकार (Architect) है जो "वाक्य ब्लूप्रिंट" में सोचता है लेकिन "ईंटों" में बोलता है।

  1. ब्लूप्रिंट में सोचना: स्वप्नद्रष्टा की तरह, SONAR-LLM अपने पूरे वाक्य को एक इकाई के रूप में अनुमान लगाकर अपनी कहानी की योजना बनाता है। यह अगले शब्द की चिंता नहीं करता; यह अगले विचार की चिंता करता है। यह इसे लंबा उपन्यास लिखने के लिए भी तेज़ और कुशल बनाए रखता है।
  2. ईंटों में बोलना: यहाँ जादू का मंत्र है। एक बार जब वास्तुकार के पास "ब्लूप्रिंट" (वाक्य का विचार) आ जाता है, तो वह केवल शब्दों का अनुमान नहीं लगाता। वह उस ब्लूप्रिंट को एक जमे हुए (frozen), पूर्व-प्रशिक्षित अनुवादक (SONAR डिकोडर) के माध्यम से गुज़ारता है। यह अनुवादक अमूर्त विचारों को पूर्ण, व्याकरणिक रूप से सही वाक्यों में बदलने में विशेषज्ञ है।
  3. फीडबैक लूप: मॉडल को फिर इस आधार पर ग्रेड किया जाता है कि इसके द्वारा बनाए गए वास्तविक शब्द लक्षित कहानी के साथ कितनी अच्छी तरह मेल खाते हैं। यह इसे सीखने के लिए एक स्पष्ट, स्थिर संकेत देता है (स्वप्नद्रष्टा के विपरीत), जिससे यह सुनिश्चित होता है कि अंतिम कहानी स्वाभाविक और मानवीय लगे।

यह एक बड़ी बात क्यों है?

  • गति बनाम गुणवत्ता: यह स्वप्नद्रष्टा की तरह तेज़ है (क्योंकि यह एक बार में पूरे वाक्यों को प्रोसेस करता है) लेकिन ईंट बिछाने वाले की तरह सटीक भी है (क्योंकि इसे वास्तविक शब्दों पर ग्रेड किया जाता है)।
  • लंबी कहानियाँ: पेपर दिखाता है कि बहुत लंबे टेक्स्ट (10 लाख शब्दों तक) के लिए, SONARD-LLM मानक मॉडलों की तुलना में बहुत अधिक कुशल हो जाता है। यह कदम-दर-कदम चलने के बजाय लंबी छलांग लगाने जैसा है; यात्रा जितनी लंबी होगी, लाभ उतना ही बड़ा होगा।
  • "फ्रीजिंग" का रहस्य: टीम ने "अनुवादक" (डिकोडर) को फ्रीज़ रखा, जिसका अर्थ है कि उन्होंने इसे फिर से प्रशिक्षित नहीं किया। इससे भारी मात्रा में कंप्यूटिंग शक्ति बचाई जा गई। उन्होंने केवल "वास्तुकार" वाले हिस्से को प्रशिक्षित किया जो यह तय करता है कि अगला वाक्य क्या होना चाहिए।

उन्होंने क्या पाया?

  • बेहतर कहानियाँ: जब उन्होंने एक AI जज (GPT-4o) से कहानियों को रेट करने के लिए कहा, तो SONAR-LLM ने पिछले "स्वप्नद्रष्टा" मॉडलों की तुलना में बेहतर, अधिक रचनात्मक और अधिक सुसंगत कहानियाँ लिखीं।
  • सारांश बनाना: यह लंबे लेखों को छोटे, प्रभावशाली वाक्यों में सारांशित करने में भी बहुत अच्छा था।
  • एक पेच (The Catch): यदि किसी कार्य के लिए अत्यधिक सटीकता की आवश्यकता है (जैसे घास के ढेर में किसी विशिष्ट फ़ोन नंबर को खोजना), तो मॉडल सबसे अच्छा काम करता है यदि आप अनुवादक को अनफ्रीज़ (unfreeze) कर दें और उसे उन विशिष्ट विवरणों को सीखने दें। लेकिन सामान्य कहानी कहने और सारांश बनाने के लिए, इसे फ्रीज़ रखना एकदम सही है।

संक्षेप में:
SONAR-LLM एक नए प्रकार का AI लेखक है जो तेज़ रहने के लिए अपनी कहानियों को बड़े, सार्थक हिस्सों (वाक्यों) में नियोजित करता है, लेकिन उन हिस्सों को पूर्ण शब्दों में अनुवाद करने के लिए एक भरोसेमंद विशेषज्ञ का उपयोग करता है। यह इसे लंबी कहानियों के लिए वर्तमान मॉडलों की तुलना में तेज़ बनाता है, बिना लेखन की गुणवत्ता से समझौता किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →