← नवीनतम पेपर
💬 NLP

Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling

यह शोध पत्र LenVM को प्रस्तुत करता है, जो एक स्केलेबल, एनोटेशन-मुक्त फ्रेमवर्क है जो शेष जनरेशन लंबाई को टोकन-स्तरीय मान संकेत (value signal) के रूप में मॉडल करता है, जिससे सटीक लंबाई मिलान में महत्वपूर्ण सुधार होता है और ऑटोरेग्रेसिव मॉडलों में प्रदर्शन-दक्षता के बीच निरंतर नियंत्रण सक्षम होता है।

मूल लेखक: Zhen Zhang, Changyi Yang, Zijie Xia, Zhen Yang, Chengzhi Liu, Zhaotiao Weng, Yepeng Liu, Haobo Chen, Jin Pan, Chenyang Zhao, Yuheng Bu, Alkesh Patel, Zhe Gan, Xin Eric Wang

प्रकाशित 2026-05-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhen Zhang, Changyi Yang, Zijie Xia, Zhen Yang, Chengzhi Liu, Zhaotiao Weng, Yepeng Liu, Haobo Chen, Jin Pan, Chenyang Zhao, Yuheng Bu, Alkesh Patel, Zhe Gan, Xin Eric Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानीकार को कहानी सुनाते हुए देख रहे हैं। कभी-कभी वे कुछ वाक्यों के बाद रुक जाते हैं; अन्य समय में वे घंटों तक बड़बड़ाते रहते हैं। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, यह "कहानी सुनाना" टेक्स्ट को, टोकन दर टोकन, जेनरेट करने की प्रक्रिया है।

समस्या यह है कि वर्तमान AI मॉडल ऐसे कहानीकारों की तरह हैं जिन्हें यह नहीं पता कि कब रुकना है। वे बहुत जल्दी रुक सकते हैं (कहानी अधूरी छोड़ देते हैं) या बहुत लंबे समय तक चल सकते हैं (समय और पैसा बर्बाद करते हैं)। इसे नियंत्रित करने के मौजूदा तरीके एक बहुत ही साधारण निर्देश देने जैसे हैं जो बिल्कुल शुरुआत में दिया जाता है: "एक 5 मिनट की कहानी सुनाओ।" कहानीकार को एक भी शब्द बोलने से पहले पूरी लंबाई का अनुमान लगाना पड़ता है, जिससे अक्सर गलतियाँ होती हैं।

यह पेपर एक नया टूल पेश करता है जिसे LenVM (Length Value Model) कहा जाता है। LenVM को एक स्मार्ट आंतरिक दिशा-सूचक यंत्र (internal compass) के रूप में सोचें जिसे AI अपने साथ लेकर चलता है जबकि वह बोल रहा होता है।

मुख्य विचार: "समाप्ति तक की दूरी" का दिशा-सूचक यंत्र

कुल कहानी की लंबाई का अनुमान लगाने के बजाय, LenVM हर एक कदम पर एक सरल प्रश्न का उत्तर देता है: "मुझे और कितनी दूर जाना है?"

यह कैसे काम करता है, यहाँ कुछ उपमाएँ दी गई हैं:

1. "टोल रोड" की उपमा
कल्पना कीजिए कि AI एक हाईवे पर गाड़ी चला रहा है। हर बार जब वह एक शब्द (एक "टोकन") जेनरेट करता है, तो उसे एक छोटा सा टोल देना पड़ता है।

  • लक्ष्य: AI चाहता है कि वह (वाक्य के अंत तक) गंतव्य तक यथासंभव कुशलता से पहुँचे।
  • गणना: LenVM गणना करता है कि AI इस सटीक क्षण से यात्रा के अंत तक कुल कितना "टोल" चुकाने की उम्मीद करता है।
  • परिणाम: यदि AI अभी एक लंबी व्याख्या शुरू कर रहा है, तो "कुल टोल" अधिक होगा (एक बड़ी नकारात्मक संख्या)। यदि AI समाप्त करने वाला है, तो "कुल टोल" बहुत कम होगा (शून्य के करीब)।

2. "थर्मोस्टेट" की उपमा
आमतौर पर, AI जनरेशन एक हीटर की तरह होता है जो तब तक गर्मी फेंकता रहता है जब तक कि आप इसे मैन्युअल रूप से बंद न कर दें। LenVM एक स्मार्ट थर्मोस्टेट की तरह काम करता है। यह लगातार महसूस करता है कि कमरा लक्ष्य तापमान (लक्षित लंबाई) के कितने करीब है।

  • यदि AI को जल्द ही रुकने की आवश्यकता है, तो LenVM संकेत देता है: "हम करीब हैं! ऐसे शब्द चुनें जो जल्दी समाप्ति की ओर ले जाएं।"
  • यदि AI को चलते रहने की आवश्यकता है, तो LenVM संकेत देता है: "हम दूर हैं! ऐसे शब्द चुनें जो अधिक विवरण की अनुमति दें।"

LenVM वास्तव में क्या करता है (पेपर के दावे)

शोधकर्ताओं ने इस "दिशा-सूचक यंत्र" को एक चतुर ट्रिक का उपयोग करके प्रशिक्षित किया है: उन्हें डेटा को लेबल करने के लिए इंसानों की आवश्यकता नहीं थी। उन्होंने बस AI को कहानियाँ जेनरेट करने दिया, शब्दों को गिना, और LenVM को उन कहानियों को पूरा करने की "शेष लागत" (remaining cost) का अनुमान लगाना सिखाया। क्योंकि यह हर एक शब्द पर होता है, इसलिए प्रशिक्षण डेटा विशाल और स्वचालित है।

यहाँ वह है जो यह पेपर साबित करता है कि LenVM कर सकता है:

1. सटीक लंबाई नियंत्रण (एक "सटीक फिट" होने वाला दर्जी)
यदि आप AI को ठीक 500 शब्द लिखने के लिए कहते हैं, तो मानक मॉडल अक्सर लक्ष्य से काफी चूक जाते हैं। LenVM एक मापने वाले टेप के साथ एक दर्जी की तरह काम करता है।

  • परिणाम: LIFEBench नामक एक टेस्ट पर, LenVM का उपयोग करने वाले एक मानक 7-बिलियन-पैरामीटर मॉडल ने सटीक शब्द गणना को हिट करने की अपनी क्षमता को 30.9 से बढ़ाकर 64.8 कर दिया।
  • तुलना: LenVM के साथ यह ओपन-सोर्स मॉडल सटीक लंबाई को हिट करने में कुछ सबसे उन्नत, क्लोज्ड-सोर्स "ब्लैक बॉक्स" मॉडलों (जैसे GPT-4o या Claude) से भी बेहतर प्रदर्शन करता है जो सरल प्रॉम्प्ट्स पर निर्भर करते हैं।

2. "एफिशिएंसी डायल" (प्रदर्शन बनाम गति का ट्रेड-ऑफ)
कभी-कभी आप एक सटीक, लंबा उत्तर चाहते हैं। कभी-कभी आप एक त्वरित, "काम चलाऊ" उत्तर चाहते हैं।

  • परिणाम: LenVM आपको एक डायल घुमाने की अनुमति देता है। आप AI को कह सकते हैं, "मुझे अपना सबसे अच्छा उत्तर दें, लेकिन कोशिश करें कि यह 200 शब्दों के भीतर रहे।"
  • जादू: बिना LenVM के, यदि आप AI को 200 शब्दों पर रुकने के लिए मजबूर करते हैं, तो गणित की समस्याओं पर इसकी सटीकता गिरकर 6% रह जाती है। LenVM द्वारा शब्दों के चयन को निर्देशित करने के साथ, सटीकता उच्च 63% पर बनी रहती है। यह उन "शॉर्टकट" को खोज लेता है जिन्हें AI पहले से जानता है लेकिन आमतौर पर अनदेखा कर देता है।

3. "क्रिस्टल बॉल" (भवििकावाणी करना)
LenVM शुरुआती प्रॉम्प्ट को देख सकता है (AI द्वारा एक भी शब्द बोलने से पहले) और यह अनुमान लगा सकता है कि उत्तर कितना लंबा होगा।

  • परिणाम: यह उच्च सटीकता के साथ किसी गणित की समस्या के समाधान या कोड स्निपेट की लंबाई का अनुमान लगा सकता है। यह कंप्यूटरों को काम शुरू करने से पहले ही अपनी मेमोरी और बजट की योजना बनाने में मदद करता है।

4. "एक्स-रे विजन" (AI के मन को समझना)
चूंकि LenVM हर कदम पर "समाप्ति तक की दूरी" की जांच करता है, यह प्रकट करता है कि AI कहाँ रुकने या चलने का निर्णय लेता है।

  • खोज: पेपर में पाया गया कि "Ah," "Wait," या "Let's think" जैसे शब्द अक्सर संकेत देते हैं कि AI एक लंबी यात्रा शुरू करने वाला है (एक "पॉजिटिव लेंथ टोकन")। "Therefore," "Perfect," या चेक मार्क (✓) जैसे इमोजी संकेत देते हैं कि AI समापन कर रहा है (एक "नेगेटिव लेंथ टोकन")। यह हमें AI की तर्क प्रक्रिया में एक खिड़की प्रदान करता है।

सारांश

LenVM AI को यह समझने का एक नया तरीका है कि उसकी अपनी "फिनिश लाइन से दूरी" कितनी है। यह लंबाई की अस्पष्ट अवधारणा को एक सटीक, गणितीय संकेत में बदल देता है जिसका उपयोग AI वास्तविक समय में कर सकता है।

  • यह एनोटेशन-मुक्त है: यह स्वतः ही AI के अपने आउटपुट से सीखता है।
  • यह स्केलेबल है: जैसे-जैसे AI बड़ा होता है, यह बेहतर काम करता है।
  • यह व्यावहारिक है: यह हमें AI के दिमाग को बदले बिना, केवल उसके शब्दों के चुनाव को निर्देशित करके, यह नियंत्रित करने की अनुमति देता है कि वह कितनी देर तक बात करेगा।

पेपर निष्कर्ष निकालता है कि यह "टोकन-लेवल वैल्यू सिग्नल" AI को अधिक कुशल, पूर्वानुमानित और नियंत्रणीय बनाने के लिए एक शक्तिशाली नया उपकरण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →