Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
यह शोध पत्र LenVM को प्रस्तुत करता है, जो एक स्केलेबल, एनोटेशन-मुक्त फ्रेमवर्क है जो शेष जनरेशन लंबाई को टोकन-स्तरीय मान संकेत (value signal) के रूप में मॉडल करता है, जिससे सटीक लंबाई मिलान में महत्वपूर्ण सुधार होता है और ऑटोरेग्रेसिव मॉडलों में प्रदर्शन-दक्षता के बीच निरंतर नियंत्रण सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कहानीकार को कहानी सुनाते हुए देख रहे हैं। कभी-कभी वे कुछ वाक्यों के बाद रुक जाते हैं; अन्य समय में वे घंटों तक बड़बड़ाते रहते हैं। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, यह "कहानी सुनाना" टेक्स्ट को, टोकन दर टोकन, जेनरेट करने की प्रक्रिया है।
समस्या यह है कि वर्तमान AI मॉडल ऐसे कहानीकारों की तरह हैं जिन्हें यह नहीं पता कि कब रुकना है। वे बहुत जल्दी रुक सकते हैं (कहानी अधूरी छोड़ देते हैं) या बहुत लंबे समय तक चल सकते हैं (समय और पैसा बर्बाद करते हैं)। इसे नियंत्रित करने के मौजूदा तरीके एक बहुत ही साधारण निर्देश देने जैसे हैं जो बिल्कुल शुरुआत में दिया जाता है: "एक 5 मिनट की कहानी सुनाओ।" कहानीकार को एक भी शब्द बोलने से पहले पूरी लंबाई का अनुमान लगाना पड़ता है, जिससे अक्सर गलतियाँ होती हैं।
यह पेपर एक नया टूल पेश करता है जिसे LenVM (Length Value Model) कहा जाता है। LenVM को एक स्मार्ट आंतरिक दिशा-सूचक यंत्र (internal compass) के रूप में सोचें जिसे AI अपने साथ लेकर चलता है जबकि वह बोल रहा होता है।
मुख्य विचार: "समाप्ति तक की दूरी" का दिशा-सूचक यंत्र
कुल कहानी की लंबाई का अनुमान लगाने के बजाय, LenVM हर एक कदम पर एक सरल प्रश्न का उत्तर देता है: "मुझे और कितनी दूर जाना है?"
यह कैसे काम करता है, यहाँ कुछ उपमाएँ दी गई हैं:
1. "टोल रोड" की उपमा
कल्पना कीजिए कि AI एक हाईवे पर गाड़ी चला रहा है। हर बार जब वह एक शब्द (एक "टोकन") जेनरेट करता है, तो उसे एक छोटा सा टोल देना पड़ता है।
- लक्ष्य: AI चाहता है कि वह (वाक्य के अंत तक) गंतव्य तक यथासंभव कुशलता से पहुँचे।
- गणना: LenVM गणना करता है कि AI इस सटीक क्षण से यात्रा के अंत तक कुल कितना "टोल" चुकाने की उम्मीद करता है।
- परिणाम: यदि AI अभी एक लंबी व्याख्या शुरू कर रहा है, तो "कुल टोल" अधिक होगा (एक बड़ी नकारात्मक संख्या)। यदि AI समाप्त करने वाला है, तो "कुल टोल" बहुत कम होगा (शून्य के करीब)।
2. "थर्मोस्टेट" की उपमा
आमतौर पर, AI जनरेशन एक हीटर की तरह होता है जो तब तक गर्मी फेंकता रहता है जब तक कि आप इसे मैन्युअल रूप से बंद न कर दें। LenVM एक स्मार्ट थर्मोस्टेट की तरह काम करता है। यह लगातार महसूस करता है कि कमरा लक्ष्य तापमान (लक्षित लंबाई) के कितने करीब है।
- यदि AI को जल्द ही रुकने की आवश्यकता है, तो LenVM संकेत देता है: "हम करीब हैं! ऐसे शब्द चुनें जो जल्दी समाप्ति की ओर ले जाएं।"
- यदि AI को चलते रहने की आवश्यकता है, तो LenVM संकेत देता है: "हम दूर हैं! ऐसे शब्द चुनें जो अधिक विवरण की अनुमति दें।"
LenVM वास्तव में क्या करता है (पेपर के दावे)
शोधकर्ताओं ने इस "दिशा-सूचक यंत्र" को एक चतुर ट्रिक का उपयोग करके प्रशिक्षित किया है: उन्हें डेटा को लेबल करने के लिए इंसानों की आवश्यकता नहीं थी। उन्होंने बस AI को कहानियाँ जेनरेट करने दिया, शब्दों को गिना, और LenVM को उन कहानियों को पूरा करने की "शेष लागत" (remaining cost) का अनुमान लगाना सिखाया। क्योंकि यह हर एक शब्द पर होता है, इसलिए प्रशिक्षण डेटा विशाल और स्वचालित है।
यहाँ वह है जो यह पेपर साबित करता है कि LenVM कर सकता है:
1. सटीक लंबाई नियंत्रण (एक "सटीक फिट" होने वाला दर्जी)
यदि आप AI को ठीक 500 शब्द लिखने के लिए कहते हैं, तो मानक मॉडल अक्सर लक्ष्य से काफी चूक जाते हैं। LenVM एक मापने वाले टेप के साथ एक दर्जी की तरह काम करता है।
- परिणाम: LIFEBench नामक एक टेस्ट पर, LenVM का उपयोग करने वाले एक मानक 7-बिलियन-पैरामीटर मॉडल ने सटीक शब्द गणना को हिट करने की अपनी क्षमता को 30.9 से बढ़ाकर 64.8 कर दिया।
- तुलना: LenVM के साथ यह ओपन-सोर्स मॉडल सटीक लंबाई को हिट करने में कुछ सबसे उन्नत, क्लोज्ड-सोर्स "ब्लैक बॉक्स" मॉडलों (जैसे GPT-4o या Claude) से भी बेहतर प्रदर्शन करता है जो सरल प्रॉम्प्ट्स पर निर्भर करते हैं।
2. "एफिशिएंसी डायल" (प्रदर्शन बनाम गति का ट्रेड-ऑफ)
कभी-कभी आप एक सटीक, लंबा उत्तर चाहते हैं। कभी-कभी आप एक त्वरित, "काम चलाऊ" उत्तर चाहते हैं।
- परिणाम: LenVM आपको एक डायल घुमाने की अनुमति देता है। आप AI को कह सकते हैं, "मुझे अपना सबसे अच्छा उत्तर दें, लेकिन कोशिश करें कि यह 200 शब्दों के भीतर रहे।"
- जादू: बिना LenVM के, यदि आप AI को 200 शब्दों पर रुकने के लिए मजबूर करते हैं, तो गणित की समस्याओं पर इसकी सटीकता गिरकर 6% रह जाती है। LenVM द्वारा शब्दों के चयन को निर्देशित करने के साथ, सटीकता उच्च 63% पर बनी रहती है। यह उन "शॉर्टकट" को खोज लेता है जिन्हें AI पहले से जानता है लेकिन आमतौर पर अनदेखा कर देता है।
3. "क्रिस्टल बॉल" (भवििकावाणी करना)
LenVM शुरुआती प्रॉम्प्ट को देख सकता है (AI द्वारा एक भी शब्द बोलने से पहले) और यह अनुमान लगा सकता है कि उत्तर कितना लंबा होगा।
- परिणाम: यह उच्च सटीकता के साथ किसी गणित की समस्या के समाधान या कोड स्निपेट की लंबाई का अनुमान लगा सकता है। यह कंप्यूटरों को काम शुरू करने से पहले ही अपनी मेमोरी और बजट की योजना बनाने में मदद करता है।
4. "एक्स-रे विजन" (AI के मन को समझना)
चूंकि LenVM हर कदम पर "समाप्ति तक की दूरी" की जांच करता है, यह प्रकट करता है कि AI कहाँ रुकने या चलने का निर्णय लेता है।
- खोज: पेपर में पाया गया कि "Ah," "Wait," या "Let's think" जैसे शब्द अक्सर संकेत देते हैं कि AI एक लंबी यात्रा शुरू करने वाला है (एक "पॉजिटिव लेंथ टोकन")। "Therefore," "Perfect," या चेक मार्क (✓) जैसे इमोजी संकेत देते हैं कि AI समापन कर रहा है (एक "नेगेटिव लेंथ टोकन")। यह हमें AI की तर्क प्रक्रिया में एक खिड़की प्रदान करता है।
सारांश
LenVM AI को यह समझने का एक नया तरीका है कि उसकी अपनी "फिनिश लाइन से दूरी" कितनी है। यह लंबाई की अस्पष्ट अवधारणा को एक सटीक, गणितीय संकेत में बदल देता है जिसका उपयोग AI वास्तविक समय में कर सकता है।
- यह एनोटेशन-मुक्त है: यह स्वतः ही AI के अपने आउटपुट से सीखता है।
- यह स्केलेबल है: जैसे-जैसे AI बड़ा होता है, यह बेहतर काम करता है।
- यह व्यावहारिक है: यह हमें AI के दिमाग को बदले बिना, केवल उसके शब्दों के चुनाव को निर्देशित करके, यह नियंत्रित करने की अनुमति देता है कि वह कितनी देर तक बात करेगा।
पेपर निष्कर्ष निकालता है कि यह "टोकन-लेवल वैल्यू सिग्नल" AI को अधिक कुशल, पूर्वानुमानित और नियंत्रणीय बनाने के लिए एक शक्तिशाली नया उपकरण है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।