← नवीनतम पेपर
💬 NLP

Learning Tractable Distributions Of Language Model Continuations

यह शोध पत्र "लर्निंग टू लुक अहेड" (LTLA) प्रस्तावित करता है, जो एक हाइब्रिड विधि है जो पूर्ण-शब्दावली पुनर्मूल्यांकन (full-vocabulary rescoring) की उच्च कम्प्यूटेशनल लागत के बिना, विशिष्ट बाधाओं (जैसे कि सिंटैक्स या सुरक्षा) की ओर ऑटोरेग्रेसिव लैंग्वेज मॉडल्स को कुशलतापूर्वक निर्देशित करने के लिए एक साझा, सुलभ हिडन मार्कोव मॉडल (HMM) को न्यूरल एम्बेडिंग्स के साथ जोड़ता है।

मूल लेखक: Gwen Yidou-Weng, Ian Li, Anji Liu, Oliver Broadrick, Yuchen Cui, Guy Van den Broeck, Benjie Wang

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Gwen Yidou-Weng, Ian Li, Anji Liu, Oliver Broadrick, Yuchen Cui, Guy Van den Broeck, Benjie Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "मेरा वाक्य पूरा करो" नामक एक खेल खेल रहे हैं, लेकिन एक ट्विस्ट के साथ: आप केवल अगले शब्द का अनुमान लगाने की कोशिश नहीं कर रहे हैं; बल्कि आप एक कहानी के पूरे अंत का अनुमान लगाने की कोशिश कर रहे हैं ताकि यह सुनिश्चित हो सके कि वह एक विशिष्ट नियम का पालन करता है (जैसे कि "कहानी का अंत एक सुखद शादी के साथ होना चाहिए" या "कहानी में कभी भी 'बुरा' शब्द का उपयोग नहीं होना चाहिए")।

समस्या: "आंखों पर पट्टी बांधा हुआ भविष्यवक्ता"

वर्तमान AI मॉडल (जैसे ChatGPT) बहुत बुद्धिमान लेखकों की तरह हैं, लेकिन वे थोड़े "दूरदर्शिता की कमी" वाले भी हैं। वे अगले शब्द की भविष्यवाणी करने में बहुत अच्छे हैं, लेकिन वे यह देखने में संघर्ष करते हैं कि वाक्य किस दिशा में जा रहा है।

यदि आप एक AI को कहते हैं, "एक ऐसी कहानी लिखें जिसका अंत सुखद हो," तो AI लिखना शुरू कर देता है, लेकिन उसे वास्तव में यह पता नहीं होता कि वह वर्तमान पथ पर है या नहीं कि क्या वह एक सुखद अंत की ओर ले जाएगा, जब तक कि बहुत देर न हो जाए। यह जांचने के लिए कि क्या कोई वाक्य सही दिशा में जा रहा है, AI को आमतौर पर अपने दिमाग में हजारों अलग-अलग संभावित भविष्यों का "सिमुलेशन" करना पड़ता है। यह एक भविष्यवक्ता की तरह है जो हर एक संभावित टाइमलाइन को एक-एक करके जीकर भविष्य की भविष्यवाणी करने की कोशिश करता है—इसमें बहुत समय लगता है और बहुत अधिक मानसिक शक्ति (कंप्यूटेशन) खर्च होती है।

समाधान: LTLA ("कहानी कहने के लिए GPS")

शोधकर्ताओं ने एक नई विधि बनाई है जिसे LTLA (Looking Ahead - आगे देखना) कहा जाता है। LTLA को AI के विचारों के लिए एक हाई-टेक GPS सिस्टम देने के रूप में समझें।

AI को हर संभावित भविष्य का सिमुलेशन करने की आवश्यकता है या नहीं, यह देखने के लिए कि क्या वह किसी "डेड एंड" (जैसे कि दुखद अंत या जहरीले शब्द) पर पहुँच जाता है, इसके बजाय LTLA मस्तिष्क को दो विशिष्ट भागों में विभाजित करता है:

  1. इतिहासकार (The Transformer/LM): यह भाग देखता है कि अब तक जो कुछ भी कहा गया है वह क्या है। यह संदर्भ, मूड और पात्रों को समझता है। यह एक ऐसे व्यक्ति की तरह है जो कथानक को समझने के लिए किताब पढ़ रहा है।
  2. नेविगेटर (The HMM/Tractable Surrogate): यह एक बहुत छोटा, बिजली की गति से चलने वाला गणितीय इंजन है। हर संभावित भविष्य का सिमुलेशन करने के बजाय, यह तुरंत गणना करता है कि कहानी किस दिशा में जा रही है इसकी संभावना क्या है।

यह कैसे काम करता है: "शॉर्टकट"

पुराने तरीके में, यदि आप 10,000 संभावित अंतों की जांच करना चाहते थे, तो आपको 10,000 भारी गणनाएं करनी पड़ती थीं।

LTLA के साथ, "इतिहासकार" वर्तमान वाक्य को देखता है और "नेविगेटर" को एक त्वरित "वाइब चेक" (लेटेंट प्रायर) भेजता है। नेविगेटर फिर एक गणितीय शॉर्टकट का उपयोग करके कहता है, "इस वाइब के आधार पर, 80% संभावना है कि हम एक सुखद अंत की ओर बढ़ रहे हैं।"

यह जंगल के हर रास्ते पर चलकर यह देखने के अंतर जैसा है कि कौन सा रास्ता बाहर की ओर ले जाता है (पुराना तरीका) और हेलीकॉप्टर से एक मानचित्र देखकर यह देखने के अंतर जैसा कि कौन सा रास्ता साफ है (LTLA तरीका)।

यह क्यों महत्वपूर्ण है (परिणाम)

क्योंकि यह "GPS" बहुत तेज़ और सटीक है, शोधकर्ताओं ने तीन बड़ी जीत देखीं:

  • पूर्ण नियम-पालन: यदि आप AI को एक विशिष्ट व्याकरणिक पैटर्न का पालन करने के लिए कहते हैं, तो वह लक्ष्य को 100% बार प्राप्त करता है। यह एक ऐसे ड्राइवर की तरह है जो कभी भी मोड़ नहीं चूकता क्योंकि GPS ने उसे ठीक समय पर स्टीयरिंग करने के लिए बताया था।
  • बेहतर व्यवहार (Detoxification): यह एक मील दूर से ही देख सकता है कि कोई जहरीला या घृणास्पद वाक्य आने वाला है और खराब शब्दों के टाइप होने से पहले ही बातचीत को दूसरे दिशा में मोड़ सकता है।
  • सुपर स्पीड: अधिकांश "स्मार्ट" तरीके जो AI को नियंत्रित करते हैं, वे इसे अविश्वसनीय रूप से धीमा बना देते हैं (जैसे कीचड़ में चलता हुआ कार)। LTLA एक हल्के रेसिंग स्पॉइलर को जोड़ने जैसा है—यह कार को मोड़ों पर बेहतर ढंग से संभालने में सक्षम बनाता है, लेकिन यह कंप्यूटर पर केवल थोड़ा सा अतिरिक्त भार (केवल लगभग 14% अधिक काम) ही डालता है।

संक्षेप में: LTLA AI को उसके शब्दों के परिणामों को "आगे देखने" की क्षमता देता है, बिना "क्या होगा अगर" के अंतहीन लूप में फंसे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →