← नवीनतम पेपर
💬 NLP

LK Losses: Direct Acceptance Rate Optimization for Speculative Decoding

यह शोध पत्र LK losses को प्रस्तुत करता है, जो एक नया प्रशिक्षण उद्देश्य (training objective) है जो बड़े भाषा मॉडलों (large language models) के लिए स्पेक्युलेटिव डिकोडिंग (speculative decoding) की स्वीकृति दर (acceptance rate) को सीधे अनुकूलित करता है, जो बिना किसी अतिरिक्त गणनात्मक ओवरहेड (computational overhead) के विविध मॉडल आर्किटेक्चर और डोमेन में मानक KL डाइवर्जेंस-आधारित प्रशिक्षण पर निरंतर प्रदर्शन लाभ प्रदर्शित करता है।

मूल लेखक: Alexander Samarin, Sergei Krutikov, Anton Shevtsov, Sergei Skvortsov, Filipp Fisin, Alexander Golubev

प्रकाशित 2026-03-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alexander Samarin, Sergei Krutikov, Anton Shevtsov, Sergei Skvortsov, Filipp Fisin, Alexander Golubev

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ (Target Model) हैं जो एक जटिल भोजन बनाने की कोशिश कर रहे हैं। आप अविश्वसनीय रूप से प्रतिभाशाली हैं, लेकिन आप बहुत धीमे भी हैं क्योंकि आपको अगले कदम पर बढ़ने से पहले हर एक सामग्री को चखना और एडजस्ट करना पड़ता है। वर्तमान AI मॉडल इसी तरह टेक्स्ट जनरेट करते हैं: शब्द दर शब्द, बहुत सावधानी से।

इस प्रक्रिया को तेज करने के लिए, आपने एक तेज़, ऊर्जावान sous-chef (सहायक शेफ) को काम पर रखा है (Draft Model)। यह sous-chef जल्दी से उन 5 या 10 सामग्रियों का अनुमान लगा लेता है जिनकी आपको शायद आवश्यकता होगी और उन्हें काउंटर पर सजा देता है। फिर आप उन पर एक नज़र डालते हैं। यदि आपकी मास्टर शेफ वाली अंतर्दृष्टि (intuition) उनके अनुमान से सहमत होती है, तो आप उस पूरे बैच को तुरंत स्वीकार कर लेते हैं। यदि sous-chef ने गलत अनुमान लगाया, तो आप उस बैच को फेंक देते हैं और फिर से शुरू करते हैं।

आपकी रसोई की गति पूरी तरह से इस बात पर निर्भर करती है कि sous-chef कितनी बार सही अनुमान लगाता है। इसे Acceptance Rate (स्वीकृति दर) कहा जाता है।

समस्या: "काफी अच्छा है" वाला जाल (The "Good Enough" Trap)

लंबे समय तक, इन sous-chefs को प्रशिक्षित करने का तरीका यह था:
"Sous-chef, मेरी रेसिपी बुक की हुबहू नकल करने की कोशिश करो।"

गणित की भाषा में, इसे KL Divergence को कम करना कहा जाता है। यह वैसा ही है जैसे sous-chef को आपकी पूरी कुकबुक याद करने के लिए कहना।

  • सिद्धांत (Theory): यदि sous-chef आपकी पूरी तरह से नकल करता है, तो वे हर शब्द का सही अनुमान लगाएंगे, और आप बहुत तेज़ होंगे।
  • वास्तविकता (Reality): Sous-chef छोटा है और उसका दिमाग बहुत छोटा है (सीमित कंप्यूटिंग पावर)। वे आपकी 1,000 पन्नों की कुकबुक को याद नहीं कर सकते। इसलिए, वे आपकी किताब की समग्र शैली (overall style) को कॉपी करने की पूरी कोशिश करते हैं।
  • गड़बड़ी (Glitch): कभी-कभी, sous-chef शैली को इतनी अच्छी तरह से कॉपी करता है कि वे एक आदर्श छात्र की तरह दिखते हैं, लेकिन फिर भी वे आपके वर्तमान व्यंजन के लिए गलत विशिष्ट शब्दों का अनुमान लगाते हैं। उन्होंने "शैली में अंतर" को तो कम कर दिया, लेकिन "सही अनुमान लगाने की संख्या" को बढ़ाने में विफल रहे।

यह एक ऐसे छात्र की तरह है जिसने इतिहास की पाठ्यपुस्तक की 'वाइब' (vibe) को तो रट लिया, लेकिन विशिष्ट बहुविकल्पीय प्रश्नों (multiple-choice questions) में फेल हो गया। वे स्मार्ट दिखते हैं, लेकिन अंक प्राप्त नहीं कर पाते।

समाधान: LK Losses (The "Direct Hit" Strategy)

इस पेपर के लेखक कहते हैं: "Sous-chef को पूरी किताब कॉपी करने के लिए कहना बंद करें। बस उन्हें अगला शब्द सही ढंग से पहचानने के लिए कहें।"

उन्होंने एक नई प्रशिक्षण विधि पेश की जिसे LK Losses कहा जाता है। "मेरे जैसा बनो" कहने के बजाय, वे कहते हैं, "यदि तुम इस शब्द का सही अनुमान लगाते हो, तो तुम्हें एक पॉइंट मिलेगा। यदि नहीं, तो तुम्हें शून्य मिलेगा।"

वे इसके दो तरीके प्रदान करते हैं:

1. "सब कुछ या कुछ नहीं" वाला कोच (Likelihood-Based)

यह कोच sous-chef के अनुमानों को देखता है और कहता है: "मुझे इस बात से फर्क नहीं पड़ता कि तुम्हारी व्याकरण मेरी तरह कितनी सटीक है। मुझे केवल इस बात से मतलब है कि क्या तुमने वही शब्द चुना जो मैं चुनता। यदि हाँ, तो बहुत बढ़िया! यदि नहीं, तो फिर से प्रयास करो।"

  • उपमा (Analogy): यह एक डार्टबोर्ड की तरह है। आपको इस बात से फर्क नहीं पड़ता कि डार्ट बुल्सआई (bullseye) के पास लगा है या नहीं; आपको केवल इस बात से मतलब है कि क्या वह बुल्सआई पर लगा है। यह sous-chef को पूरी तरह से उच्च-संभावना वाले लक्ष्यों पर ध्यान केंद्रित करने के लिए मजबूर करता है।

2. "स्मार्ट हाइब्रिड" कोच (Adaptive Blending)

यह पेपर का सुपरस्टार है। यह कोच इस बारे में बहुत समझदार है कि कब किस रणनीति का उपयोग किया जाए।

  • प्रारंभिक प्रशिक्षण (The "Learning to Walk" Phase): जब sous-chef एक बिल्कुल नौसिखिया होता है और रैंडम अनुमान लगा रहा होता है, तो कोच कहता है, "ठीक है, बस मेरी शैली की नकल करने की कोशिश करो (KL Divergence) ताकि तुम पूरी तरह से भटक न जाओ।" यह sous-chef को एक सुगम रास्ता प्रदान करता है।
  • देर से प्रशिक्षण (The "Pro" Phase): एक बार जब sous-chef थोड़ा बेहतर हो जाता है, तो कोच अपनी रणनीति बदल देता है। "ठीक है, तुम शैली जानते हो। अब, मेरी तरह दिखने की चिंता छोड़ो और लक्ष्य को हिट करने (Acceptance Rate) पर ध्यान दो।"
  • उपमा (Analogy): इसे ड्राइविंग सीखने जैसा समझें। पहले, आप सड़क के नियमों को सीखते हैं और स्टीयरिंग करना सीखते हैं (शिक्षक की नकल करना)। एक बार जब आप सहज हो जाते हैं, तो इंस्ट्रक्टर स्टीयरिंग तकनीक की परवाह करना छोड़ देता है और केवल इस बात पर ध्यान देता है कि क्या आप अपनी लेन में रहते हैं और किनारे से टकराने से बचते हैं (वास्तविक लक्ष्य)।

यह क्यों महत्वपूर्ण है?

लेखकों ने इसका परीक्षण विशाल AI मॉडलों पर किया (कुछ 685 बिलियन पैरामीटर्स जितने बड़े) और पाया कि:

  1. यह हर जगह काम करता है: चाहे AI कोड लिख रहा हो, गणित के सवाल हल कर रहा हो, या चैट कर रहा हो, "डायरेक्ट हिट" रणनीति sous-chef को अधिक बार सही अनुमान लगाने में मदद करती है।
  2. यह छोटे मॉडलों की सबसे अधिक मदद करता है: छोटे, कमजोर sous-chefs (कम क्षमता वाले मॉडल्स) को सबसे अधिक लाभ हुआ। वे पूरी किताब याद नहीं कर सकते थे, इसलिए उन्हें विशिष्ट "अगले शब्द" पर ध्यान केंद्रित करने के लिए मजबूर करना एक गेम-चेंजर साबित हुआ।
  3. यह मुफ्त है: यह नई विधि प्रशिक्षण को धीमा नहीं करती है और न ही इसके लिए अधिक कंप्यूटर पावर की आवश्यकता होती है। यह केवल छात्र को ग्रेड देने का एक अलग तरीका है।

निष्कर्ष (The Bottom Line)

यह पेपर AI सहायकों को तेज़ बनाने के लिए उन्हें प्रशिक्षित करने के तरीके में मौजूद एक दोष को ठीक करता है। उन्हें बड़े दिमाग (जो कि असंभव है) की परफेक्ट कॉपी बनने के लिए प्रशिक्षित करने के बजाय, हम उन्हें भाग्यशाली अनुमान लगाने वाले (lucky guessers) के रूप में प्रशिक्षित करते हैं जो सही उत्तर को अधिक बार हिट करते हैं।

"मेरी शैली को कॉपी करो" से "लक्ष्य को हिट करो" में स्विच करके, AI टेक्स्ट को औसतन 8% से 10% तेज़ी से जनरेट कर सकता है, जिससे हमारे AI के साथ संवाद बहुत अधिक चुस्त और रिस्पॉन्सिव महसूस होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →