← नवीनतम पेपर
💻 computer science

AdaDec: A Uncertainty-Guided Lookahead Decoding Framework for LLM-Based Code Generation

AdaDec एक अनिश्चितता-निर्देशित अनुकूलन योग्य डिकोडिंग फ्रेमवर्क है जो एक सीखे हुए, मॉडल-विशिष्ट लुकअहेड मैकेनिज्म के माध्यम से उच्च-अनिश्चितता वाले चरणों पर टोकन को गतिशील रूप से रोकने और पुन: रैंक करने द्वारा ग्रिडी डिकोडिंग की तुलना में LLM-आधारित कोड जनरेशन सटीकता में 20.9% तक सुधार करता है।

मूल लेखक: Kaifeng He, Mingwei Liu, Chong Wang, Zike Li, Yanlin Wang, Xin Peng, Zibin Zheng

प्रकाशित 2026-04-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaifeng He, Mingwei Liu, Chong Wang, Zike Li, Yanlin Wang, Xin Peng, Zibin Zheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े घबराए हुए रोबोट से आपके लिए एक कंप्यूटर प्रोग्राम लिखने के लिए कह रहे हैं। रोबोट को बहुत सारा कोड पता है, लेकिन जब उसे अगला शब्द (या "टोकन") टाइप करने के लिए चुनना होता है, तो वह कभी-कभी थोड़ा भ्रमित हो जाता है।

AI की दुनिया में, इस प्रक्रिया को डिकोडिंग (decoding) कहा जाता है। अधिकांश रोबोट एक सरल रणनीति का उपयोग करते हैं: "उस शब्द को चुनें जो सबसे अधिक संभावित लगता है कि सही होगा।" यह एक रास्ते पर चलने जैसा है और हमेशा बाईं ओर मुड़ने जैसा है क्योंकि वह रास्ता सबसे लोकप्रिय है। आमतौर पर, यह ठीक काम करता है। लेकिन कभी-कभी, सड़क के एक महत्वपूर्ण मोड़ पर, रोबोट सबसे "लोकप्रिय" रास्ता चुन लेता है, जो वास्तव में एक डेड एंड (बंद रास्ता) या बग की ओर ले जाता है। एक बार जब वह यह गलती कर देता है, तो पूरा प्रोग्राम टूट जाता है, और वह वापस नहीं जा सकता।

यह शोध पत्र AdaDec नामक एक नई प्रणाली पेश करता है जो रोबोट को इन जालों से बचने में मदद करती है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: रोबोट का "कन्फ्यूजन मीटर" (भ्रम का मीटर)

शोधकर्ताओं ने पाया कि रोबोट हर जगह भ्रमित नहीं होता है। जब वह सरल चीजें (जैसे print या if) टाइप कर रहा होता है, तो वह आमतौर पर आत्मविश्वासी होता है। लेकिन कुछ पेचीदा क्षणों में—जैसे कि यह तय करने में कि लूप शुरू करना है या परिणाम वापस करना है—रोबोट "अनिश्चित" हो जाता है।

उन्होंने पाया कि जब रोबोट अनिश्चित होता है, तो वह अक्सर सही उत्तर को जानता भी है, लेकिन वह उसे अपना नंबर #1 विकल्प नहीं बनाता। वह सही उत्तर को नंबर #2 या #3 के रूप में रैंक करता है। यदि रोबोट अंधाधुंध होकर #1 को चुन लेता है, तो कोड टूट जाता है।

2. समाधान: "पॉज एंड पीक" (रुकें और झाँकें) रणनीति

AdaDec एक सुरक्षा निरीक्षक (safety inspector) की तरह कार्य करता है। यह रोबोट को काम करने से नहीं रोकता; यह बस एक विशेष "कन्फ्यूजन मीटर" (जिसे शैनन एंट्रॉपी/Shannon Entropy कहा जाता है) पर नज़र रखता है।

  • सामान्य मोड: जब मीटर कम होता है (रोबोट आत्मविश्वासी होता है), AdaDec रोबोट को तुरंत अगला शब्द टाइप करने देता है। यह तेज़ और कुशल है।
  • द पॉज़ (विराम): जब मीटर अचानक बढ़ता है (रोबोट भ्रमित होता है), AdaDec पॉज बटन दबा देता है। यह कहता है, "एक सेकंड रुकिए, यह जोखिम भरा लग रहा है।"

3. द लुकअहेड: "क्या होगा अगर?" परिदृश्य

एक बार जब रोबोट रुक जाता है, तो AdaDec केवल अनुमान नहीं लगाता है। यह एक त्वरित खेल खेलता है जिसे "क्या होगा अगर?" (यही लुकअहेड वाला हिस्सा है) कहा जाता है।

कल्पना कीजिए कि रोबोट सड़क के एक मोड़ पर है। केवल एक रास्ता चुनने के बजाय, AdaDec कहता है:

  • "ठीक है, मान लीजिए कि हम रास्ता A लेते हैं। अगले 5 कदम कैसे दिखते हैं? क्या यह एक चिकनी सड़क की ओर ले जाता है?"
  • "अब, मान लीजिए कि हम रास्ता B लेते हैं। क्या यह किसी खाई की ओर ले जाता है?"

यह शीर्ष कुछ विकल्पों के लिए इन संक्षिप्त भविष्य की स्थितियों का अनुकरण (simulate) करता है। यदि पथ A सिमुलेशन में एक चिकनी सड़क की ओर ले जाता है, लेकिन पथ B एक खाई की ओर ले जाता है, तो AdaDec रोबोट को पथ A चुनने के लिए मजबूर करता है, भले ही रोबोट ने मूल रूप से सोचा हो कि पथ B थोड़ा अधिक संभावित है।

4. नियम सीखना: "पर्सनलाइज्ड अलार्म" (व्यक्तिगत अलार्म)

AdaDec की सबसे स्मार्ट बात यह है कि यह हर रोबोट के लिए एक सामान्य अलार्म का उपयोग नहीं करता है। अलग-अलग रोबोट अलग-अलग स्तरों पर भ्रमित होते हैं।

  • कुछ रोबोट जल्दी घबरा जाते हैं (कम थ्रेशोल्ड)।
  • अन्य बहुत साहसी होते हैं (उच्च थ्रेशोल्ड)।

शोधकर्ताओं ने AdaDec को प्रत्येक विशिष्ट रोबोट के लिए एकदम सही अलार्म सेटिंग सीखना सिखाया। यह एक स्मोक डिटेक्टर को ट्यून करने जैसा है: आप नहीं चाहते कि वह ब्रेड टोस्ट करते समय भी चिल्लाने लगे (बहुत संवेदनशील), लेकिन आप यह भी नहीं चाहते कि आग लगने पर वह शांत रहे (पर्याप्त संवेदनशील न होना)। AdaDec प्रत्येक मॉडल के लिए सटीक 'स्वीट स्पॉट' खोज लेता है।

परिणाम: तेज़ और स्मार्ट

शोधकर्ताओं ने इसका परीक्षण कई बेंचमार्क (जैसे HumanEval+ और MBPP+) पर किया।

  • सटीकता (Accuracy): AdaDec ने रोबोट की गलतियों को काफी हद तक ठीक कर दिया। कुछ मामलों में, इसने मानक पद्धति की तुलना में सफलता दर में लगभग 21% तक सुधार किया।
  • दक्षता (Efficiency): आपको लग सकता है कि सोचने के लिए रुकने से रोबोट धीमा हो जाएगा। और यह होता भी है, लेकिन बहुत थोड़ा सा। क्योंकि AdaDec केवल तभी रुकता है जब रोबोट वास्तव में भ्रमित होता है (लग लगभग 7% समय), यह उन अन्य तरीकों की तुलना में बहुत समय बचाता है जो हर संभव पथ की जांच करने की कोशिश करते हैं।

सारांश

AdaDec को एक AI कोडर के लिए को-पायलट (सह-पायलट) के रूप में समझें।

  • AI अधिकांश समय ड्राइविंग करता है।
  • को-पायलट सड़क पर नज़र रखता है।
  • जब सड़क धुंधली हो जाती है (उच्च अनिश्चितता), तो को-पायलट कहता है, "ठहरिए, मुड़ने से पहले अगले कुछ मील के लिए मानचित्र की जाँच कर लेते हैं।"
  • यह AI को खाई में गिरने से रोकता है, जिससे अंतिम कोड बहुत अधिक विश्वसनीय हो जाता है, बिना पूरी यात्रा को धीमा किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →