← नवीनतम पेपर
💬 NLP

LogitsCoder: Towards Efficient Chain-of-Thought Path Search via Logits Preference Decoding for Code Generation

LogitsCoder एक नवीन फ्रेमवर्क है जो लॉजिट-लेवल कंट्रोल मैकेनिज्म, विशेष रूप से लॉजिट प्रेफरेंस डिकोडिंग और पाथ सिलेक्शन रणनीतियों के माध्यम से, संतुलित और सुसंगत रीजनिंग चेन्स उत्पन्न करने के लिए अंडरथिंकिंग और ओवरथिंकिंग की समस्याओं को संबोधित करके कोड जनरेशन की दक्षता और गुणवत्ता में सुधार करता है।

मूल लेखक: Jizheng Chen, Weiming Zhang, Xinyi Dai, Weiwen Liu, Kounianhua Du, Yasheng Wang, Ruiming Tang, Yong Yu, Weinan Zhang

प्रकाशित 2026-02-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jizheng Chen, Weiming Zhang, Xinyi Dai, Weiwen Liu, Kounianhua Du, Yasheng Wang, Ruiming Tang, Yong Yu, Weinan Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली को सुलझाने की कोशिश कर रहे हैं, जैसे कि कोई जटिल कोडिंग समस्या। आप एक सुपर-स्मार्ट AI असिस्टेंट से मदद मांगते हैं।

अतीत में, AI इसे हल करने के दो मुख्य तरीके अपनाता था, और दोनों में बड़ी खामियां थीं:

  1. "जल्दबाजी वाला काम" (कम सोचना - Underthinking): AI जल्दी से उत्तर का अनुमान लगा लेता था। वह कहता था, "यह रहा कोड!" लेकिन वह कठिन हिस्सों को छोड़ देता था, जैसे कोई छात्र बिना अपना काम दिखाए गणित की परीक्षा में अनुमान लगाता है। उत्तर अक्सर गलत होता था क्योंकि AI गहराई से नहीं सोच पाता था।

  2. "जरूरत से ज्यादा सोचने वाला" (Overthinking): AI बहुत अधिक पूर्ण होने की कोशिश करता था। वह समस्या के बारे में 50 पन्नों का निबंध लिख देता था, हर एक संभव कोण की खोज करता था, खुद को दोहराता था, और भ्रमित हो जाता था। वह अंततः सही उत्तर तक पहुँच जाता था, लेकिन इसमें बहुत समय लगता था, बहुत अधिक लागत (कंप्यूटर पावर) आती थी, और कभी-कभी वह अपनी ही बड़बड़ाहट में इतना खो जाता था कि मूर्खतापूर्ण गलतियाँ कर देता था।

पेश है LogitsCoder: "स्मार्ट एडिटर"

यह पेपर एक नया सिस्टम पेश करता है जिसे LogitsCoder कहा जाता है। इसे AI के दिमाग के लिए एक सुपर-कुशल प्रोजेक्ट मैनेजर के रूप में समझें। AI को बिना किसी दिशा के भटकने या जल्दबाजी करने देने के बजाय, LogitsCoder सोचने की प्रक्रिया को निर्देशित करने के लिए विशेष उपकरणों का उपयोग करता है।

यह कैसे काम करता है, यहाँ कुछ रोजमर्रा के उदाहरण दिए गए हैं:

1. "सहज ज्ञान का फिल्टर" (Logits Preference Decoding)

कल्पना कीजिए कि आप एक कहानी लिख रहे हैं। कभी-कभी आप एक ऐसा वाक्य लिखते हैं जो ठीक तो लगता है लेकिन थोड़ा "अजीब" महसूस होता है।

  • पुराना तरीका: AI बस अगले शब्द को चुनता है जो सबसे आम लगता है।
  • LogitsCoder का तरीका: इसमें एक "सांख्यिकीय सहज ज्ञान" (statistical instinct) होता है। यह बेहतरीन समाधानों के हजारों उदाहरणों को देखता है और कहता है, "हे, सभी बेहतरीन समाधानों में, अगला शब्द आमतौर पर यह विशिष्ट शब्द होता है, वह नहीं।"
  • उदाहरण: यह एक अनुभवी संपादक की तरह है जो AI के कान में फुसफुसाता है, "उस घिसे-पिटे वाक्यांश का उपयोग न करें; इसके बजाय इस सटीक शब्द का उपयोग करें।" यह AI को शुरुआत से ही सतही गलतियाँ करने से रोकता है।

2. "मैप चेक" (Logits Rank Based Path Selection)

कल्पना कीजिए कि आप जंगल में हाइकिंग कर रहे हैं और आपको एक रास्ता चुनना है।

  • पुराना तरीका (MCTS): AI 10 अलग-अलग रास्तों पर चलने की कोशिश करता है, प्रत्येक में भटक जाता है, वापस मुड़ता है, और फिर से प्रयास करता है। इसमें बहुत अधिक ऊर्जा (कंप्यूटेशनल लागत) लगती है।
  • LogitsCoder का तरीका: पूरा रास्ता तय करने के बजाय, यह शुरुआत में ही "कॉन्फिडेंस मैप" (विश्वास का मानचित्र) को देखता है। यह जाँचता है: "इन 5 रास्तों में से किस रास्ते में सबसे स्थिर और भरोसेमंद पकड़ है?"
  • उदाहरण: यह एक GPS सिग्नल स्ट्रेंथ की तरह है। यदि एक रास्ते का सिग्नल कमजोर है (AI अनिश्चित है), तो यह उसे अनदेखा कर देता है। यदि दूसरा रास्ता मजबूत और स्थिर सिग्नल (AI आश्वस्त है) दिखाता है, तो यह उसे चुन लेता है। यह पूरा रास्ता पैदल चलने से पहले ही सबसे अच्छा मार्ग खोज लेता है।

3. "ग्रुप मंथन" (Thoughts Aggregation)

कभी-कभी, एक व्यक्ति के पास एक शानदार विचार होता है, लेकिन दूसरे व्यक्ति के पास एक अलग शानदार विचार होता है।

  • पुराना तरीका: AI एक रास्ता चुनता है और उसी पर टिका रहता है, भले ही वह किसी महत्वपूर्ण विवरण को छोड़ रहा हो।
  • LogitsCoder का तरीका: यह कुछ अलग-अलग "सर्वश्रेष्ठ अनुमान" उत्पन्न करता है और फिर एक स्मार्ट समराइज़र (सारांशकर्ता) से उन्हें मिलाने के लिए कहता है।
  • उदाहरण: यह एक टीम मीटिंग की तरह है जहाँ हर कोई अपना सबसे अच्छा विचार साझा करता है, और टीम लीडर कहता है, "ठीक है, आइए व्यक्ति A से रणनीति लें, व्यक्ति B से सुरक्षा जांच लें, और व्यक्ति C से रचनात्मक मोड़ लें।" परिणाम एक ऐसी योजना है जो किसी भी अकेले व्यक्ति के विचार से अधिक मजबूत है।

यह एक बड़ी बात क्यों है?

  • यह तेज़ है: यह मृत अंत वाले रास्तों पर चलकर समय बर्बाद नहीं करता (समय और पैसा बचाता है)।
  • यह गहरा है: यह केवल अनुमान नहीं लगाता; यह AI को तार्किक रूप से समस्या के माध्यम से सोचने के लिए मजबूर करता है, जिससे "जल्दबाजी वाले काम" से बचा जा सके।
  • यह स्मार्ट है: विभिन्न विचारों के सबसे अच्छे हिस्सों को मिलाकर, यह एक ऐसा समाधान बनाता है जिसके सही होने की संभावना अधिक होती है।

संक्षेप में: LogitsCoder AI को एक घबराए हुए छात्र से अपग्रेड करने जैसा है जो या तो घबरा जाता है या बहुत अधिक बोलता है, एक शांत, अनुभवी इंजीनियर में जो जानता है कि कौन से उपकरण का उपयोग करना है, चलने से पहले मैप चेक करता है, और कम से कम बर्बाद प्रयास के साथ सबसे अच्छा संभव समाधान बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →