← नवीनतम पेपर
🤖 AI

Uncertainty Quantification for LLM-based Code Generation

यह शोध पत्र RisCoSet को प्रस्तुत करता है, जो एक नवीन ढांचा (framework) है जो LLM-आधारित कोड जनरेशन के लिए जोखिम-नियंत्रित भविष्यवाणी सेट (risk-controlling prediction sets) बनाने के लिए मल्टीपल हाइपोथीसिस टेस्टिंग का लाभ उठाता है, जो कई वैध आउटपुट को समायोजित करके और उच्च सटीकता के विश्वास को बनाए रखते हुए अनावश्यक कोड हटाने को काफी कम करके मौजूदा विधियों की सीमाओं को प्रभावी ढंग से दूर करता है।

मूल लेखक: Senrong Xu, Yuhao Tan, Yanke Zhou, Guangyuan Wu, Zenan Li, Yuan Yao, Taolue Chen, Feng Xu, Xiaoxing Ma

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Senrong Xu, Yuhao Tan, Yanke Zhou, Guangyuan Wu, Zenan Li, Yuan Yao, Taolue Chen, Feng Xu, Xiaoxing Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली लेकिन कभी-कभी अति-आत्मविश्वासी AI से आपके लिए एक कंप्यूटर प्रोग्राम लिखने के लिए कहते हैं। कभी-कभी, AI एकदम सटीक कोड लिखता है। अन्य समय में, वह "हैलुसिनेट" (hallucinate) करता है, यानी ऐसी लाइनें मिला देता है जो देखने में तो सही लगती हैं लेकिन वास्तव में प्रोग्राम को तोड़ देती हैं।

समस्या यह है: आपको कैसे पता चलेगा कि AI के कोड के कौन से हिस्से सुरक्षित रखने योग्य हैं, और कौन से खतरनाक हैं?

यह शोध पत्र RISCOSET नामक एक नई विधि पेश करता है जो इस समस्या को हल करती है। इसे एक "सुरक्षा जाल" (Safety Net) के रूप में समझें जो AI द्वारा जनरेट किए गए कोड के लिए बनाया गया है।

पुराने तरीकों के साथ समस्या

पहले, शोधकर्ता PAC (जो "Probably Approximately Correct" का संक्षिप्त रूप है) नामक एक विधि का उपयोग करने की कोशिश करते थे।

  • उपमा: कल्पना कीजिए कि आप चाबियों से भरी एक विशाल, अस्त-व्यस्त दराज में एक विशिष्ट चाबी खोजने की कोशिश कर रहे हैं। पुराने तरीके (PAC) का एक सख्त नियम था: "आप केवल उन्हीं चाबियों को देख सकते हैं जो आपके द्वारा चुनी गई पिछली चाबी से छोटी हैं।"
  • दोष: यह नियम बहुत कठोर था। इसने शोधकर्ताओं को केवल नियम का पालन करने के लिए कई संभावित रूप से अच्छी चाबियों (या इस मामले में कोड की लाइनों) को फेंकने के लिए मजबूर किया। इसने यह भी मान लिया कि केवल एक ही सही उत्तर होता है, लेकिन कोडिंग में, अक्सर एक ही काम को करने के कई अलग-अलग तरीके होते हैं।

नया समाधान: RISCOSET

लेखक RISCOSET प्रस्तावित करते हैं, जो LTT (Learn Then Test) नामक एक स्मार्ट दृष्टिकोण का उपयोग करता है।

1. "आंशिक प्रोग्राम" (The Skeleton/कंकाल)
पूरे सटीक प्रोग्राम का अनुमान लगाने के बजाय, RISCOSET एक "कंकाल" या "आंशिक प्रोग्राम" बनाता है।

  • उपमा: कल्पना कीजिए कि AI एक कहानी लिखता है, लेकिन आप उसके अंत के बारे में अनिश्चित हैं। RISCOSET पूरी कहानी को नहीं हटाता है। इसके बजाय, यह अनिश्चित वाक्यों को हाइलाइट करता है और केवल उन विशिष्ट हिस्सों को हटा देता है, जिससे आपके पास एक ठोस ढांचा (एक आंशिक कहानी) बच जाता है जिसे आप जानते हैं कि सुरक्षित है।
  • लक्ष्य: यह कंकाल (skeleton) उच्च सांख्यिकीय विश्वास (statistical confidence) के साथ एक सही समाधान का हिस्सा होने की गारंटी देता है। आप बाद में इन लापता हिस्सों को भर सकते हैं।

2. "मल्टी-लेबल" (Multi-Label) लाभ
पुराने तरीके ने माना था कि केवल एक ही "सही" उत्तर होता है। RISCOSET समझता है कि कोडिंग में कई वैध समाधान होते हैं।

  • उपमा: यदि आप केक की रेसिपी मांगते हैं, तो उसे करने का केवल एक ही "सही" तरीका नहीं है। आप मक्खन या तेल का उपयोग कर सकते हैं; आप इसे गोल पैन या चौकोर पैन में बेक कर सकते हैं। RISCOSET इस बात को स्वीकार करता है कि कई "सही" संस्करण मौजूद हैं, इसलिए यह अच्छे कोड को केवल इसलिए नहीं फेंकता क्योंकि वह पहले अनुमान से थोड़ा अलग दिखता है।

3. "चयनात्मक निष्पादन" (Selective Execution - समय और पैसा बचाना)
यह सुनिश्चित करने के लिए कि उनके "कंकाल" सुरक्षित हैं, सिस्टम को कोड का परीक्षण करने की आवश्यकता होती है। लेकिन कोड के हर एक हिस्से का परीक्षण करना धीमा और महंगा है (जैसे हर एक बोल्ट के लिए कार के पूरे इंजन का परीक्षण करना)।

  • उपमा: RISCOSET एक "चयनात्मक निष्पादन" रणनीति का उपयोग करता है। यह एक गुणवत्ता निरीक्षक (quality inspector) की तरह है जो किसी उत्पाद को देखता है। यदि उत्पाद बहुत साफ और उच्च गुणवत्ता वाला दिखता है (कम अनिश्चितता), तो निरीक्षक पूर्ण परीक्षण छोड़ देता है। यदि यह अव्यवस्थित दिखता है (उच्च अनिश्चितता), तो निरीक्षक पूर्ण परीक्षण करता है।
  • परिणाम: यह त्रुटि दर को बहुत कम रखते हुए, बहुत अधिक समय और कंप्यूटिंग शक्ति बचाता है।

उन्होंने क्या पाया?

शोधकर्ताओं ने इसे तीन अलग-अलग AI मॉडल और तीन अलग-अलग कोडिंग डेटासेट पर परखा।

  • कम बर्बादी: मौजूदा सर्वोत्तम तरीकों की तुलना में, RISCOSET ने 24.5% कम कोड की लाइनें हटाईं। इसका मतलब है कि आप AI के उपयोगी काम के अधिक हिस्से को रख पाते हैं।
  • सुरक्षा सर्वोपरि: अधिक कोड रखने के बावजूद, उन्होंने सुरक्षा के समान उच्च स्तर को बनाए रखा। उनके द्वारा बनाया गया "कंकाल" पुराने तरीकों की तरह ही एक सही समाधान का हिस्सा होने की गारंटी देता था, लेकिन इसमें अनावश्यक डिलीशन बहुत कम था।

संक्षेप में

RISCOSET एक नया उपकरण है जो हमें AI-जनरेटेड कोड पर बेहतर भरोसा करने में मदद करता है। गलतियों के डर से कोड के बड़े हिस्सों को फेंकने के बजाय, यह सावधानीपूर्वक एक सुरक्षित "कंकाल" को तराशता है जो एक काम करने वाले समाधान का हिस्सा होने की गारंटी देता है। यह अधिक स्मार्ट है, कम बर्बादी वाला है, और इस तथ्य का सम्मान करता है कि अच्छा कोड लिखने के कई तरीके हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →