← नवीनतम पेपर
💻 computer science

Fine-grained Approaches for Confidence Calibration of LLMs in Automated Code Revision

यह शोध पत्र स्वचालित कोड संशोधन कार्यों में कॉन्फिडेंस स्कोर को कैलिब्रेट करने के लिए एक फाइन-ग्रेन्ड लोकल प्लैट-स्केलिंग दृष्टिकोण का प्रस्ताव और सत्यापन करता है, जो यह प्रदर्शित करता है कि यह विविध मॉडलों और मेट्रिक्स में पारंपरिक ग्लोबल विधियों की तुलना में काफी बेहतर प्रदर्शन करता है क्योंकि यह कॉन्फिडेंस को उन लोकल एडिट निर्णयों के साथ बेहतर ढंग से संरेखित करता है जो कोड की शुद्धता निर्धारित करते हैं।

मूल लेखक: Hong Yi Lin, Chunhua Liu, Haoyu Gao, Patanamon Thongtanunam, Christoph Treude

प्रकाशित 2026-04-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hong Yi Lin, Chunhua Liu, Haoyu Gao, Patanamon Thongtanunam, Christoph Treude

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं और आपने एक बहुत ही प्रतिभाशाली, लेकिन थोड़े अति-आत्मविश्वासी, सू-शेफ (AI) को एक जटिल रेसिपी ठीक करने के लिए काम पर रखा है। कभी-कभी वह व्यंजन को पूरी तरह से ठीक कर देता है; कभी-कभी वह नमक का एक चुटकी ऐसा डाल देता है जिससे पूरा भोजन आपदा बन जाता है।

समस्या केवल यह नहीं है कि सू-शेफ गलतियाँ करता है; समस्या यह है कि उसे पता नहीं होता कि वह गलतियाँ कर रहा है। वह कह सकता है, "मुझे 99% यकीन है कि नमक की यह मात्रा सही है," जबकि वास्तव में वह केवल 50% सुनिश्चित हो सकता है। यदि आप उन पर अंधा विश्वास करते हैं, तो आप भोजन खराब कर देंगे। यदि आप बिल्कुल भी भरोसा नहीं करते हैं, तो आप हर एक सामग्री को खुद चखने में अपना समय बर्बाद कर देंगे।

यह शोध पत्र उस AI सू-शेफ को यह सिखाने के बारे में है कि कैसे कहना है, "मैं इस विशिष्ट रेसिपी के बारे में केवल 60% निश्चित हूँ," ताकि आपको पता चल सके कि कब हस्तक्षेप करना है और कार्यभार संभालना है।

यहाँ उनके समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. पुराना तरीका: "औसत" रिपोर्ट कार्ड

पहले, शोधकर्ता AI के आत्मविश्वास को उसके द्वारा लिखे गए पूरे कोड को एक बड़े ब्लॉक के रूप में देखकर आंकने की कोशिश करते थे।

  • उपमा: कल्पना कीजिए कि AI 10 पन्नों का एक निबंध लिखता है। पुराना तरीका सभी 10 पन्नों की गुणवत्ता का औसत निकालकर "कॉन्फिडेंस स्कोर" (विश्वास स्कोर) की गणना करता है।
  • दोष: यदि AI 9 बेहतरीन पन्ने लिखता है लेकिन 10वें पन्ने पर एक छोटी सी, घातक टाइपो (typo) कर देता है जो पूरे निबंध को खराब कर देती है, तो "औसत" स्कोर अभी भी उच्च दिखता है (जैसे 9/10)। AI सोचता है, "मैंने कुल मिलाकर बहुत अच्छा किया!" लेकिन परिणाम एक विफलता होता है। वह एक खराब हिस्सा अच्छे हिस्सों के बीच दब गया।

2. नया विचार: "स्पॉट चेक" (बारीक दृष्टिकोण)

लेखकों ने महसूस किया कि कोडिंग में, एक खराब सेब पूरे टोकरी को खराब कर देता है। एक गलत अक्षर भी प्रोग्राम को तोड़ सकता है। इसलिए, पूरे निबंध को देखने के बजाय, उन्होंने सबसे कमजोर कड़ी को देखने का निर्णय लिया।

  • उपमा: पूरे निबंध का औसत निकालने के बजाय, वे उस एकल वाक्य को देखते हैं जिसके बारे में AI सबसे कम आश्वस्त था।
  • परिणाम: उन्होंने पाया कि यदि AI एक छोटे से शब्द (टोकन) के बारे में भी अनिश्चित है, तो पूरा कोड टूटने की संभावना है। इन "कमजोर स्थानों" (जिन्हें वे Minimum Token Probability कहते हैं) पर ध्यान केंद्रित करके, उन्हें इस बात की कहीं अधिक ईमानदार तस्वीर मिलती है कि क्या कोड काम करेगा। यह घर के पेंट को देखने के बजाय उसके आधार (foundation) की जांच करने जैसा है।

3. कैलिब्रेशन (समायोजन): "एक ही आकार सबके लिए" बनाम "कस्टम टेलरिंग"

नए "स्पॉट चेक" तरीके के साथ भी, AI के आत्मविश्वास के नंबर अभी भी थोड़े गलत थे। नंबरों को ठीक करने के लिए उन्हें एक "अनुवादक" की आवश्यकता थी।

  • पुराना अनुवादक (Global Platt-scaling): कल्पना कीजिए कि एक अनुवादक पूरी दुनिया से बात करने के लिए एक ही शब्दकोश और लहजे का उपयोग करता है। वे रेगिस्तान में रहने वाले व्यक्ति के लिए बर्फ के बारे में एक चुटकुला अनुवाद करने की कोशिश करते हैं, और वह अजीब लगता है। यह विधि मानती है कि सभी कोडिंग समस्याएं एक जैसी हैं।
  • नया अनुवादक (Local Platt-scaling): लेखकों ने एक ऐसा अनुवादक बनाया जो पहले पूछता है, "यह किस प्रकार की समस्या है?"
    • यदि यह एक बग फिक्स (जैसे वाक्य में टाइपो) है, तो वे एक विशिष्ट शब्दकोश का उपयोग करते हैं।
    • यदि यह एक सुरक्षा फिक्स (जैसे ताला लगा हुआ दरवाजा) है, तो वे दूसरे शब्दकोश का उपयोग करते हैं।
    • यदि यह कोड रिफाइनमेंट (वाक्य को अधिक विनम्र बनाना) है, तो वे तीसरे, बहुत विशिष्ट शब्दकोश का उपयोग करते हैं।
  • यह क्यों महत्वपूर्ण है: कुछ कार्य (जैसे सुरक्षा खामियों को ठीक करना) बहुत अराजक और विविध होते हैं। एक "एक ही आकार सबके लिए" वाला अनुवादक यहाँ बुरी तरह विफल हो जाता है। आपको आत्मविश्वास स्कोर को समस्या के विशिष्ट प्रकार के अनुसार फिट करने के लिए एक "कस्टम टेलर" (Local Platt-scaling) की आवश्यकता होती है।

तीन मुख्य निष्कर्ष

  1. औसत पर भरोसा न करें: जब AI कोड अच्छा है या नहीं इसकी जांच कर रहे हों, तो पूरी चीज़ को न देखें। उस एक हिस्से को देखें जिसे लेकर AI सबसे अधिक घबराया हुआ था। यदि वह वहां घबराया हुआ है, तो पूरी चीज़ जोखिम भरी है।
  2. संदर्भ ही राजा है: आप टाइपो ठीक करने, सुरक्षा छेद को पैच करने और पैराग्राफ को फिर से लिखने के लिए एक ही आत्मविश्वास-जांच उपकरण का उपयोग नहीं कर सकते। विभिन्न कार्यों के लिए अलग-अलग "कैलिब्रेटर्स" की आवश्यकता होती है।
  3. समझौता (Trade-off):
    • बग ठीक करने के लिए: "ग्लोबल" (एक ही आकार सबके लिए) विधि आमतौर पर तेज़ और पर्याप्त अच्छी होती है।
    • कोड को बेहतर बनाने के लिए (रिफाइनमेंट): आपको "लोकल" (कस्टम टेलर) विधि का उपयोग करना ही होगा। इसके बिना, AI का आत्मविश्वास इतना गलत होता है कि आप उस पर बिल्कुल भी भरोसा नहीं कर सकते।

निचोड़ (The Bottom Line)

यह शोध पत्र डेवलपर्स को AI कोड के लिए एक बेहतर "झूठ पकड़ने वाला यंत्र" (lie detector) प्रदान करता है। यह AI को अपने काम के बारे में आत्मविश्वास से झूठ बोलने से रोकता है। विशिष्ट कमजोर बिंदुओं को देखकर और कोडिंग कार्य के विशिष्ट प्रकार के लिए आत्मविश्वास की जांच को अनुकूलित करके, डेवलपर्स अंततः AI का उपयोग करने के लिए पर्याप्त भरोसा कर सकते हैं, लेकिन यह जानने के लिए भी पर्याप्त समझ रखते हैं कि उन्हें कब काम की दोबारा जांच करनी है।

संक्षेप में: AI से पूरे प्रोजेक्ट के बारे में, "क्या आप निश्चित हैं?" पूछना बंद करें। पूछें, "क्या आप इस विशिष्ट कठिन हिस्से के बारे में निश्चित हैं?" और फिर एक विशेष अनुवादक का उपयोग करें ताकि यह सुनिश्चित हो सके कि उत्तर ईमानदार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →