DEL: Digit Entropy Loss for Numerical Learning of Large Language Models
यह शोध पत्र डिजिट एंट्रॉपी लॉस (DEL) को प्रस्तुत करता है, जो एक नया प्रशिक्षण उद्देश्य है जो अनसुपरवाइज्ड एंट्रॉपी ऑप्टिमाइज़ेशन को एक सुपरवाइज्ड, डिस्टेंस-फ्री फ्रेमवर्क में पुनर्गठित करता है ताकि गणितीय तर्क और कोड जनरेशन कार्यों में पूर्णांक और फ्लोटिंग-पॉइंट दोनों संख्याओं की भविष्यवाणी करने में लार्ज लैंग्वेज मॉडल्स की सटीकता में सुधार किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े भ्रमित रोबोट को गणित करना सिखा रहे हैं। यह रोबोट कहानियाँ लिखने और बातचीत करने में बहुत माहिर है, लेकिन जब बात संख्याओं की आती है, तो यह अक्सर अंकों को गलत कर देता है। यह "12" कह सकता है जबकि उत्तर "13" होना चाहिए, या यह "12" के बजाय "14" का अनुमान लगा सकता है।
यह शोध पत्र, जो हांगकांग पॉलिटेकनिक यूनिवर्सिटी की विजुअल कंप्यूटिंग लैब से है, यह पेश करता है कि कैसे इस रोबोट को संख्याओं को बेहतर ढंग से संभालने के लिए सिखाया जा सकता है। वे इस नए तरीके को डिजिट एंट्रॉपी लॉस (Digit Entropy Loss - DEL) कहते हैं।
रोबोट के गणित कौशल को ठीक करने की कहानी यहाँ दी गई है, जिसे सरल उपमाओं का उपयोग करके समझाया गया है:
1. समस्या: रोबोट की "सबसे अच्छा अनुमान लगाने" की आदत
पारंपरिक रूप से, इन AI रोबोटों (जिन्हें लार्ज लैंग्वेज मॉडल कहा जाता है) को प्रशिक्षित करते समय, हम मैक्सिमम लाइकलीहुड एस्टीमेशन (Maximum Likelihood Estimation - MLE) नामक विधि का उपयोग करते हैं।
- उपमा: कल्पना कीजिए कि रोबक एक बहुविकल्पीय (multiple-choice) परीक्षा दे रहा है। MLE रोबोट को बताता है: "बस वही उत्तर चुनो जो तुम्हें सबसे अधिक संभावित लगता है।"
- दोष: रोबोट बहुत विनम्र है। वह सोचता है, "खैर, '12' सबसे अच्छा उत्तर है, लेकिन '13' और '11' भी काफी करीब हैं, इसलिए मैं उन्हें भी थोड़ी सी संभावना दे दूँगा।"
- परिणाम: रोबोट अनिश्चित हो जाता है। वह संख्याओं के बीच झूलता रहता है, जिससे ऐसी त्रुटियां होती हैं जैसे कि पूर्णांक (whole number) होने के बजाय "12.4" कहना, या केवल इसलिए गलत अंक चुन लेना क्योंकि वह पर्याप्त आत्मविश्वासी नहीं था।
2. पुराने समाधान: "दूरी" का जाल
शोधकर्ताओं ने एक "पेनल्टी" (दंड) प्रणाली जोड़कर इसे ठीक करने की कोशिश की।
- उपमा: उन्होंने रोबोट को बताया: "यदि उत्तर 5 है, और तुम 4 का अनुमान लगाते हो, तो यह ठीक है, यह करीब है। लेकिन यदि तुम 9 का अनुमान लगाते हो, तो यह बहुत बुरा है!" उन्होंने एक मानचित्र बनाया जहाँ संख्याएँ एक रेखा पर व्यवस्थित थीं, और रोबोट को उसके अनुमान और सच्चाई के बीच की दूरी के आधार पर दंडित किया जाता था।
- समस्या: शोध पत्र का तर्क है कि यह "दूरी मानचित्र" कृत्रिम है। वास्तविक दुनिया में, संख्याएँ केवल एक रेखा पर बिंदु नहीं हैं; वे अपने स्वयं के अर्थ वाले प्रतीक हैं। कभी-कभी, रोबोट सीख जाता है कि संख्या "2" संख्या "3" की तुलना में अक्षर "Z" के अधिक समान दिखती है। उसे एक सख्त दूरी नियम का पालन करने के लिए मजबूर करना उसे भ्रमित करता है और उसके अनुमानों को या तो बहुत कठोर (sharpened) या बहुत अस्पष्ट (flattened) बना देता है।
3. नया समाधान: "कॉन्फिडेंस कोच" (DEL)
लेखक डिजिट एंट्रॉपी लॉस (DEL) का प्रस्ताव करते हैं। यह मापने के बजाय कि रोबोट उत्तर से कितना दूर है, वे इस बात पर ध्यान केंद्रित करते हैं कि रोबोट कितना निश्चित (certain) है।
- उपमा: एक कोच की कल्पना करें जिसे आपके अनुमान और लक्ष्य के बीच की दूरी की परवाह नहीं है। इसके बजाय, कोच कहता है: "मुझे इस बात की परवाह नहीं है कि आप लक्ष्य के कितने करीब या दूर हैं। मैं बस चाहता हूँ कि आप अपने उत्तर के प्रति 100% सुनिश्चित हों। यदि आप '5' के प्रति 90% निश्चित हैं और '6' के प्रति 10% निश्चित हैं, तो आप अनिश्चित हो रहे हैं। मैं चाहता हूँ कि आप '5' के प्रति 100% निश्चित हों और बाकी सब के प्रति 0%।"
- यह कैसे काम करता है:
- सुपरवाइज्ड सर्टेन्टी (Supervised Certainty): वे रोबोट को हर अंक को एक साधारण "हाँ/नहीं" प्रश्न की तरह मानने के लिए सिखाते हैं। "क्या यह अंक 5 है? हाँ या नहीं?" यह रोबोट को एक धुंधला अनुमान लगाने के बजाय एक स्पष्ट और सटीक निर्णय लेने के लिए मजबूर करता है।
- कोई दूरी नियम नहीं: वे "दूरी मानचित्र" को हटा देते हैं। वे रोबोट को देखे गए डेटा के आधार पर संख्याओं के प्राकृतिक संबंध को सीखने देते हैं, न कि किसी मानव-निर्मित नियम को उस पर थोपते हैं।
- डेसिमल्स (Decimals) को संभालना: पिछले तरीकों ने पूर्ण संख्याओं (जैसे 10) और दशमलव संख्याओं (जैसे 10.5) के साथ अलग व्यवहार किया, जिससे एक "खड़ी ढलान" (cliff) पैदा हुई जहाँ रोबोट लड़खड़ा जाता था। DEL पूरे नंबर और दशमलव भाग को एक सुचारू, निरंतर प्रवाह (continuous flow) के रूप में मानता है, जैसे कि दो अलग-अलग द्वीपों के बजाय एक लंबी संख्या रेखा।
4. परिणाम: तेज गणित
शोधकर्ताओं ने इस नए "कॉन्फिडेंस कोच" का परीक्षण चार अलग-अलग प्रकार के AI रोबोटों (CodeLlama, Mistral, DeepSeek, और Qwen-2.5) पर सात अलग-अलग गणितीय बेंचमार्क का उपयोग करके किया।
- परिणाम: DEL के साथ प्रशिक्षित रोबोटों ने कम गलतियाँ कीं। वे न केवल सही उत्तर अधिक बार देते थे; जब वे गलत होते भी थे, तो गलत उत्तर सही वाले के बहुत करीब होता था (उदाहरण के लिए, 13 के बजाय 12 का अनुमान लगाना, न कि 50 का)।
- दृश्य प्रमाण: शोध पत्र के उदाहरणों में, आप देख सकते हैं कि पुराने तरीके अक्सर तर्क (logic) को सही करते थे लेकिन अंतिम संख्या को गलत कर देते थे (जैसे खरीदारी की यात्रा की कुल लागत की गणना करना लेकिन अंतिम डॉलर राशि गलत कर देना)। DEL विधि तर्क और अंतिम संख्या दोनों को सही करती है।
सारांश
संक्षेप में, यह शोध पत्र कहता है: AI रोबोट को यह अनुमान लगाना सिखाना बंद करें कि कोई संख्या कितनी "करीब" है। इसके बजाय, उन्हें सटीक अंक के बारे में पूरी तरह से आश्वस्त होना सिखाएं। कृत्रिम दूरी नियमों को हटाकर और सटीक, आत्मविश्वासी भविष्यवाणियों के निर्माण पर ध्यान केंद्रित करके, रोबोट गणित और कोड जनरेशन में बहुत बेहतर हो गए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।