← नवीनतम पेपर
💬 NLP

What Models Know, How Well They Know It: Knowledge-Weighted Fine-Tuning for Learning When to Say "I Don't Know"

यह शोध पत्र एक ज्ञान-भारित फाइन-ट्यूनिंग (knowledge-weighted fine-tuning) पद्धति प्रस्तावित करता है जो इंस्टेंस-स्तरीय ज्ञान स्कोर का उपयोग करती है ताकि बड़े भाषा मॉडलों (large language models) को ज्ञात विषयों पर सटीकता बनाए रखते हुए आउट-ऑफ-स्कोप प्रश्नों के लिए अनिश्चितता को स्पष्ट रूप से व्यक्त करने में मदद मिल सके, जिससे ज्ञान के गलत संरेखण (knowledge misalignment) के कारण होने वाले मतिभ्रम (hallucinations) को कम किया जा सके।

मूल लेखक: Joosung Lee, Hwiyeol Jo, Donghyeon Ko, Kyubyung Chae, Cheonbok Park, Jeonghoon Kim

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joosung Lee, Hwiyeol Jo, Donghyeon Ko, Kyubyung Chae, Cheonbok Park, Jeonghoon Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान और विद्वान छात्र है जिसका नाम एलेक्स (Alex) है। एलेक्स ने लाखों किताबें पढ़ी हैं (यह "प्री-ट्रेनिंग" चरण है)। एलेक्स समझदार तो है, लेकिन कभी-कभी, जब उससे कोई कठिन सवाल पूछा जाता है, तो वह बहुत आत्मविश्वासी हो जाता है और एक ऐसा उत्तर बना देता है जो सुनने में तो बहुत अच्छा लगता है, लेकिन वास्तव में गलत होता है। हम इसे "हैलुसिनेशन" (hallucination) कहते हैं।

समस्या यह है कि जब शिक्षक एलेक्स को नई चीजें सिखाने की कोशिश करते हैं (यह "फाइन-ट्यूनिंग" है), तो वे अक्सर एलेक्स को हर चीज़ का जवाब देने के लिए मजबूर करते हैं, यहाँ तक कि उन सवालों का भी जिन्हें उसने पहले कभी नहीं देखा। अगर एलेक्स को उत्तर नहीं पता होता, तो शिक्षक कहते हैं, "बस अंदाज़ा लगाओ!" इसलिए, एलेक्स आत्मविश्वास के साथ अंदाज़े लगाने लगता है, जिससे मनगढ़ंत तथ्य अधिक पैदा होते हैं।

यह शोध पत्र एलेक्स को सिखाने का एक नया तरीका प्रस्तावित करता है, जिसे नॉलेज-वेटेड फाइन-ट्यूनिंग (KWT) कहा जाता है। यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं का उपयोग किया गया है:

1. "आत्मविश्वास की जाँच" (ज्ञान का अनुमान - Knowledge Estimation)

एलेक्स को नया पाठ सिखाने से पहले, शिक्षक यह मान नहीं लेता कि एलेक्स इसे जानता है या नहीं। इसके बजाय, शिक्षक एलेक्स से एक ही सवाल को पाँच अलग-अलग तरीकों से पूछता है (जैसे, "फ्रांस की राजधानी क्या है?" और "फ्रांस के मुख्य शहर के बारे में बताओ" और "फ्रांस की राजधानी का नाम बताओ")।

  • यदि एलेक्स 5/5 बार सही उत्तर देता है: तो शिक्षक को पता चलता है, "आह, एलेक्स वास्तव में यह जानता है!"
  • यदि एलेक्स 0/5 बार सही उत्तर देता है: तो शिक्षक को पता चलता है, "एलेक्स को इसके बारे में कोई जानकारी नहीं है।"
  • यदि एलेक्स 3/5 बार सही उत्तर देता है: तो शिक्षक को पता चलता है, "एलेक्स इस विषय पर थोड़ा अनिश्चित है।"

इससे हर एक सवाल के लिए एक "नॉलेज स्कोर" (Knowledge Score) बनता है। यह केवल "हाँ/नहीं" वाला स्विच नहीं है; यह एक डिमर स्विच (dimmer switch) की तरह है जो दिखाता है कि एलेक्स उस विषय को कितनी अच्छी तरह जानता है।

2. "स्मार्ट ग्रेडिंग" प्रणाली (वेटेड ट्रेनिंग - Weighted Training)

अब, शिक्षक वास्तविक प्रशिक्षण सत्र शुरू करता है। हर सवाल के साथ एक जैसा व्यवहार करने के बजाय, शिक्षक यह तय करने के लिए नॉलेज स्कोर का उपयोग करता है कि एलेक्स को कितना ज़ोर देना है।

  • उन चीजों के लिए जिन्हें एलेक्स अच्छी तरह जानता है: शिक्षक इन सवालों को अधिक महत्व (more weight) देता है। यह कहने जैसा है, "बहुत बढ़िया! आइए इसका थोड़ा और अभ्यास करें ताकि आप इसे कभी न भूलें।" यह उस चीज़ को पुख्ता करता है जो एलेक्स पहले से जानता है।
  • उन चीजों के लिए जिन्हें वह नहीं जानता: शिक्षक "अंदाज़ा लगाने" वाले हिस्से के दौरान इन सवालों को कम महत्व देता है। लेकिन यहाँ असली जादू है: शिक्षक एलेक्स से कहता है, "अगर तुम्हें उत्तर नहीं पता, तो तुम्हें 'मुझे नहीं पता' कहने की अनुमति है।"

पुराने समय में, यदि कोई छात्र कहता था "मुझे नहीं पता," तो उसे शून्य मिलता था। इस नई प्रणाली में, कहना कि "मुझे नहीं पता" (जिसे एक विशेष टोकन <IDK> द्वारा दर्शाया जाता है) उन सवालों के लिए सही उत्तर है जिन्हें एलेक्स नहीं जानता।

3. परिणाम: एक ईमानदार छात्र

इस प्रशिक्षण के बाद, एलेक्स का व्यवहार बदल जाता है:

  • जब एलेक्स को उत्तर पता होता है: एलेक्स आत्मविश्वास और सटीकता के साथ उत्तर देता है।
  • जब एलेक्स को उत्तर नहीं पता होता: मनगढ़ंत तथ्य बनाने के बजाय, एलेक्स विनम्रता से कहता है, "मुझे नहीं पता।"

यह "आत्मविश्वास के साथ झूठ बोलने" (hallsucinations) को रोकता है।

यह अन्य तरीकों से बेहतर क्यों है?

  • पुरानी विधि (SFT): एलेक्स को हर चीज़ का उत्तर देने के लिए मजबूर करती है। परिणाम: एलेक्स आत्मविश्वास के साथ झूठ बोलता है।
  • अन्य नई विधियाँ: कुछ विधियाँ एलेक्स को "मुझे नहीं पता" कहना सिखाने की कोशिश करती हैं, लेकिन इसे एक बाइनरी स्विच (जानना/न जानना) की तरह मानती हैं। लेकिन यह शोध पत्र दिखाता है कि ज्ञान एक "लाइट स्विच" की तुलना में एक "वॉल्यूम नॉब" (क्रमिक/ग्रेड) की तरह है। कुछ तथ्य "धुंधले" होते हैं, और नई विधि उस बारीकी को बेहतर ढंग से संभालती है।
  • टोकन-लेवल विधियाँ: कुछ विधियाँ एलेक्स को तब तक बोलने से रोकने की कोशिश करती हैं जब तक वह निश्चित न हो। इस शोध पत्र की विधि एलेक्स को बोलने देती है जब तक कि वह वास्तव में पूरी तरह अनभिज्ञ न हो, जो उत्तरों को सटीक रखते हुए भी ईमानदार बनाए रखती है।

"जादुई मीट्रिक" (nAUPC)

शोधकर्ताओं ने एलेक्स को ग्रेड देने का एक नया तरीका भी बनाया है। आमतौर पर, शिक्षक केवल इस बात की परवाह करते हैं कि उत्तर सही है या गलत। लेकिन यह शोध पत्र कहता है, "हमें ईमानदारी को भी ग्रेड देने की आवश्यकता है।"

उन्होंने एक स्कोर बनाया जिसे nAUPC कहा जाता है। यह एलेक्स को पुरस्कृत करता है:

  1. सही उत्तर देने के लिए जब वह जानता है।
  2. "मुझे नहीं पता" कहने के लिए जब वह नहीं जानता।
  3. "मुझे नहीं पता" नहीं कहने के लिए जब वह वास्तव में जानता है (क्योंकि ऐसा करना बेवकूफी होगी)।

निष्कर्ष

यह शोध पत्र AI मॉडल्स को विनम्र होना सिखाता है। प्रशिक्षण से पहले यह जाँचकर कि मॉडल वास्तव में किसी तथ्य को कितनी अच्छी तरह जानता है, और मॉडल को यह स्वीकार करने के लिए पुरस्कृत करके कि वह अनभिज्ञ है, हमें एक ऐसा AI मिलता है जो पहले जितना ही स्मार्ट है, लेकिन मनगढ़ंत बातें बनाने की संभावना बहुत कम है।

संक्षेप में: यह एक ऐसे छात्र के बीच का अंतर है जो शिक्षक को खुश करने के लिए बेतहाशा अंदाज़े लगाता है, और एक ऐसे छात्र के बीच जो कहता है, "मैं पक्का नहीं हूँ, मुझे इसे देखने दें," या "मुझे नहीं पता।" दूसरा छात्र बहुत अधिक विश्वसनीय है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →