← नवीनतम पेपर
💬 NLP

Self-Calibrating Language Models via Test-Time Discriminative Distillation

यह शोध पत्र SECL को प्रस्तुत करता है, जो एक नवीन टेस्ट-टाइम ट्रेनिंग फ्रेमवर्क है जो एक लैंग्वेज मॉडल के मौखिक रूप से व्यक्त आत्मविश्वास (verbalized confidence) और उसके आंतरिक विभेदक "True" टोकन संभाव्यता (internal discriminative "True" token probability) के बीच के अंतर का लाभ उठाकर एक लेबल-मुक्त स्व-पर्यवेक्षित संकेत (label-free self-supervisory signal) के रूप में उपयोग करता है ताकि इन्फरेंस के दौरान मॉडल को गतिशील रूप से कैलिब्रेट किया जा सके, जिससे बिना किसी लेबल वाले डेटा की आवश्यकता के या अत्यधिक लागत उठाए बिना कैलिब्रेशन त्रुटि को महत्वपूर्ण रूप से कम किया जा सके।

मूल लेखक: Mohamed Rissal Hedna, Jan Strich, Martin Semmann, Chris Biemann

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohamed Rissal Hedna, Jan Strich, Martin Semmann, Chris Biemann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Self-Calibrating Language Models via Test-Time Discriminative Distillation" (SECL) का सरल भाषा और रचनात्मक उपमाओं के साथ अनुवाद दिया गया है।

बड़ी समस्या: अति-आत्मविश्वासी विशेषज्ञ (The Overconfident Expert)

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लेकिन थोड़ा अहंकारी छात्र है जिसका नाम LLM (लार्ज लैंग्वेज मॉडल) है। यह छात्र अविश्वसनीय रूप से स्मार्ट है और लगभग किसी भी सवाल का जवाब दे सकता है। हालाँकि, इसमें एक घातक दोष है: यह खतरनाक रूप से अति-आत्मविश्वासी है।

यदि आप LLM से ऐसा सवाल पूछते हैं जिसका उत्तर उसे नहीं पता, तो भी वह कहेगा, "मुझे 99% यकीन है कि मैं सही हूँ!" जबकि वास्तव में वह गलत होगा। वास्तविक दुनिया में (जैसे अस्पतालों या कानून के क्षेत्र में), यह खतरनाक है। यदि किसी डॉक्टर का AI कहता है, "मुझे 100% यकीन है कि इस मरीज की हड्डी टूटी हुई है," लेकिन वास्तव में हड्डी ठीक है, तो मरीज को चोट पहुँच सकती है।

लंबे समय तक, इसे ठीक करने के लिए एक शिक्षक (मानवीय डेटा) की आवश्यकता होती थी जो छात्र के काम को ग्रेड दे सके और कह सके, "नहीं, तुम इसके बारे में केवल 60% ही निश्चित हो।" लेकिन वास्तविक दुनिया में, हमारे पास हर एक सवाल के लिए शिक्षक उपलब्ध नहीं होता है।

गुप्त सुपरपावर: "आंतरिक आवाज़" (The "Inner Voice")

शोधकर्ताओं ने LLMs के बारे में एक दिलचस्प बात खोजी है। जबकि उनका मुखर आत्मविश्वास (जो वे ज़ोर से कहते हैं) अक्सर गलत होता है, उनकी आंतरिक आवाज़ (एक छिपा हुआ कैलकुलेशन जो वे करते हैं) वास्तव में बहुत सटीक होती है।

इसे इस तरह सोचें:

  • मुखर LLM: "मुझे पूरा यकीन है कि यह फ्रांस की राजधानी है!" (गलत, वास्तव में यह बर्लिन है)।
  • आंतरिक LLM: जब पूछा जाता है, "क्या 'बर्लिन' सही उत्तर है?" तो मॉडल का आंतरिक गणित कहता है, "वास्तव में, इसकी सही होने की संभावना केवल 10% है।"

मॉडल जानता है कि वह गलत है, लेकिन वह इसे बोलकर नहीं बताता। जो वह जनरेट करता है (कहता है) और जो वह डिस्क्रिमिनेट करता है (जानता है), उसके बीच एक अंतर होता है।

समाधान: SECL (स्व-सुधार करने वाला छात्र)

लेखकों ने SECL (सेल्फ-कैलिब्रेटिंग लैंग्वेज मॉडल्स) नामक एक विधि बनाई है। एक मानव शिक्षक का इंतज़ार करने के बजाय, SECL मॉडल को अपनी ही "आंतरिक आवाज़" को सुनने और वास्तविक समय (real-time) में अपनी "मुखर आवाज़" को समायोजित करने की शिक्षा देता है।

यहाँ SECL कैसे काम करता है, एक शेफ की रसोई की उपमा के माध्यम से दिया गया है:

1. स्वाद परीक्षण (The Gap)

कल्पना कीजिए कि एक शेफ (LLM) एक नया व्यंजन बना रहा है।

  • मुखर शेफ: "यह सूप एकदम परफेक्ट है! मैं 100% आश्वस्त हूँ!"
  • स्वाद परीक्षण (The Gap): शेफ चुपके से सूप चखता है। स्वाद परीक्षण कहता है, "यह वास्तव में नमकीन है और इसे सुधारने की ज़रूरत है।"
  • समस्या: शेफ चिल्लाकर "परफेक्ट!" कहता रहता है, भले ही स्वाद परीक्षण कह रहा हो कि "इसे सुधारो।"

2. प्रशिक्षण का "झोंका" (Test-Time Training)

आमतौर पर, शेफ रेस्टोरेंट खोलने से पहले सालों तक प्रशिक्षण लेते हैं। SECL अलग है। यह रेस्टोरेंट खुला होने के दौरान (टेस्ट-टाइम पर) प्रशिक्षण देता है।

  • जब शेफ को किसी नए प्रकार के ग्राहक (एक नया विषय या डेटा वितरण) का सामना करना पड़ता है, तो SECL एक त्वरित "कैलिब्रेशन बर्स्ट" (calibration burst) शुरू करता है।
  • यह शेफ से पूछता है: "तुमने कहा कि यह 100% परफेक्ट है, लेकिन तुम्हारा स्वाद परीक्षण कहता है कि यह केवल 40% अच्छा है। चलो तुम्हारे आत्मविश्वास के डायल को 40% तक कम करते हैं।"
  • शेफ अपने मस्तिष्क में एक छोटा सा समायोजन करता है ( LoRA तकनीक का उपयोग करके, जो शेफ की वर्दी में एक छोटे, हटाने योग्य एप्रन की तरह है) ताकि वह इस सबक को याद रख सके।

3. एंट्रॉपी गेट (The Smart Doorbell)

आप नहीं चाहेंगे कि हर बार जब कोई ग्राहक आए तो आप शेफ को प्रशिक्षित करने के लिए रसोई रोक दें। इससे काम बहुत धीमा हो जाएगा।

  • SECL एक स्मार्ट डोरबेल (एंट्रॉपी गेटिंग) का उपयोग करता है।
  • यदि सभी ग्राहक "इटालियन खाना" (एक ही विषय) मांग रहे हैं, तो डोरबेल शांत रहती है। शेफ सामान्य रूप से खाना बनाना जारी रखता है।
  • लेकिन यदि कोई ग्राहक आता है और "सुशी" (एक बिल्कुल नया विषय) मांगता है, तो डोरबेल बजती है! शेफ रुकता है, नए व्यंजन का स्वाद लेता है, और अपने आत्मविश्वास के डायल को एडजस्ट करता है।
  • यह बहुत अधिक ऊर्जा और समय बचाता है।

यह गेम-चेंजर क्यों है?

अति-आत्मविश्वास को ठीक करने के पिछले तरीके ऐसे थे:

  • सैंपलिंग (Sampling): शेफ से सूप को 20 बार बनाने के लिए कहना ताकि देखा जा सके कि क्या इसका स्वाद एक जैसा रहता है। (बहुत धीमा और महंगा)।
  • स्टैटिक प्रोबिंग (Static Probing): रसोई का साल में एक बार निरीक्षण करने के लिए एक सलाहकार को नियुक्त करना। (जब मेनू बदल जाता है, तो यह बेकार है)।
  • सुपरवाइज्ड लर्निंग (Supervised Learning): हर एक व्यंजन का स्वाद लेने के लिए एक इंसान को नियुक्त करना। (यह बहुत महंगा है और इसके लिए मानवीय डेटा की आवश्यकता होती है)।

SECL अलग है क्योंकि:

  1. यह मुफ्त है: यह शिक्षक के रूप में मॉडल की अपनी "आंतरिक आवाज़" का उपयोग करता है। किसी इंसान की ज़रूरत नहीं है।
  2. यह तेज़ है: यह केवल तभी प्रशिक्षण देता है जब आवश्यक हो (जब विषय बदलता है), जिससे यह अन्य तरीकों की तुलना में बहुत सस्ता हो जाता है।
  3. यह काम करता है: प्रयोगों में, SECL ने "ओवरकॉन्फिडेंस एरर" को 56% से 78% तक कम कर दिया। मॉडल इस बारे में बहुत अधिक ईमानदार हो गया कि वह क्या जानता है और क्या नहीं।

कमी (सीमाएँ)

पेपर एक बड़ा नियम स्वीकार करता है: आप किसी छात्र को ईमानदार होने के लिए तभी सिखा सकते हैं जब वे वास्तव में सच्चाई को जानते हों।
यदि मॉडल की "आंतरिक आवाज़" भी भ्रमित या गलत है, तो SECL इसे ठीक नहीं कर सकता। लेकिन अधिकांश आधुनिक AI मॉडल्स के लिए, यह आंतरिक आवाज़ आश्चर्यजनक रूप से सटीक होती है, जो SECL को बिना किसी मानव पर्यवेक्षक के AI को सुरक्षित और विश्वसनीय बनाने के लिए एक शक्तिशाली उपकरण बनाती है।

सारांश

SECL एक सेल्फ-ड्राइविंग कार की तरह है जो लगातार अपने आंतरिक मानचित्र (internal map) के विरुद्ध अपने जीपीएस (GPS) की जाँच करती रहती है। यदि जीपीएस कहता है "बाएँ मुड़ें" लेकिन आंतरिक मानचित्र कहता है "यह एक बंद रास्ता है," तो कार यात्री को "मुझे इस मोड़ के बारे में यकीन नहीं है" बताने से पहले, चुपचाप अपने आत्मविश्वास को समायोजित कर लेती है, बजाय इसके कि वह आत्मविश्वास के साथ दीवार में गाड़ी चला दे। यह AI को स्मार्ट, सुरक्षित और अधिक ईमानदार बनाता है, और यह सब काम करते समय ही होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →