← नवीनतम पेपर
🤖 machine learning

Differentiable Conformal Training for LLM Reasoning Factuality

यह शोध पत्र डिफ़रेंशिएबल कोहेरेंट फैक्टुअलिटी (DCF) प्रस्तुत करता है, जो गैर-डिफरेंशिएबल कोहेरेंट फैक्टुअलिटी विधि का एक पूर्ण रूप से डिफरेंशिएबल रिलैक्सेशन है, जो मल्टी-स्टेप LLM रीजनिंग के लिए बेहतर स्कोरर्स सीखने में सक्षम बनाता है, जिससे मतिभ्रम (hallucinations) के विरुद्ध सांख्यिकीय विश्वसनीयता गारंटी बनाए रखते हुए क्लेम रिटेंशन (claim retention) में 141% तक का सुधार प्राप्त होता है।

मूल लेखक: Nathan Hittesdorf, Marco Salzetta, Lu Cheng

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nathan Hittesdorf, Marco Salzetta, Lu Cheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Differentiable Conformal Training for LLM Reasoning Factuality" पेपर का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी समस्या: आत्मविश्वासी झूठा (The Confident Liar)

कल्पना कीजिए कि आपने जटिल गणित की समस्याओं को हल करने या कानूनी दस्तावेज़ लिखने में मदद करने के लिए एक बुद्धिमान लेकिन थोड़े अविश्वसनीय सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) को काम पर रखा है। यह सहायक अविश्वसनीय रूप से स्मार्ट है और पूरे आत्मविश्वास के साथ बोलता है। हालाँकि, उसकी एक बुरी आदत है: हैलुसिनेशन (Hallucination/भ्रम)। वह गलत तथ्यों को इस तरह से पूरे विश्वास के साथ बताएगा जैसे कि वे परम सत्य हों।

यदि आप इस सहायक का उपयोग महत्वपूर्ण कार्यों (जैसे चिकित्सा सलाह या वित्तीय योजना) के लिए करते हैं, तो आप यह जोखिम नहीं उठा सकते कि वह झूठ बोले। लेकिन यदि आप उससे कहते हैं कि "केवल तभी बोलें जब आप सुनिश्चित हों," तो वह इतना सतर्क हो सकता है कि वह बोलना ही बंद कर दे, जिससे आपको कोई मदद ही नहीं मिलेगी।

पुराना समाधान: "सुरक्षा जाल" (Conformal Prediction)

शोधकर्ताओं ने इसे ठीक करने के लिए Conformal Prediction (CP) नामक एक विधि विकसित की। इसे एक सुरक्षा जाल (Safety Net) के रूप में सोचें।

  1. प्रक्रिया: सहायक अपने लंबे उत्तर को छोटे, परमाणु वाक्यों (दावों) में तोड़ता है।
  2. स्कोर: प्रत्येक वाक्य को एक "जोखिम स्कोर" (Risk Score) दिया जाता है। यदि स्कोर अधिक है, तो वाक्य जोखिम भरा है (झूठ होने की संभावना है)। यदि कम है, तो यह सुरक्षित है।
  3. फ़िल्टर: सिस्टम एक "कट-ऑफ लाइन" (सीमा) निर्धारित करता है। कोई भी वाक्य जिसका जोखिम स्कोर उस रेखा से ऊपर है, उसे हटा दिया जाता है।
  4. गारंटी: सिस्टम को इस तरह कैलिब्रेट किया गया है कि यदि आप 90% सच्चाई बनाए रखने के लिए रेखा सेट करते हैं, तो यह सांख्यिकीय रूप से गारंटी देता है कि शेष 90% में से कम से कम 90% सच होगा।

कमी: इस रेखा को सेट करने का पुराना तरीका एक हाथ से बने, कुंद हथौड़े की तरह था। यह बहुत अधिक आक्रामक था। सुरक्षित रहने के लिए, यह न केवल झूठ को, बल्कि सच्चाई के एक बड़े हिस्से को भी फेंक देता था। पेपर के प्रयोगों में, इस पुराने तरीके ने सुरक्षित रहने के चक्कर में लगभग 60% सही उत्तरों को हटा दिया था। यह एक व्यक्ति की गलती के कारण पूरी टीम को नौकरी से निकालने जैसा था।

नया समाधान: "स्मार्ट फ़िल्टर" (Differentiable Coherent Factuality)

लेखकों ने एक नई विधि पेश की है जिसे Differentiable Coherent Factuality (DCF) कहा जाता है।

उपमा 1: जासूस बनाम बाउंसर (The Detective vs. The Bouncer)

  • पुराना तरीका (बाउंसर): पुराना सिस्टम एक क्लब के बाउंसर की तरह था जिसके पास एक सख्त, कठोर सूची थी। "यदि आपका आईडी कहता है कि आप 21 वर्ष से ऊपर हैं, लेकिन आप 19 के दिखते हैं, तो आप बाहर हैं।" इसे संदर्भ (Context) की परवाह नहीं थी। इसने हर वाक्य को एक अलग तथ्य के रूप में माना।
  • नया तरीका (जासूस): नया सिस्टम एक जासूस की तरह काम करता है। यह जानता है कि एक तर्क श्रृंखला (जैसे गणित का प्रमाण) में तथ्य आपस में जुड़े होते हैं।
    • उदाहरण: यदि गणितीय प्रमाण का पहला चरण "2 + 2 = 5" (गलत) है, तो अगला चरण "इसलिए, 4 = 5" भी तार्किक रूप से टूटा हुआ होगा, भले ही उस विशिष्ट चरण में गणित सही क्यों न दिख रहा हो।
    • नया सिस्टम तर्क की पूरी श्रृंखला (Dependency Graph) को देखता है। यह समझता है कि यदि नींव कमजोर है, तो पूरी इमारत असुरक्षित है।

उपमा 2: "स्मूथ" बनाम "ब्लॉकी" स्विच (The "Smooth" vs. "Blocky" Switch)

सबसे बड़ी तकनीकी सफलता सिस्टम को Differentiable (विभेदक) बनाना है।

  • पुराना तरीका (ब्लॉकी स्विच): एक ऐसे लाइट स्विच की कल्पना करें जो या तो पूरी तरह से चालू (ON) है या बंद (OFF) है। आप इसे धीरे-धीरे स्लाइड नहीं कर सकते। कंप्यूटर को इस स्विच को बेहतर ढंग से चलाने के लिए प्रशिक्षित करने के लिए, आप "ग्रेडिएंट डिसेंट" (AI सीखने का मानक तरीका) का उपयोग नहीं कर सकते क्योंकि स्विच सुचारू रूप से नहीं चलता है। आपको अनुमान लगाना और परीक्षण करना पड़ता है, जो धीमा और अक्षम है।
  • नया तरीका (डिमर स्विच): लेखकों ने उस ब्लॉकी स्विच को एक स्मूथ डिमर (Dimmer Switch) में बदल दिया। उन्होंने फ़िल्टर का एक "सॉफ्ट" संस्करण बनाया जिसे थोड़ा ऊपर या नीचे समायोजित किया जा सकता है।
    • यह AI को फ़िल्टर को सटीक रूप से ट्यून करना सीखने की अनुमति देता है। यह कह सकता है, "हम्म, यह वाक्य जोखिम भरा है, लेकिन क्योंकि यह पहले के एक बहुत ही मजबूत, सत्य वाक्य से जुड़ा है, मैं इसे 90% विश्वास के साथ रखूँगा।"
    • क्योंकि सिस्टम "स्मूथ" है, AI लाखों बार अभ्यास कर सकता है, और सुरक्षा (झूठ को बाहर रखना) और उपयोगिता (सच्चाई को अंदर रखना) के बीच सही संतुलन सीखना सीख सकता है।

परिणाम: अधिक सच्चाई, वही सुरक्षा

जब उन्होंने इस नए "स्मार्ट फ़िल्टर" (DCF) का परीक्षण किया:

  • सुरक्षा: इसने वही सख्त सुरक्षा गारंटी बनाए रखी (जैसे, "हम वादा करते हैं कि जो कुछ भी हम कहते हैं उसका 95% सच है")।
  • उपयोगिता: इसने पुराने तरीके की तुलना में 141% तक अधिक सत्य दावे रखे।

साधारण शब्दों में: नया सिस्टम एक बहुत अधिक स्मार्ट संपादक की तरह है। पुराना संपादक यह सुनिश्चित करने के लिए आपके आधे पांडुलिपि को हटा देता था कि कोई टाइपो न रहे। नया संपादक पूरी कहानी पढ़ता है, संदर्भ को समझता है, और केवल वास्तविक त्रुटियों को हटाता है, जिससे आपकी कहानी अधिक लंबी, अधिक उपयोगी और फिर भी त्रुटि रहित रहती है।

यह क्यों मायने रखता है

यह वास्तविक दुनिया में AI के उपयोग के लिए एक बड़ा कदम है।

  • पहले: हमें "सुरक्षित लेकिन बेकार" (AI कुछ नहीं कहता) या "उपयोगी लेकिन जोखिम भरा" (AI झूठ बोलता है) के बीच चयन करना पड़ता था।
  • अब: हमारे पास एक ऐसा सिस्टम है जो सुरक्षित और उपयोगी दोनों है। यह हमें उच्च-दांव वाली स्थितियों (जैसे कानून, चिकित्सा या विज्ञान) में गहराई के साथ AI पर भरोसा करने की अनुमति देता है।

सारांश रूपक (Summary Metaphor)

पुराने तरीके को बहुत बड़े छेदों वाली छलनी के रूप में सोचें। यह खराब चीजों को अंदर आने देती है, या यदि आप खराब चीजों को रोकने के लिए छेद छोटे करते हैं, तो आप गलती से सारी अच्छी चीजों को भी छान देते हैं।

नया तरीका (DCF) एक स्मार्ट, खुद को एडजस्ट करने वाली छलनी की तरह है। यह सीखता है कि अनाज (तथ्य) के हर विशिष्ट प्रकार के लिए छेद कितने बड़े होने चाहिए। यह जानता है कि कुछ अनाज नाजुक होते हैं जिन्हें बड़े छेद की आवश्यकता होती है, जबकि अन्य भारी होते हैं जिन्हें छोटे छेद की आवश्यकता होती है। परिणाम? आपको लगभग सभी अच्छे अनाज के साथ एक साफ बाल्टी मिलती है और कोई भी बुरा अनाज नहीं मिलता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →