← नवीनतम पेपर
🤖 AI

Inference-Time Conformal Reasoning with Valid Factuality Control for Large Language Models

यह शोध पत्र इन्फरेंस-टाइम कॉन्फॉर्मल रीजनिंग (ITCR) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो वैध, संरचना-स्तरीय तथ्यात्मकता नियंत्रण प्रदान करने के लिए और पोस्ट-हॉक विधियों की तुलना में सटीकता में सुधार करने के लिए रीजनिंग ग्राफ के निर्माण में सीधे कॉन्फॉर्मल प्रेडिक्शन को एकीकृत करता है।

मूल लेखक: Ting Wang, Yuanjie Shi, Yan Yan, Huan Zhang

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ting Wang, Yuanjie Shi, Yan Yan, Huan Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक बहुत ही बुद्धिमान, लेकिन कभी-कभी अति-आत्मविश्वासी जासूस के रूप में करें जो एक जटिल रहस्य को सुलझाने की कोशिश कर रहा है। मामले को सुलझाने के लिए, जासूस केवल एक निष्कर्ष पर नहीं कूदता; बल्कि वह कदम-दर-कदम, तर्क की एक श्रृंखला बनाता है।

समस्या: गलतियों का "डोमिनो प्रभाव" (Domino Effect)
पुराने तरीके में, जासूस पहले अपनी पूरी कहानी लिख देता था, पहले सुराग से लेकर अंतिम फैसले तक। कहानी पूरी होने के बाद ही एक सुपरवाइजर उसकी जांच करता था।

  • दोष: यदि जासूस ने पहले ही सुराग पर कोई गलती कर दी, तो उसके बाद के हर एक कदम का निर्माण उसी त्रुटि पर आधारित होगा। यह ताश के पत्तों का घर बनाने जैसा है जो एक कमजोर नींव पर टिका हो। भले ही सुपरवाइजर कहानी के अंत को ठीक कर दे, लेकिन पूरी संरचना समझौतापूर्ण रह जाती है। सुपरवाइजर नुकसान होने के बाद ही कहानी के खराब हिस्सों को "प्रून" (काट) सकता है, जिससे अक्सर जासूस के पास कोई कहानी ही नहीं बचती।

समाधान: ITCR (इन्फरेंस-टाइम कॉन्फॉर्मल रीजनिंग)
यह पेपर एक नई विधि प्रस्तावित करता है जिसे ITCR कहा जाता है। इसे एक "स्मार्ट सेफ्टी इंस्पेक्टर" के रूप में सोचें जो जासूस के साथ कहानी बनाने के दौरान चलता है, न कि उसके बाद।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "स्टॉप साइन" रणनीति

जासूस को पूरी कहानी लिखने देने और फिर उसे चेक करने के बजाय, इंस्पेक्टर हर एक कदम पर कहानी की जांच करता है।

  • उपमा: कल्पना करें कि जासूस एक अंधेरे जंगल से गुजर रहा है। इंस्पेक्टर के पास एक विशेष रडार है जो यह मापता है कि आगे का रास्ता कितना "धुंधला" या "अनिश्चित" है।
  • कार्रवाई: जब तक रास्ता साफ है (कम अनिश्चितता), जासूस चलता रहता है और कदम जोड़ता रहता है। जैसे ही रडार बीप करता है और कहता है, "रुको, यह रास्ता बहुत धुंधला और जोखिम भरा है," इंस्पेक्टर तुरंत एक स्टॉप साइन (रोकने का संकेत) लगा देता है।
  • परिणाम: जासूस वहीं रुक जाता है। वह कहानी को पूरा नहीं करता। इसके बजाय, वह कहानी का वह हिस्सा सौंप देता है जिसे उसने उस सुरक्षित बिंदु तक बनाया था। यह सुनिश्चित करता है कि उनके द्वारा सौंपी गई अंतिम कहानी गारंटीकृत रूप से "धुंधले" (तथ्यात्मक रूप से गलत) हिस्सों से मुक्त है।

2. "नेस्टेड" (Nested) सुरक्षा जाल

यह पेपर एक चतुर गणितीय ट्रिक पेश करता है जिसे "नेस्टेड प्रॉपर्टी" कहा जाता है।

  • उपमा: रूसी नेस्टिंग डॉल्स (रशियन गुड़िया) के रूप में तर्क के चरणों के बारे में सोचें। आपके पास एक छोटी गुड़िया है (पहला कदम), फिर एक थोड़ी बड़ी गुड़िया (पहले दो कदम), फिर एक और बड़ी गुड़िया (पहले तीन कदम), और इसी तरह।
  • नियम: जैसे-जैसे आप अधिक गुड़िया जोड़ते हैं, "जोखिम स्कोर" (कहानी के गलत होने की संभावना) हमेशा बढ़ना चाहिए। आप एक कदम जोड़कर अचानक कहानी को पहले की तुलना में अधिक सुरक्षित नहीं बना सकते।
  • महत्व: क्योंकि जोखिम हमेशा बढ़ता है, इसलिए जिस क्षण इंस्पेक्टर "स्टॉप" कहता है, वे निश्चित रूप से जानते हैं कि कोई भी अगला कदम भी असुरक्षित होगा। पीछे मुड़कर देखने या संदेह करने की कोई आवश्यकता नहीं है। रुकने का निर्णय अंतिम और गणितीय रूप से सुरक्षित है।

3. सुरक्षित खेलने के दो तरीके

पेपर में इंस्पेक्टर के लिए दो अलग-अलग "सेफ्टी मोड" का वर्णन किया गया है:

  • मोड A: "कोई गलत कदम नहीं" (सटीकता/Precision): इंस्पेक्टर अत्यंत सख्त है। यदि किसी कदम के गलत होने की थोड़ी सी भी संभावना है, तो वे रुक जाते हैं। यह गारंटी देता है कि कहानी में शून्य झूठ हैं, लेकिन यह बहुत छोटी हो सकती है (जैसे एक जासूस जो पहले सुराग के बाद ही रुक जाता है क्योंकि वह 100% सुनिश्चित नहीं है)।
  • मोड B: "कोई छूटा हुआ कदम नहीं" (रिकॉल/Recall): इंस्पेक्टर अधिक उदार है। वे चाहते हैं कि जासूस बहुत जल्दी न रुक जाए और महत्वपूर्ण सच्चे तथ्यों को न छोड़ दे। वे कहानी को जारी रखने के लिए थोड़ी सी "धुंध" की अनुमति दे सकते हैं, जिससे यह सुनिश्चित होता है कि सभी सही सुराग शामिल हैं, भले ही इसका अर्थ यह हो कि कहानी थोड़ी कम पूर्ण है।

परिणाम: क्या हुआ?

शोधकर्ताओं ने गणितीय समस्याओं और सामान्य ज्ञान के प्रश्नों पर इनका परीक्षण किया।

  • बेहतर सटीकता: जासूस को बड़ी गलती करने से पहले ही रोककर, अंतिम उत्तर पुराने "बाद में जांचने वाले" तरीके की तुलना में काफी अधिक सटीक (औसतन लगभग 18% बेहतर) थे।
  • समय की बचत: क्योंकि यह नया तरीका जोखिम भरा होने पर जल्दी रुक जाता है, इसलिए यह लंबी, गलत कहानियाँ बनाने में समय बर्बाद नहीं करता जिन्हें बाद में फेंकना पड़ता है। यह कम कंप्यूटर संसाधनों (टोकन) का उपयोग करता है और तेजी से समाप्त होता है।

सारांश में:
यह पेपर केवल यह नहीं कहता कि "बाद में काम की जांच करें।" यह कहता है, "एक ऐसी सुरक्षा प्रणाली बनाएं जो काम होते समय ही उस पर नज़र रखे और जैसे ही रास्ता खतरनाक हो, ब्रेक लगा दे।" यह सुनिश्चित करता है कि जब लार्ज लैंग्वेज मॉडल अंततः बोलता है, तो वह गणितीय रूप से गारंटीकृत सत्यनिष्ठा के साथ बोल रहा होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →