← नवीनतम पेपर
💬 NLP

Think Through Uncertainty: Improving Long-Form Generation Factuality via Reasoning Calibration

यह शोध पत्र CURE को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो एक संरचित तर्क प्रोटोकॉल और बहु-चरणीय अंशांकन (कैलिब्रेशन) के माध्यम से बड़े भाषा मॉडलों को व्यक्तिगत दावे के स्तर पर आत्मविश्वास का अनुमान लगाने के लिए प्रशिक्षित करके दीर्घ-रूप पीढ़ी की तथ्यात्मकता को बढ़ाता है, जिससे अधिक सटीक चयनात्मक भविष्यवाणी सक्षम होती है और मतिभ्रम (हैलुसिनेशन) को काफी कम किया जाता है।

मूल लेखक: Xin Liu, Lu Wang

प्रकाशित 2026-04-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xin Liu, Lu Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, विश्वकोश जैसा ज्ञान रखने वाला रोबोट दोस्त है जिसे कहानियाँ सुनाना पसंद है। यह रोबोट लंबी, विस्तृत जीवनियाँ लिख सकता है या जटिल विषयों को लगभग किसी भी अन्य व्यक्ति से बेहतर समझा सकता है। लेकिन एक पेंच है: रोबोट एक बहुत बुरा झूठा है और उसे पता भी नहीं है कि वह झूठ बोल रहा है।

यदि रोबोट किसी तथ्य के बारे में 100% आश्वस्त है, तो वह इसे गरजती हुई आवाज़ में कहेगा। यदि वह केवल अनुमान लगा रहा है, तो भी वह इसे उसी बुलंद आवाज़ में कहेगा। वह कह सकता है, "डेविड बोवी मंगल ग्रह पर पैदा हुए थे," ठीक उसी आत्मविश्वास के साथ जैसे वह कहेगा, "डेविड बोवी लंदन में पैदा हुए थे।" इसे हैलुसिनेशन (hallucination) कहा जाता है, और यह रोबोट की लंबी कहानियों को खतरनाक बनाता है क्योंकि आप यह नहीं बता सकते कि क्या सच है और क्या मनगढ़ंत।

यह शोध पत्र CURE (Claim-level Uncertainty-aware Reasoning for Factual Generation) नामक एक नया ढांचा पेश करता है। CURE को एक "सत्य कोच" (truth coach) के रूप में समझें जो रोबोट को सोचने का एक नया तरीका सिखाता है।

CURE कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से दिया गया है:

1. "परमाणु दावा" विभाजन (लेगो एनालॉजी)

पहले, जब रोबोट एक जीवनी लिखता था, तो वह एक बड़ा, अटूट टेक्स्ट ब्लॉक लिखता था। यदि एक वाक्य भी गलत होता, तो पूरा ब्लॉक संदिग्ध हो जाता था।

CURE खेल बदल देता है: यह रोबोट को अपनी कहानी को छोटे, व्यक्तिगत लेगो ब्रिक्स (जिसे "एटॉमिक क्लेम" कहा जाता है) में तोड़ने के लिए मजबूर करता है।

  • डेविड बोवी के बारे में पैराग्राफ लिखने के बजाय, रोबोट सूची बनाता है:
    • ईंट 1: लंदन में पैदा हुए।
    • ईंट 2: 1966 में नाम बदला।
    • ईंट 3: 2016 में निधन हुआ।
  • जादू: हर एक ईंट के लिए, रोबोट को एक कॉन्फिडेंस स्टिकर (विश्वास का स्टिकर) लगाना होगा।
    • "लंदन में पैदा हुए" को गोल्ड स्टिकर मिलता है (98% निश्चित)।
    • "2016 में निधन हुआ" को शायद येलो स्टिकर (30% निश्चित) मिल सकता है क्योंकि रोबोट वास्तव में सटीक तारीख को लेकर थोड़ा अस्पष्ट है।

2. "तीन-चरणीय प्रशिक्षण शिविर" (Three-Stage Training Camp)

लेखकों ने महसूस किया कि आप रोबोट को सिर्फ यह नहीं कह सकते कि "अधिक सटीक बनो।" इसे यह सीखने के लिए एक विशिष्ट प्रशिक्षण दिनचर्या की आवश्यकता है कि कब अनिश्चित होना है। वे तीन चरणों वाले शिविर का उपयोग करते हैं:

  • चरण 1: "फॉर्मेट पुलिस" (Feasibility Induction)
    सबसे पहले, वे रोबोट को खेल के नियम सिखाते हैं। इसे उन लेगो ब्रिक्स में अपने उत्तरों को तोड़ने और कॉन्फिडेंस स्टिकर लगाने का सीखना होगा। यदि रोबोट बिना स्टिकर के एक विशाल पैराग्राफ लिखने की कोशिश करता है, तो "पुलिस" (एक स्वचालित प्रणाली) उसे वापस ड्राइंग बोर्ड पर भेज देती है। यह सुनिश्चित करता है कि रोबोट वास्तव में छोटे, सत्यापन योग्य टुकड़ों में सोच रहा है।

  • चरण 2: "ईमानदारी कोच" (Calibration Optimization)
    यह सबसे महत्वपूर्ण हिस्सा है। रोबोट को ऐसे उदाहरण दिखाए जाते हैं जहाँ वह गलत था लेकिन आत्मविश्वास दिखा रहा था, या सही था लेकिन संकोच कर रहा था।

    • परिदृश्य: रोबोट कहता है, "मुझे 100% यकीन है कि चंद्रमा पनीर से बना है।"
    • कोच: "नहीं! यह गलत है। तुम्हें कहना चाहिए था, 'मुझे 0% यकीन है।'"
    • रोबोट अपने कॉन्फिडेंस स्टिकर को सत्य के साथ मिलाना सीखता है। यदि वह अनुमान लगा रहा है, तो स्टिकर कम होना चाहिए। यदि वह निश्चित है, तो स्टिकर अधिक होना चाहिए। यह रोबोट को "आत्मविश्वासी झूठा" बनने से रोकता है।
  • चरण 3: "तथ्य-जांचकर्ता" (Factuality Optimization)
    अब जब रोबोट यह जान गया है कि अपनी अनिश्चितता के बारे में ईमानदार कैसे होना है, तो वे उसे वास्तव में तथ्यों को सही करने के लिए सिखाते हैं। वे उसे लेगो ब्रिक्स सही करने के लिए पुरस्कृत करते हैं, लेकिन वे यह सुनिश्चित करते हैं कि यह प्रशिक्षण चरण 2 के "ईमानदारी कोच" के पाठों को खराब न करे।

3. "चयनात्मक फिल्टर" (क्लब का बाउंसर)

एक बार प्रशिक्षित होने के बाद, रोबोट वास्तविक दुनिया में अविश्वसनीय रूप से उपयोगी हो जाता है। कल्पना कीजिए कि आप रोबोट से एक जीवनी मांगते हैं।

  • पुराना रोबोट: एक लंबी कहानी लिखता है। आप इसे पढ़ते हैं और महसूस करते हैं कि इसका आधा हिस्सा बकवास है, लेकिन आपको अंत तक पता नहीं चलता।
  • CURE रोबोट: कहानी लिखता है, लेकिन एक क्लब के बाउंसर की तरह व्यवहार करता है।
    • यह अपने "गोल्ड स्टिकर" वाले तथ्यों (लंदन में पैदा हुए) को देखता है और उन्हें अंतिम कहानी में जाने देता है।
    • यह अपने "येलो स्टिकर" वाले तथ्यों (मृत्यु की सटीक तारीख) को देखता है और कहता है, "मैं इस बारे में पर्याप्त निश्चित नहीं हूँ," और इसे बाहर छोड़ देता है
    • परिणाम: अंतिम कहानी छोटी होती है, लेकिन इसमें मौजूद सब कुछ अत्यधिक विश्वसनीय है। रोबोट स्वीकार करता है, "मुझे बाकी चीज़ों के बारे में नहीं पता," बजाय इसके कि वह मनगढ़ंत बातें बनाए।

यह क्यों मायने रखता है

शोध पत्र दिखाता है कि रोबोट को यह सीखने के लिए कि वह क्या नहीं जानता, सिखाने से वह वास्तव में अधिक स्मार्ट और सच्चा बन जाता है।

  • सटीकता: यह अधिक तथ्य सही प्राप्त करता है क्योंकि यह आत्मविश्वास के साथ अनुमान लगाना बंद कर देता है।
  • विश्वास: आप कॉन्फिडेंस स्टिकर को देख सकते हैं और जान सकते हैं कि कहानी के किन हिस्सों पर भरोसा करना है और किन हिस्सों को दोबारा जांचना है।
  • सुरक्षा: लंबी कहानियों (जैसे चिकित्सा सलाह या समाचार) में, यह रोबोट को आत्मविश्वास के साथ खतरनाक गलत सूचना फैलाने से रोकता है।

संक्षेप में: CURE उस रोबोट को जो आत्मविश्वास से झूठ बोलता है, एक ऐसे रोबोट में बदल देता है जो सावधानी से अपना काम चेक करता है, यह स्वीकार करता है कि वह अनिश्चित है, और केवल वही आपको बताता है जिसे वह तथ्य के रूप में जानता है। यह एक आत्मविश्वासी सेल्समैन और एक सतर्क लाइब्रेरियन के बीच का अंतर है जो केवल वही किताबें आपको देता है जिन्हें उसने सत्यापित किया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →