← नवीनतम पेपर
💬 NLP

TRACE: Trajectory Correction from Cross-layer Evidence for Hallucination Reduction

TRACE एक नियत (deterministic), प्रशिक्षण-मुक्त इन्फरेंस-टाइम एल्गोरिदम है जो प्रत्येक इनपुट के आंतरिक क्रॉस-लेयर कैंडिडेट ट्रेजेक्टरी के आधार पर इष्टतम लेयर और सुधार ऑपरेटर (जैसे कि स्केलर रिवर्सल या अर्लीअर-स्टेट रिकवरी) को गतिशील रूप से चुनकर लार्ज लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम करता है, जिससे बिना किसी बाहरी डेटा या फाइन-ट्यूनिंग के 15 मॉडल्स में महत्वपूर्ण सटीकता लाभ प्राप्त होता है।

मूल लेखक: Tej Sanibh Ranade

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tej Sanibh Ranade

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, बहु-मंजिला फैक्ट्री के रूप में करें जहाँ एक उत्पाद (एक उत्तर) को परत दर परत असेंबल किया जाता है। सबसे नीचे, कच्चे माल का प्रवेश होता है। जैसे-जैसे वे मंजिलों (परतों) के माध्यम से ऊपर जाते हैं, उन्हें प्रोसेस, रिफाइन और पैकेज किया जाता है। अंत में, सबसे ऊपरी मंजिल पर, तैयार उत्पाद को शिप कर दिया जाता है।

समस्या, जैसा कि पेपर में बताया गया है, यह है कि कभी-कभी फैक्ट्री शिपिंग डॉक पर ही गलती कर देती है। ऊपरी मंजिल के कर्मचारी भ्रमित, विचलित या दबाव में हो सकते हैं, और वे एक "हैलुसिनेशन" (एक आत्मविश्वासी लेकिन गलत उत्तर) शिप कर देते हैं, भले ही नीचे की मंजिलों पर सच्चाई स्पष्ट और सही दिखाई दे रही थी।

इसे ठीक करने के पिछले प्रयास हर समस्या के लिए एक ही, कठोर उपकरण का उपयोग करने जैसे थे:

  • "स्टीयरिंग व्हील" दृष्टिकोण: फैक्ट्री को एक निश्चित नियम के आधार पर बाएँ या दाएँ मुड़ने के लिए मजबूर करना।
  • "बाहरी सलाहकार" दृष्टिकोण: काम की जाँच करने के लिए बाहरी विशेषज्ञों (रिट्रीवल सिस्टम) को लाना।
  • "तुलना और कंट्रास्ट" दृष्टिकोण: बस ऊपरी मंजिल को देखना और कहना, "यह सही नहीं लग रहा है, चलिए नीचे वाली मंजिल को देखते हैं।"

पेपर का तर्क है कि ये तरीके बहुत कठोर हैं। कभी-कभी सच्चाई बीच में कहीं छिपी होती है; कभी-कभी यह शुरुआत में होती है; कभी-कभी फैक्ट्री तीन अलग-अलग गलत विचारों के बीच एक लड़ाई लड़ रही होती है, न कि केवल दो के बीच। एक अकेला उपकरण इन सभी विभिन्न परिदृश्यों को ठीक नहीं कर सकता।

समाधान: TRACE (स्मार्ट फैक्ट्री इंस्पेक्टर)

लेखक TRACE पेश करते हैं, जो एक स्मार्ट, एडेप्टिव इंस्पेक्टर की तरह काम करता है जो फैक्ट्री के माध्यम से उत्पाद बनने के दौरान ही घूमता है। एक निश्चित नियम का उपयोग करने के बजाय, TRACE एक उत्तर के "सफर" को देखता है जब वह नीचे की मंजिल से ऊपर की मंजिल तक जाता है।

यहाँ बताया गया है कि TRACE कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "जर्नी मैप" (क्रॉस-लेयर कैंडिडेट ट्रेजेक्टरी)

जैसे ही फैक्ट्री एक प्रश्न को प्रोसेस करती है, TRACE केवल अंतिम उत्तर को नहीं देखता। यह हर संभावित उत्तर के लिए एक "जर्नी मैप" बनाता है। यह पूछता है: "क्या फैक्ट्री ने नीचे की मंजिल पर सच्चाई को प्राथमिकता दी? क्या वह बीच में डगमगाई? क्या वह ऊपर की मंजिल पर अचानक झूठ की ओर बदल गई?"

2. दो प्रकार की समस्याएँ, दो प्रकार के समाधान

TRACE जर्नी मैप का विश्लेषण करता है कि फैक्ट्री को किस तरह की परेशानी हो रही है, और फिर सही उपकरण चुनता है:

  • परिदृश्य A: "एक ही ढर्रे की सोच" की समस्या (स्केलर रेजीम)

    • स्थिति: फैक्ट्री मूल रूप से दो विकल्पों के बीच एक लड़ाई लड़ रही है: सत्य बनाम झूठ। पूरी फैक्ट्री यात्रा के अधिकांश भाग में सत्य पर सहमत होती है, लेकिन ऊपरी मंजिल भ्रमित हो जाती है और झूठ का स्विच चालू कर देती है।
    • समाधान: TRACE एक वॉल्यूम नॉब (आवाज़ नियंत्रित करने वाला बटन) की तरह काम करता है। यह बस "सत्य" के सिग्नल की आवाज़ बढ़ाता है और "झूठ" के सिग्नल की आवाज़ कम कर देता है। यह एक सरल, एक-दिशीय सुधार है।
    • उप-विविधता: यदि ऊपरी मंजिल इतनी भ्रमित है कि वॉल्यूम नॉब काम नहीं करेगा, तो TRACE एक टाइम मशीन की तरह काम करता है। यह कहता है, "ऊपरी मंजिल खराब है; आइए उत्पाद को ठीक वैसे ही शिप करें जैसा वह पहली मंजिल से निकलते समय था, क्योंकि वह सबसे ईमानदार संस्करण था।"
  • परिसीय B: "बीच में अराजकता" की समस्या (मल्टी-डायरेक्शनल रेजीम)

    • स्थिति: फैक्ट्री अस्त-व्यस्त है। तीन या चार अलग-अलग गलत विचार आपस में लड़ रहे हैं, और सच्चाई एक विशिष्ट मध्य मंजिल में छिपी हुई है, लेकिन ऊपरी मंजिल गलत विजेता चुन लेती है। एक साधारण "वॉल्यूम नॉब" इसे ठीक नहीं कर सकता क्योंकि समस्या बहुत जटिल है।
    • समाधान: TRACE एक स्पॉटलाइट की तरह काम करता है। यह जर्नी मैप को स्कैन करता है, उस विशिष्ट मंजिल को ढूंढता है जहाँ "सत्य" का उम्मीदवार सबसे मजबूत और स्पष्ट था (डेसिसिव लेयर), और कहता है, "ऊपरी मंजिल को अनदेखा करें। उत्पाद को ठीक वैसे ही शिप करें जैसा वह उस विशिष्ट मंजिल पर दिखता था।"

3. "फैक्ट्री ब्लूप्रिंट" (मॉडल इनवेरिएंट)

यह जानने के लिए कि "एक ही ढर्रे की सोच" वाली समस्या के लिए कौन सा उपकरण उपयोग करना है, TRACE शुरू करने से पहले एक बार फैक्ट्री का ब्लूप्रिंट (मॉडल के वेट्स) पढ़ता है।

  • यदि ब्लूप्रिंट दिखाता है कि ऊपरी मंजिल आमतौर पर विश्वसनीय है, तो TRACE वॉल्यूम नॉब का उपयोग करता है।
  • यदि ब्लूप्रिंट दिखाता है कि ऊपरी मंजिल अक्सर सच्चाई से भटक जाती है, तो TRACE शुरुआत में वापस जाने के लिए टाइम मशीन का उपयोग करता है।

यह क्यों मायने रखता है (परिणाम)

पेपर ने इस "स्मार्ट इंस्पेक्टर" का परीक्षण 15 अलग-अलग AI मॉडल्स (छोटे से लेकर बहुत बड़े तक) पर 3 अलग-अलग फैक्ट-चेकिंग टेस्ट के माध्यम से किया।

  • कोई ट्रेनिंग आवश्यक नहीं: TRACE को AI को फिर से सिखाने की आवश्यकता नहीं है। यह उत्तर जनरेशन के दौरान तुरंत काम करता है।
  • कोई बाहरी डेटा नहीं: इसे उत्तरों के लिए इंटरनेट खोजने की आवश्यकता नहीं है। यह AI की अपनी आंतरिक मेमोरी का उपयोग करता है।
  • सार्वभौमिक सफलता: इसने परीक्षण किए गए प्रत्येक मॉडल की सटीकता में सुधार किया। ऐसे शून्य मामले थे जहाँ इसने चीजों को बदतर बनाया।
  • बड़ी बढ़त: औसतन, इसने तथ्यात्मक सटीकता में लगभग 12 अंक की वृद्धि की (इस क्षेत्र में एक बड़ी छलांग), जबकि कुछ मॉडल्स में लगभग 47 अंक तक का सुधार देखा गया।

कमी (सीमाएं)

पेपर इसके ट्रेड-ऑफ के बारे में ईमानदार है:

  • गति: क्योंकि TRACE को जर्नी मैप बनाने के लिए फैक्ट्री की हर मंजिल को देखना पड़ता है, इसलिए इसे एक मानक AI की तुलना में उत्तर जनरेट करने में लगभग 2 से 3 गुना अधिक समय लगता है।
  • दायरा: यह वर्तमान में छोटे, बहुविकल्पीय शैली के प्रश्नों (जैसे, "क्या X सत्य है या असत्य?") पर सबसे अच्छा काम करता है। इसका परीक्षण अभी लंबी कहानियाँ लिखने या जटिल चिकित्सा सलाह देने जैसे कार्यों पर नहीं किया गया है।

सारांश

TRACE को एक जासूस के रूप में समझें जो न केवल अपराध स्थल (अंतिम उत्तर) को देखता है, बल्कि घटनाओं की पूरी टाइमलाइन की भी जांच करता है। यह पता लगाता है कि गलती कहाँ हुई और इसे कैसे ठीक किया जाए, एक साधारण चूक बनाम एक जटिल गड़बड़ी के लिए अलग-अलग रणनीति का उपयोग करते हुए। यह साबित करता है कि AI के अंदर गहराई में सच्चाई पहले से ही मौजूद है; इसे बस सही समय पर अपने ही दिमाग के सही हिस्से को सुनने के एक स्मार्ट तरीके की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →