← नवीनतम पेपर
💬 NLP

Towards Transparent RAG: Fostering Evidence Traceability in LLM Generation via Reinforcement Learning

यह शोध पत्र TRACE को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो बड़े भाषा मॉडलों (Large Language Models) को स्पष्ट उद्धरणों के साथ संरचित, साक्ष्य-आधारित आउटपुट उत्पन्न करने के लिए निर्देशित करके रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) की पारदर्शिता और सटीकता को बढ़ाता है, जिससे उन्नत वाणिज्यिक मॉडलों के तुलनीय प्रदर्शन प्राप्त होता है।

मूल लेखक: Jingyi Ren, Yekun Xu, Xiaolong Wang, Weitao Li, Ante Wang, Weizhi Ma, Yang Liu

प्रकाशित 2026-01-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jingyi Ren, Yekun Xu, Xiaolong Wang, Weitao Li, Ante Wang, Weizhi Ma, Yang Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत कठिन इतिहास की परीक्षा दे रहे एक छात्र हैं। आपको अपने साथ पाठ्यपुस्तकों का एक ढेर (जिसे "रिट्रीव्ड डॉक्यूमेंट्स" कहा जाता है) परीक्षा कक्ष में ले जाने की अनुमति है, लेकिन शिक्षक (AI) की एक बुरी आदत है: वह अक्सर ऐसे उत्तर लिखता है जो सुनने में तो आत्मविश्वास से भरे लगते हैं लेकिन वास्तव में मनगढ़ंत होते हैं, या वह दावे का समर्थन करने के लिए किताब का गलत पृष्ठ उपयोग करता है।

यही वर्तमान रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम की समस्या है। उनके पास तथ्य तो होते हैं, लेकिन वे हमेशा अपना काम (प्रमाण) नहीं दिखाते। वे आपको सही उत्तर दे सकते हैं, लेकिन आप यह नहीं जान सकते कि उन्होंने किताब के किस हिस्से का उपयोग किया, या क्या उन्होंने केवल उस आधार पर अनुमान लगाया जो उन्हें अपनी "ट्रेनिंग" से याद रहा।

यह शोध पत्र TRACE (ट्रांसपेरेंट RAG विद एविडेंस ट्रेसिंग) नामक एक नई प्रणाली पेश करता है। TRACE को एक सख्त शिक्षक के रूप में समझें जो छात्र को अच्छा ग्रेड पाने के लिए एक विशिष्ट, पारदर्शी प्रक्रिया का पालन करने के लिए मजबूर करता है।

TRACE कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. "अपना काम दिखाओ" नियम (स्ट्रक्चर्ड प्रोटोकॉल)

एक सामान्य परीक्षा में, एक छात्र एक पैराग्राफ लिख सकता है जिसमें उसके विचार, उसके द्वारा खोजे गए तथ्य और अंतिम उत्तर सब आपस में मिले हुए होते हैं। यह अव्यवस्थित होता है और इसकी जाँच करना कठिन होता है।

TRACE AI को तीन अलग-अलग, लेबल वाले बॉक्स में अपना उत्तर लिखने के लिए मजबूर करता है, जैसे कि कोई फॉर्म हो:

  • बॉक्स 1 (साक्ष्य/एविडेंस): "यहाँ वे विशिष्ट पृष्ठ संख्याएँ हैं जिनका मैं उपयोग कर रहा हूँ।" (AI को उत्तर लिखना शुरू करने से पहले सही दस्तावेज़ चुनने चाहिए)।
  • बॉक्स 2 (तर्क/रीजनिंग): "यहाँ बताया गया है कि मैंने उत्तर खोजने के लिए उन पृष्ठों को कैसे जोड़ा।"
  • बॉक्स 3 (उत्तर): "यहाँ अंतिम परिणाम है।"

यह AI को अपनी गलतियाँ छिपाने से रोकता है। यदि वह गलत पृष्ठ चुनता है, तो आप इसे तुरंत देख सकते हैं।

2. "गोल्ड स्टार" सिस्टम (एडाप्टिव रिवार्ड्स)

AI को इन नियमों का पालन करना सिखाने के लिए, शोधकर्ताओं ने रीइन्फोर्समेंट लर्निंग नामक एक तकनीक का उपयोग किया। कल्पना कीजिए कि यह एक वीडियो गेम है जहाँ AI को सही काम करने के लिए अंक मिलते हैं।

आमतौर पर, AI को केवल अंतिम उत्तर सही होने पर अंक मिलते हैं। TRACE इस स्कोरिंग सिस्टम को बदल देता है:

  • फॉर्मेट पॉइंट्स: क्या आपने तीनों बॉक्स का सही ढंग से उपयोग किया?
  • सटीकता (एक्यूरेसी) पॉइंट्स: क्या अंतिम उत्तर सही है?
  • प्रासंगिकता (रेलेवेंस) पॉइंट्स: क्या आपने अपने उत्तर का समर्थन करने के लिए बिल्कुल सही पृष्ठ चुने?
  • "गोल्ड स्टार" बोनस: यही असली जादू है। AI को भारी "गोल्ड स्टार" बोनस तभी मिलता है जब वह सब कुछ पूरी तरह से सही करता है: फॉर्मेट, उत्तर, और साक्ष्य का चयन।

यह "गोल्ड स्टार" एक शक्तिशाली चुंबक की तरह काम करता है। यह AI को शॉर्टकट लेने से रोकता है। वह केवल उत्तर का अनुमान लगाकर और सफल होने की उम्मीद करके काम नहीं चला सकता; उसे बड़ा इनाम पाने के लिए हर चरण में पूर्ण होना होगा।

3. "स्टेडी हैंड" (स्थिर प्रशिक्षण)

AI को इतने सख्त नियमों का पालन करना सिखाना एक रस्सी पर संतुलन बनाते हुए करतब दिखाने वाले (tightrope walker) को सिखाने जैसा है। यदि निर्देश बहुत सख्त हैं, तो AI भ्रमित हो जाएगा और "रस्सी" से गिर जाएगा (प्रशिक्षण अस्थिर हो जाएगा)।

शोधकर्ताओं ने पाया कि AI को सिखाने के लिए इस्तेमाल किया जाने वाला मानक गणित (जिसे "KL एस्टीमेटर" कहा जाता है) इस रस्सी पर बहुत डगमगाता था। इसके कारण AI अनियially झूल जाता था और जो कुछ भी उसने सीखा था उसे भूल जाता था।

शोधकर्ताओं ने इस डगमगाते गणित को एक अधिक स्थिर, "अनबायस्ड" (निष्पक्ष) संस्करण से बदल दिया। इसे एक रस्सी पर चलने वाले को बेहतर संतुलन पोल देने के रूप में समझें। यह प्रशिक्षण को सुचारू रखता है और यह सुनिश्चित करता है कि AI बिना क्रैश हुए वास्तव में सख्त नियमों को सीखे।

परिणाम: क्या हुआ?

शोधकर्ताओं ने कठिन "मल्टी-हॉप" प्रश्नों (ऐसे प्रश्न जिनमें विभिन्न सूचनाओं के बीच संबंध जोड़ने की आवश्यकता होती है) पर TRACE का परीक्षण किया।

  • बेहतर उत्तर: AI ने पिछले तरीकों की तुलना में काफी अधिक प्रश्नों को सही हल किया (10-30% सुधार)।
  • पारदर्शिता: इसने तथ्य बनाना बंद कर दिया। इसने लगातार सटीक दस्तावेज़ों की ओर इशारा किया।
  • प्रतिस्पर्धा: TRACE के साथ प्रशिक्षित एक छोटा, ओपन-सोर्स AI, विशाल और महंगे कमर्शियल मॉडल्स (जैसे OpenAI का o1 या DeepSeek-R1) के लगभग बराबर प्रदर्शन करता है।

मुख्य निष्कर्ष

TRACE यह सिद्ध करता है कि यदि आप AI को पारदर्शी होने के लिए मजबूर करते हैं—यानी उत्तर देने से पहले उसे अपने साक्ष्य दिखाने के लिए मजबूर करते हैं, और ऐसा पूरी तरह से करने के लिए उसे भारी इनाम देते हैं—तो आप न केवल एक अधिक ईमानदार AI प्राप्त करते हैं, बल्कि एक अधिक स्मार्ट AI भी प्राप्त करते हैं। यह AI को अनुमान लगाने वाले "ब्लैक बॉक्स" से बदलकर एक पारदर्शी विचारक में बदल देता है जो अपने स्वयं के तर्क को सत्यापित करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →