← नवीनतम पेपर
💻 computer science

CTRL-RAG: Contrastive Likelihood Reward Based Reinforcement Learning for Context-Faithful RAG Models

यह शोधपत्र CTRL-RAG का प्रस्ताव करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो सहायक साक्ष्य के साथ और साक्ष्य के बिना प्रतिक्रियाओं के लॉग-लाइक्लीहुड अंतराल (log-likelihood gap) को अनुकूलित करने के लिए एक कंट्रास्टिव लाइकलीहुड रिवॉर्ड (Contrastive Likelihood Reward) का उपयोग करता है, जिससे रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) मॉडलों में संदर्भ निष्ठा (context faithfulness) में वृद्धि होती है और मतिभ्रम (hallucinations) को कम किया जाता है।

मूल लेखक: Zhehao Tan, Yihan Jiao, Dan Yang, Junjie Wang, Duolin Sun, Jie Feng, Xidong Wang, Lei Liu, Yue Shen, Jian Wang, Jinjie Gu

प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhehao Tan, Yihan Jiao, Dan Yang, Junjie Wang, Duolin Sun, Jie Feng, Xidong Wang, Lei Liu, Yue Shen, Jian Wang, Jinjie Gu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत कठिन परीक्षा दे रहे एक छात्र हैं। आपके पास एक पाठ्यपुस्तक (Retrieved Documents) है और आपकी अपनी याददाश्त (Model's Internal Knowledge) है।

अतीत में, जब AI को इन पाठ्यपुस्तकों का उपयोग करने के लिए प्रशिक्षित किया जाता था, तो शिक्षकों (Reward Systems) को दो मुख्य समस्याओं का सामना करना पड़ता था:

  1. बाहरी निर्णायक दोषपूर्ण था: कभी-कभी शिक्षक केवल यह देखते थे कि उत्तर सही दिख रहा है या छात्र ने पुस्तक का सही उल्लेख किया है या नहीं। लेकिन एक छात्र बिना किताब पढ़े ही सही उत्तर का अनुमान लगा सकता था या उद्धरण (citation) की नकल कर सकता था।
  2. स्व-मूल्यांकन खतरनाक था: यदि हम छात्र को खुद ग्रेड देने दें, तो वे अति-आत्मविश्वासी हो सकते हैं और मनगढ़ंत बातें (hallucinations) बनाना शुरू कर सकते हैं क्योंकि उन्हें कोई बताने वाला नहीं होगा कि वे गलत हैं।

CTRL-RAG इन AI छात्रों को प्रशिक्षित करने का एक नया, चतुर तरीका है। यह एक "कॉन्ट्रास्टिव लाइकलीहुड रिवॉर्ड" (CLR) पेश करता है, जो एक सुपर-इंटेलिजेंट स्टडी कोच की तरह काम करता है। यह कैसे काम करता है, यहाँ सरल उपमाओं में दिया गया है:

1. "क्या-होता-अगर" का खेल (मुख्य विचार)

कोच केवल अंतिम उत्तर को नहीं देखता है। इसके बजाय, वह छात्र के मस्तिष्क के साथ एक "क्या-होता-अगर" (What-If) खेल खेलता है।

  • परिदृश्य A: छात्र पाठ्यपुस्तक खुली रखकर एक प्रश्न का उत्तर देता है।
  • परिदृश्य B: कोच पूछता है, "क्या होगा अगर हम पाठ्यपुस्तक का सबसे महत्वपूर्ण पन्ना हटा दें? अब आप कितने आश्वस्त होंगे?"

CLR इन दोनों परिदृश्यों के बीच के अंतर (gap) को मापता है।

  • यदि किताब हटा दिए जाने पर छात्र का आत्मविश्वास तेजी से गिर जाता है, तो इसका मतलब है कि वे वास्तव में किताब पर निर्भर थे। बहुत अच्छा काम! (उच्च रिवॉर्ड)।
  • यदि किताब के बिना भी छात्र का आत्मविश्वास समान रहता है, तो इसका मतलब है कि वे केवल अपनी याददाश्त से अनुमान लगा रहे थे या मनगढ़ंत बातें बना रहे थे। बुरा काम! (कम या कोई रिवॉर्ड नहीं)।

2. "नॉइज़ फ़िल्टर" (खराब किताबों को संभालना)

कल्पना कीजिए कि पाठ्यपुस्तक 30 पन्नों का एक अस्त-व्यस्त ढेर है, लेकिन केवल 2 पन्नों में ही उत्तर है। बाकी 28 पन्ने केवल शोर (noise) या अप्रासंगिक तथ्य हैं।

पुराने तरीके इस शोर से भ्रमित हो सकते थे। CTRL-RAG एक मेटल डिटेक्टर की तरह है। यह विशेष रूप से मॉडल को "सिग्नल" (सही 2 पन्ने) खोजने और "शोर" (बाकी 28 पन्ने) को अनदेखा करने के लिए पुरस्कृत करता है। यह मॉडल को सिखाता है: "सिर्फ बात मत करो; विशेष रूप से उस बारे में बात करो जो तुमने किताब में पाया है।"

3. "ट्रुथ गेट" (गलत लेकिन 'वफादार' उत्तरों से बचना)

एक पेचीदा स्थिति होती है: क्या होगा यदि पाठ्यपुस्तक में ही कोई झूठ हो?

  • पुरानी समस्या: यदि मॉडल आँख बंद करके किताब का पालन करता है, तो वह एक "फिदेल" (faithful) उत्तर दे सकता है जो तथ्यात्मक रूप से गलत हो (जैसे, "किताब कहती है कि आकाश हरा है, इसलिए मैं कहता हूँ कि आकाश हरा है")।
  • CTRL-RAG समाधान: यह सिस्टम एक हाइब्रिड रिवॉर्ड का उपयोग करता है। यह "बुक रिलायंस स्कोर" (CLR) को "करेक्टनेस स्कोर" के साथ जोड़ता है।
    • इसे एक क्लब के बाउंसर की तरह समझें। भले ही आपके पास टिकट हो (आपने किताब का उपयोग किया है), यदि आपने गलत कपड़े पहने हैं (उत्तर तथ्यात्मक रूप से गलत है), तो आप अंदर नहीं जा सकते। मॉडल को तभी पुरस्कृत किया जाता है जब वह किताब का उपयोग और तथ्यों को सही रखता है।

4. "लंबाई दंड" (बड़बड़ाने से रोकना)

AI मॉडल बहुत अधिक बातें करना पसंद करते हैं। यदि रिवॉर्ड केवल यह होता कि "आपने किताब का कितना उपयोग किया?", तो मॉडल उच्च स्कोर पाने के लिए पूरी किताब को कॉपी-पेस्ट कर सकता था।

CTRL-RAG लंबाई के लिए एक सूक्ष्म दंड (शब्द गणना पर टैक्स की तरह) जोड़ता है। यह मॉडल को संक्षिप्त होने के लिए प्रोत्साहित करता है। यह कहता है, "आपको किताब का उपयोग करने के लिए अंक मिलते हैं, लेकिन यदि आप एक ही वाक्य को पांच बार दोहराते हैं, तो आपके अंक कट जाएंगे।" यह मॉडल को कुशल बनने और सीधे मुद्दे पर आने के लिए मजबूर करता है।

यह एक बड़ी बात क्यों है?

  • कोई "नकली उद्धरण" नहीं: यह AI को स्रोत का उपयोग करने का नाटक करने से रोकता है।
  • बेहतर तर्क: यह AI को साक्ष्यों के माध्यम से वास्तव में सोचने के लिए मजबूर करता है, न कि केवल अनुमान लगाने के लिए।
  • हर जगह काम करता है: पेपर दिखाता है कि यह तब भी काम करता है जब AI छोटा या बहुत बड़ा हो, और चाहे वह सरल प्रश्न हो या जटिल, बहु-चरणीय पहेलियाँ।

सारांश में:
CTRL-RAG एक सख्त लेकिन निष्पक्ष कोच की तरह है जो AI को सिखाता है: "अपनी याददाश्त से केवल अनुमान मत लगाओ। किताब को अंधाधुंध कॉपी भी मत करो। किताब पढ़ो, विशिष्ट सत्य को खोजो, और मुझे एक संक्षिप्त, सटीक उत्तर दो। यदि तुम ऐसा करते हो, तो तुम्हें गोल्ड स्टार मिलेगा।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →