CTRL-RAG: Contrastive Likelihood Reward Based Reinforcement Learning for Context-Faithful RAG Models
यह शोधपत्र CTRL-RAG का प्रस्ताव करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो सहायक साक्ष्य के साथ और साक्ष्य के बिना प्रतिक्रियाओं के लॉग-लाइक्लीहुड अंतराल (log-likelihood gap) को अनुकूलित करने के लिए एक कंट्रास्टिव लाइकलीहुड रिवॉर्ड (Contrastive Likelihood Reward) का उपयोग करता है, जिससे रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) मॉडलों में संदर्भ निष्ठा (context faithfulness) में वृद्धि होती है और मतिभ्रम (hallucinations) को कम किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत कठिन परीक्षा दे रहे एक छात्र हैं। आपके पास एक पाठ्यपुस्तक (Retrieved Documents) है और आपकी अपनी याददाश्त (Model's Internal Knowledge) है।
अतीत में, जब AI को इन पाठ्यपुस्तकों का उपयोग करने के लिए प्रशिक्षित किया जाता था, तो शिक्षकों (Reward Systems) को दो मुख्य समस्याओं का सामना करना पड़ता था:
- बाहरी निर्णायक दोषपूर्ण था: कभी-कभी शिक्षक केवल यह देखते थे कि उत्तर सही दिख रहा है या छात्र ने पुस्तक का सही उल्लेख किया है या नहीं। लेकिन एक छात्र बिना किताब पढ़े ही सही उत्तर का अनुमान लगा सकता था या उद्धरण (citation) की नकल कर सकता था।
- स्व-मूल्यांकन खतरनाक था: यदि हम छात्र को खुद ग्रेड देने दें, तो वे अति-आत्मविश्वासी हो सकते हैं और मनगढ़ंत बातें (hallucinations) बनाना शुरू कर सकते हैं क्योंकि उन्हें कोई बताने वाला नहीं होगा कि वे गलत हैं।
CTRL-RAG इन AI छात्रों को प्रशिक्षित करने का एक नया, चतुर तरीका है। यह एक "कॉन्ट्रास्टिव लाइकलीहुड रिवॉर्ड" (CLR) पेश करता है, जो एक सुपर-इंटेलिजेंट स्टडी कोच की तरह काम करता है। यह कैसे काम करता है, यहाँ सरल उपमाओं में दिया गया है:
1. "क्या-होता-अगर" का खेल (मुख्य विचार)
कोच केवल अंतिम उत्तर को नहीं देखता है। इसके बजाय, वह छात्र के मस्तिष्क के साथ एक "क्या-होता-अगर" (What-If) खेल खेलता है।
- परिदृश्य A: छात्र पाठ्यपुस्तक खुली रखकर एक प्रश्न का उत्तर देता है।
- परिदृश्य B: कोच पूछता है, "क्या होगा अगर हम पाठ्यपुस्तक का सबसे महत्वपूर्ण पन्ना हटा दें? अब आप कितने आश्वस्त होंगे?"
CLR इन दोनों परिदृश्यों के बीच के अंतर (gap) को मापता है।
- यदि किताब हटा दिए जाने पर छात्र का आत्मविश्वास तेजी से गिर जाता है, तो इसका मतलब है कि वे वास्तव में किताब पर निर्भर थे। बहुत अच्छा काम! (उच्च रिवॉर्ड)।
- यदि किताब के बिना भी छात्र का आत्मविश्वास समान रहता है, तो इसका मतलब है कि वे केवल अपनी याददाश्त से अनुमान लगा रहे थे या मनगढ़ंत बातें बना रहे थे। बुरा काम! (कम या कोई रिवॉर्ड नहीं)।
2. "नॉइज़ फ़िल्टर" (खराब किताबों को संभालना)
कल्पना कीजिए कि पाठ्यपुस्तक 30 पन्नों का एक अस्त-व्यस्त ढेर है, लेकिन केवल 2 पन्नों में ही उत्तर है। बाकी 28 पन्ने केवल शोर (noise) या अप्रासंगिक तथ्य हैं।
पुराने तरीके इस शोर से भ्रमित हो सकते थे। CTRL-RAG एक मेटल डिटेक्टर की तरह है। यह विशेष रूप से मॉडल को "सिग्नल" (सही 2 पन्ने) खोजने और "शोर" (बाकी 28 पन्ने) को अनदेखा करने के लिए पुरस्कृत करता है। यह मॉडल को सिखाता है: "सिर्फ बात मत करो; विशेष रूप से उस बारे में बात करो जो तुमने किताब में पाया है।"
3. "ट्रुथ गेट" (गलत लेकिन 'वफादार' उत्तरों से बचना)
एक पेचीदा स्थिति होती है: क्या होगा यदि पाठ्यपुस्तक में ही कोई झूठ हो?
- पुरानी समस्या: यदि मॉडल आँख बंद करके किताब का पालन करता है, तो वह एक "फिदेल" (faithful) उत्तर दे सकता है जो तथ्यात्मक रूप से गलत हो (जैसे, "किताब कहती है कि आकाश हरा है, इसलिए मैं कहता हूँ कि आकाश हरा है")।
- CTRL-RAG समाधान: यह सिस्टम एक हाइब्रिड रिवॉर्ड का उपयोग करता है। यह "बुक रिलायंस स्कोर" (CLR) को "करेक्टनेस स्कोर" के साथ जोड़ता है।
- इसे एक क्लब के बाउंसर की तरह समझें। भले ही आपके पास टिकट हो (आपने किताब का उपयोग किया है), यदि आपने गलत कपड़े पहने हैं (उत्तर तथ्यात्मक रूप से गलत है), तो आप अंदर नहीं जा सकते। मॉडल को तभी पुरस्कृत किया जाता है जब वह किताब का उपयोग और तथ्यों को सही रखता है।
4. "लंबाई दंड" (बड़बड़ाने से रोकना)
AI मॉडल बहुत अधिक बातें करना पसंद करते हैं। यदि रिवॉर्ड केवल यह होता कि "आपने किताब का कितना उपयोग किया?", तो मॉडल उच्च स्कोर पाने के लिए पूरी किताब को कॉपी-पेस्ट कर सकता था।
CTRL-RAG लंबाई के लिए एक सूक्ष्म दंड (शब्द गणना पर टैक्स की तरह) जोड़ता है। यह मॉडल को संक्षिप्त होने के लिए प्रोत्साहित करता है। यह कहता है, "आपको किताब का उपयोग करने के लिए अंक मिलते हैं, लेकिन यदि आप एक ही वाक्य को पांच बार दोहराते हैं, तो आपके अंक कट जाएंगे।" यह मॉडल को कुशल बनने और सीधे मुद्दे पर आने के लिए मजबूर करता है।
यह एक बड़ी बात क्यों है?
- कोई "नकली उद्धरण" नहीं: यह AI को स्रोत का उपयोग करने का नाटक करने से रोकता है।
- बेहतर तर्क: यह AI को साक्ष्यों के माध्यम से वास्तव में सोचने के लिए मजबूर करता है, न कि केवल अनुमान लगाने के लिए।
- हर जगह काम करता है: पेपर दिखाता है कि यह तब भी काम करता है जब AI छोटा या बहुत बड़ा हो, और चाहे वह सरल प्रश्न हो या जटिल, बहु-चरणीय पहेलियाँ।
सारांश में:
CTRL-RAG एक सख्त लेकिन निष्पक्ष कोच की तरह है जो AI को सिखाता है: "अपनी याददाश्त से केवल अनुमान मत लगाओ। किताब को अंधाधुंध कॉपी भी मत करो। किताब पढ़ो, विशिष्ट सत्य को खोजो, और मुझे एक संक्षिप्त, सटीक उत्तर दो। यदि तुम ऐसा करते हो, तो तुम्हें गोल्ड स्टार मिलेगा।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।