← नवीनतम पेपर
💬 NLP

Reinforced Informativeness Optimization for Long-Form Retrieval-Augmented Generation

यह शोध पत्र RioRAG प्रस्तुत करता है, जो एक ऐसा ढांचा है जो सूचनात्मकता (informativeness) को एक सत्यापन योग्य उद्देश्य के रूप में परिभाषित करके और हस्तनिर्मित पर्यवेक्षण या सुदृढ़ शिक्षक मॉडलों पर निर्भर हुए बिना सुदृढीकरण लर्निंग (reinforcement learning) के लिए स्थिर, सघन पुरस्कार प्रदान करने हेतु नगेट-केंद्रित (nugget-centric), क्रॉस-सोर्स सत्यापन का उपयोग करके दीर्घ-रूप रिट्रीवल-ऑगमेंटेड जनरेशन (long-form retrieval-augmented generation) को उन्नत करता है।

मूल लेखक: Yuhao Wang, Ruiyang Ren, Yucheng Wang, Wayne Xin Zhao, Jing Liu, Hua Wu, Haifeng Wang

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhao Wang, Ruiyang Ren, Yucheng Wang, Wayne Xin Zhao, Jing Liu, Hua Wu, Haifeng Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन कभी-कभी अति-आत्मविश्वासी लाइब्रेरियन (एक AI) से किसी जटिल विषय पर, जैसे कि "क्वांटम टनलिंग कैसे काम करती है?" पर एक लंबा और विस्तृत रिपोर्ट लिखने के लिए कह रहे हैं।

वह लाइब्रेरियन केवल अनुमान नहीं लगाता; वह लाइब्रेरी के संग्रहों में जाता है, दस अलग-अलग किताबें निकालता है, और जो उसने पाया उसके आधार पर एक आदर्श सारांश लिखने का प्रयास करता है। इसे रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation - RAG) कहा जाता है।

हालाँकि, यह पेपर एक बड़ी समस्या की ओर इशारा करता है: आप लाइब्रेरियन के काम को कैसे ग्रेड (मूल्यांकन) करेंगे?

समस्या: "एक्ज़ैक्ट मैच" का जाल (The "Exact Match" Trap)

संक्षिप्त क्विज़ में (जैसे "2+2 क्या है?"), ग्रेडिंग आसान है: उत्तर या तो "4" है या नहीं है। लेकिन लंबे निबंधों के लिए, कोई एक एकल "सही" उत्तर नहीं होता है।

  • पुराना तरीका: वर्तमान AI सिस्टम इन लंबे निबंधों को ग्रेड करने के लिए अस्पष्ट नियमों का उपयोग करते हैं या किसी अन्य AI से पूछते हैं, "क्या यह अच्छा है?" यह एक थके हुए शिक्षक से एक साथ 50 निबंधों को ग्रेड करने के लिए कहने जैसा है। वे थक जाते हैं, उनके स्कोर अचानक ऊपर-नीचे होते रहते हैं (अस्थिरता), और वे अक्सर मुख्य बिंदु को मिस कर देते हैं। AI भ्रमित फीडबैक प्राप्त करता है और यह नहीं सीख पाता कि कैसे बेहतर बनना है।
  • परिणाम: AI एक बहुत बड़ा, खोखला निबंध लिख सकता है जो सुनने में अच्छा लगता है लेकिन वास्तविक तथ्यों को छोड़ देता है, या यह कल्पना (hallucinate) कर सकता है (चीजें बना सकता है) क्योंकि उसे नहीं पता कि "सत्य" क्या दिखता है।

समाधान: RioRAG (एक "फैक्ट-चेक" सिस्टम)

लेखक RioRAG नामक एक नया सिस्टम प्रस्तावित करते हैं। "क्या यह निबंध अच्छा है?" पूछने के बजाय, वे खेल बदल देते हैं: "क्या आपने हर एक महत्वपूर्ण तथ्य शामिल किया है?"

यहाँ बताया गया है कि RioRAG कैसे काम करता है, एक सरल उपमा (analogy) का उपयोग करते हुए:

1. "नगेट" की खोज (इसे तोड़ना)

कल्पना कीजिए कि लाइब्रेरियन की स्रोत पुस्तकों में सैकड़ों छोटे, सुनहरे तथ्य (नगेट्स) हैं।

  • पुराना तरीका: ग्रेडर पूरे निबंध को पढ़ता है और "7/10" जैसा एक अस्पष्ट स्कोर देता है।
  • RioRAG का तरीका: लाइब्रेरियन के लिखने से पहले, सिस्टम स्रोत पुस्तकों से सभी विशिष्ट, सत्यापन योग्य तथ्यों को निकालता है और उन्हें एक चेकलिस्ट पर रखता है।
    • उदाहरण चेकलिस्ट: "बाधाओं (barriers) को पार करने का उल्लेख करता है," "जोसेफसन जंक्शन (Josephson junctions) का उल्लेख करता है," "STM उपकरणों का उल्लेख करता है।"

2. "फैक्ट-चेक" ग्रेडिंग (सत्यापन योग्य पुरस्कार)

जब लाइब्रेरियन अपना उत्तर लिखता है, तो सिस्टम यह अनुमान नहीं लगाता कि वह "अच्छा" है या नहीं। यह बस चेकलिस्ट की जाँच करता है।

  • क्या आपने बाधाओं का उल्लेख किया? (हाँ/नहीं)
  • क्या आपने जंक्शनों का उल्लेख किया? (हाँ/नहीं)
  • क्या आपने उपकरणों का उल्लेख किया? (हाँ/नहीं)

यदि उत्तर 3 में से 3 आइटमों को कवर करता है, तो इसे पूर्ण स्कोर मिलता है। यदि यह 1 को कवर करता है, तो इसे कम स्कोर मिलता है। यह सत्यापन योग्य (verifiable) है क्योंकि आप ठीक से बता सकते हैं कि वह तथ्य स्रोत पुस्तक से कहाँ से आया है। यह अनुमान को हटा देता है।

3. "लेंथ पेनल्टी" (केवल बड़बड़ाएं नहीं)

कभी-कभी, एक AI गलती से सही तथ्यों तक पहुँचने की संभावना बढ़ाने के लिए 10 पन्नों का निबंध लिखकर धोखाधड़ी करने की कोशिश करता है।

  • RioRAG का एक नियम है: यदि आप बहुत अधिक लिखते हैं बिना कोई नया तथ्य जोड़े, तो आपका स्कोर कम हो जाएगा।
  • यह AI को लंबे और खोखले होने के बजाय संक्षिप्त और सूचनाओं से सघन (dense) होने के लिए प्रोत्साहित करता है।

4. आत्म-सुधार (जिम)

सिस्टम AI को एक ट्रेनिंग लूप के माध्यम से ले जाता है:

  1. AI एक उत्तर लिखने का प्रयास करता है।
  2. सिस्टम इसे "फैक्ट चेकलिस्ट" के विरुद्ध जाँचता है।
  3. AI को स्पष्ट स्कोर (पुरस्कार) मिलता है।
  4. AI फिर से प्रयास करता है, इस स्कोर का उपयोग यह सीखने के लिए करता है कि अगली बार अधिक तथ्यों को कैसे प्राप्त किया जाए।

क्योंकि फीडबैक स्पष्ट है और वास्तविक तथ्यों पर आधारित है (न कि अस्पष्ट राय पर), AI बहुत तेज़ी से और अधिक स्थिरता के साथ सीखता है। इसे कॉपी करने के लिए किसी "सुपर-टीचर" द्वारा आदर्श उत्तर लिखने की आवश्यकता नहीं है; यह स्वयं चेकलिस्ट लक्ष्यों को हिट करने का प्रयास करके सीखता है।

परिणाम

लेखकों ने दो बड़े बेंचमार्क (LongFact और RAGChecker) पर इसका परीक्षण किया। उन्होंने पाया कि:

  • अधिक तथ्य: AI ने स्रोत दस्तावेजों से अधिक वास्तविक तथ्यों को याद रखा और शामिल किया।
  • कम मतिभ्रम (Less Hallucination): AI ने कम फर्जी तथ्य बनाए क्योंकि उसे सख्ती से चेकलिस्ट का पालन करने के लिए पुरस्कृत किया गया था।
  • बेहतर स्थिरता: प्रशिक्षण क्रैश नहीं हुआ या बेकाबू नहीं हुआ क्योंकि स्कोरिंग सिस्टम विश्वसनीय था।

संक्षेप में

RioRAG यह अनुमान लगाने की कोशिश करना बंद कर देता है कि AI का लंबा निबंध "अच्छा" है या नहीं, और इसके बजाय यह जाँचने लगता है कि क्या वह पूर्ण है। एक अस्पष्ट निबंध को एक सरल "क्या आपने इन तथ्यों को चेक किया?" गेम में बदलकर, उन्होंने एक ऐसा सिस्टम बनाया है जो AI को जटिल प्रश्नों के उत्तर देने के लिए अधिक सत्यवादी, अधिक विस्तृत और अधिक विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →