← नवीनतम पेपर
🤖 AI

EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff

EviBack एजेंटिक RAG सिस्टम को बेहतर बनाने के लिए एक साक्ष्य-प्रतिबंधित (evidence-constrained) टीचर बैकऑफ तंत्र और एक स्वचालित GPT-5.5-सहायता प्राप्त पाइपलाइन पेश करता है, जो शून्य-पुरस्कार रोलआउट्स (zero-reward rollouts) के लिए सहायक पर्यवेक्षण प्रदान करके विविध बेंचमार्क में खोज दक्षता और उत्तर सटीकता में सुधार करता है।

मूल लेखक: Xiao Ma, Zhiquan Hu, Yi Wei, Chenchen Zhao, Yijun Chen, Jicheng Zhao, Yuming Li, Chuang Dai

प्रकाशित 2026-07-29
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xiao Ma, Zhiquan Hu, Yi Wei, Chenchen Zhao, Yijun Chen, Jicheng Zhao, Yuming Li, Chuang Dai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: EviBack

समस्या विवरण (Problem Statement)

रीइन्फोर्समेंट लर्निंग (RL) ने एजेंटिक रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम को सत्यापन योग्य परिणाम पुरस्कारों (verifiable outcome rewards) से बहु-चरणीय खोज रणनीतियों को सीखने में सक्षम बनाया है। हालाँकि, वर्तमान प्रशिक्षण प्रतिमानों (training paradigms) में एक महत्वपूर्ण सीमा मौजूद है: जब नमूनों का एक समूह (rollouts) कोई भी सही उत्तर नहीं देता है (एक "ऑल-जीरो" समूह), तो मानक RL सिग्नल कोई तुलनात्मक जानकारी प्रदान नहीं करता है। इन परिदृश्यों में, सामान्यीकृत लाभ (normalized advantage) शून्य होता है, जिससे आंशिक प्रगति या सही मध्यवर्ती खोज व्यवहार भी पूर्ण विफलता से अलग नहीं पहचाने जा सकते। इसके अलावा, प्रक्रिया मूल्यांकन के लिए मैन्युअल प्रॉम्प्ट डिज़ाइन पर निर्भर मौजूदा विधियाँ अक्सर 'क्वेरी तर्कसंगतता' (query rationality) और 'साक्ष्य पर्याप्तता' (evidence sufficiency) जैसे आयामों को स्थिर रूप से चित्रित करने में विफल रहती हैं, या वे इस जोखिम को बढ़ाती हैं कि संदर्भ उत्तर (reference answers) अपर्याप्त साक्ष्य के निर्णयों को ओवरराइड कर सकते हैं।

कार्यप्रणाली (Methodology)

यह शोध पत्र EviBack का प्रस्ताव करता है, जो एक ऐसा ढांचा है जिसे 'ऑल-जीरो' रोलआउट समूहों को सहायक पर्यवेक्षण (auxiliary supervision) प्रदान करने के लिए डिज़ाइन किया गया है, जबकि सत्यापन योग्य एक्टर (Actor) पुरस्कारों की अखंडता को सुरक्षित रखा जाता है। यह कार्यप्रणाली तीन मुख्य घटकों से मिलकर बनी है:

1. साक्ष्य-प्रतिबंधित शिक्षक बैकऑफ (Evidence-Constrained Teacher Backoff)

EviBack एक "शिक्षक" (Teacher) मॉडल पेश करता है जो एक बैकफ़ॉल तंत्र के रूप में कार्य करता है। इसे केवल तभी सक्रिय किया जाता है जब एक एक्टर रोलआउट समूह में कोई भी प्रक्षेपवक्र (trajectory) सत्यापन योग्य सटीक मिलान (exact match) वाला नहीं होता है (ऑल-जीरो समूह)।

  • दो-चरणीय वास्तुकला (Two-Stage Architecture): शिक्षक, संदर्भ उत्तरों द्वारा साक्ष्य अपर्याप्तता को छिपाने से रोकने के लिए साक्ष्य मूल्यांकन (evidence assessment) को उत्तर परिशोधन (answer refinement) से अलग करता है।
    • चरण A (गोल्ड-ब्लाइंड/Gold-Blind): यह मूल्यांकन करता है कि क्या एक्टर के पास उपलब्ध संचित साक्ष्य प्रश्न का उत्तर देने के लिए पर्याप्त हैं। यह एक स्थिति आउटपुट करता है: पर्याप्त (Sufficient - S), अपर्याप्त (Insufficient - I), या अस्पष्ट (Ambiguous - A)। यह चरण ग्राउंड-ट्रुथ उत्तर तक पहुँच के बिना संचालित होता है।
    • चरण B (गोल्ड-अवेयर/Gold-Aware): यह केवल तभी निष्पादित होता है जब चरण A यह निर्धारित करता है कि साक्ष्य अपर्याप्त नहीं हैं (sAIs_A \neq I)। यह संदर्भ के साथ संरेखण के लिए उत्तर को परिष्कृत करता है, लेकिन चरण A द्वारा स्थापित "अपर्याप्त" सीमा को सख्ती से सुरक्षित रखता है।
  • पुरस्कार सिग्नल (Reward Signal): ऑल-जीरो समूहों के लिए, शिक्षक स्थिति और एक संदर्भ-संरेखित F1 स्कोर के आधार पर एक हाइब्रिड पुरस्कार प्रदान करता है। इस पुरस्कार को एक कारक λ=0.1\lambda = 0.1 द्वारा कम किया जाता है ताकि यह सुनिश्चित हो सके कि यह उन समूहों से प्राप्त लर्निंग सिग्नल को ओवरराइड न करे जिनमें सत्यापित हिट्स मौजूद हैं।

2. E2E-APE (एंड-टू-एंड ऑटोमैटिक प्रॉम्प्ट इंजीनियरिंग)

शिक्षक नीति का निर्माण करने के लिए, लेखक E2E-APE का प्रस्ताव करते हैं, जो जज प्रॉम्प्ट बनाने की एक बाधा-निर्देशित (constraint-guided) विधि है।

  • प्रक्रिया: पारंपरिक प्रॉम्प्ट अनुकूलन के विपरीत, जो अंतिम कार्य स्कोर को अधिकतम करता है, E2E-APE मध्यवर्ती प्रक्रिया मूल्यांकन (जैसे क्वेरी तर्कसंगतता, साक्ष्य प्रभावशीलता) के लिए आवश्यक स्पष्ट बाधाओं से शुरू होता है।
  • स्वचालन: एक GPT-5.5 कंट्रोलर का उपयोग करते हुए, यह पाइपलाइन रोलआउट डेटा को स्वतः विभाजित करती है, उम्मीदवार प्रॉम्प्ट/वर्कफ़्लो उत्पन्न करती है, उन्हें विशिष्ट मेट्रिक्स (साक्ष्य सीमा अनुपालन, स्थिरता, लागत) के विरुद्ध मूल्यांकन करती है, और एक गेटेड दो-चरणीय नीति का चयन करती है।
  • परिणाम: यह प्रक्रिया एक मैन्युअल रूप से लिखित सिंगल-प्रॉम्ट शिक्षक को प्रारंभिक लॉन्च के बाद किसी भी मैन्युअल हस्तक्षेप के बिना एक फ्रीज्ड, वर्जन्ड दो-चरणीय नीति में बदल देती है।

3. प्रशिक्षण प्रोटोकॉल (Training Protocol)

सिस्टम GRPO (ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन) का उपयोग करता है।

  • एक्टर-प्रथम प्राथमिकता (Actor-First Precedence): यदि किसी समूह में कोई भी प्रक्षेपवक्र एक सत्यापन योग्य सटीक मिलान प्राप्त करता है, तो शिक्षक को बायपास कर दिया जाता है, और मानक एक्टर पुरस्कारों का उपयोग किया जाता है।
  • चयनात्मक बैकफ़ॉल (Selective Fallback): शिक्षक को केवल उन समूहों के लिए बुलाया जाता है जहाँ सभी प्रक्षेपवक्र विफल हो जाते हैं। परिणामी पुरस्कारों को समूह के भीतर सामान्यीकृत किया जाता है, और बैकफ़ॉल एडवांटेज को इस तरह स्केल किया जाता है कि सत्यापित हिट्स वाले समूहों की तुलना में इसका पॉलिसी-ग्रेडिएंट योगदान कम रहे।

मुख्य योगदान (Key Contributions)

  1. E2E-APE: जज प्रॉम्प्ट उत्पन्न करने के लिए एक बाधा-आधारित, एंड-टू-एंड ऑटोमैटिक प्रॉम्प्ट इंजीनियरिंग विधि। यह ध्यान अंतिम कार्य प्रदर्शन को अधिकतम करने से हटाकर मध्यवर्ती प्रक्रिया मूल्यांकन के लिए बाधाओं को संतुष्ट करने पर केंद्रित करता है, जिससे मैन्युअल डिज़ाइन लागत कम होती है और स्कोरिंग स्थिरता में सुधार होता है।
  2. EviBack फ्रेमवर्क: एक हाइब्रिड रिवॉर्ड सिस्टम जो सत्यापन योग्य अंतिम-उत्तर पुरस्कारों को शिक्षक-व्युत्पन्न प्रक्रिया पुरस्कारों के साथ जोड़ता है। यह RL पर्यवेक्षण को खोज प्रक्षेपवक्रों की गुणवत्ता तक विस्तारित करता है, विशेष रूप से "ऑल-जीरो" समूह की समस्या का समाधान करता है।
  3. साक्ष्य-सीमा संरक्षण (Evidence-Boundary Preservation): एक नवीन दो-चरणीय शिक्षक डिज़ाइन जो साक्ष्य पर्याप्तता निर्णय को उत्तर परिशोधन से अलग करता है, यह सुनिश्चित करता है कि संदर्भ उत्तर अपर्याप्त साक्ष्य के निर्णयों को ओवरराइड न कर सकें।

प्रयोगात्मक परिणाम (Experimental Results)

लेखकों ने सात ओपन-डोमेन QA बेंचमार्क (जिसमें NQ, HotpotQA, MuSiQue, 2WikiMultiHopQA आदि शामिल हैं) और तीन Qwen3 मॉडल स्केल्स (0.6B, 1.7B, और 4B) में EviBack का मूल्यांकन किया।

  • प्रदर्शन लाभ: EviBack ने मजबूत Search-R1 बेसलाइन पर लगातार F1 स्कोर में सुधार किया।
    • 1.7B स्केल पर, EviBack ने बेसलाइन पर 16% सापेक्ष लाभ प्राप्त किया।
    • सभी स्केल्स में सिंगल-हॉप और मल्टी-हॉप मैक्रो F1 स्कोर में सुधार देखा गया।
  • खोज दक्षता (Search Efficiency): इस पद्धति ने औसत खोजों, डुप्लिकेट क्वेरी दरों और मजबूर समाप्ति दरों (max-turn) को कम किया। उदाहरण के लिए, 1.7B स्केल पर, वैध-उत्तर दर 0.7317 से बढ़कर 0.8611 हो गई, जबकि औसत खोज 1.73 से घटकर 1.59 रह गई।
  • शिक्षक निर्माण: E2E-APE द्वारा निर्मित शिक्षक, मैन्युअल रूप से डिज़ाइन किए गए सिंगल-प्रॉम्ट ड्यूल-टास्क शिक्षक से बेहतर रहा, जिसने F1 में 0.0260 और वैध-उत्तर दर में 0.2197 का सुधार किया, साथ ही खोज ओवरहेड को काफी कम किया।
  • एब्लेशन अध्ययन (Ablation Studies): प्रयोगों ने पुष्टि की कि दो-चरणीय साक्ष्य प्रतिबंध और विशिष्ट बैकफ़ॉल स्केलिंग कारक (λ=0.1\lambda=0.1) प्रदर्शन लाभ और खोज दक्षता के बीच संतुलन बनाने के लिए महत्वपूर्ण थे।

महत्व और दावे (Significance and Claims)

यह शोध पत्र दावा करता है कि EviBack खोज एजेंटों के प्रशिक्षण में एक मौलिक अंतर को संबोधित करता है: विफलता के मामलों में तुलनात्मक संकेतों की कमी। एक चयनात्मक, साक्ष्य-प्रतिबंधित बैकऑफ तंत्र पेश करके, सिस्टम सत्यापन योग्य अंतिम पुरस्कार की अखंडता से समझौता किए बिना मध्यवर्ती तर्क पर सूक्ष्म फीडबैक प्रदान करता है।

लेखक इस बात पर जोर देते हैं कि उनका दृष्टिकोण:

  • सहायक पर्यवेक्षण को बहाल करता है उन समूहों के लिए जो अन्यथा कोई लर्निंग सिग्नल प्रदान नहीं करते।
  • संदर्भ लीकेज (Reference Leakage) को रोकता है जो साक्ष्य पर्याप्तता निर्णयों को विकृत कर सकता है, जो प्रोसेस-रिवॉर्ड मॉडल्स की एक आम समस्या है।
  • जटिल, बाधा-संतुष्ट मूल्यांकन नीतियों को बनाने के लिए स्वचालित प्रॉम्प्ट इंजीनियरिंग (E2E-APE) की व्यवहार्यता को प्रदर्शित करता है जो मैन्युअल डिज़ाइनों से बेहतर प्रदर्शन करती है।

कार्य यह निष्कर्ष निकालता है कि हालांकि समृद्ध शिक्षक-व्युत्पन्न सिग्नल (जैसे क्वेरी गुणवत्ता, अतिरेक) भविष्य के अनुसंधान के लिए एक दिशा बने हुए हैं, वर्तमान साक्ष्य-प्रतिबंधित डिज़ाइन एजेंटिक RAG प्रदर्शन को बेहतर बनाने के लिए एक मजबूत और प्रभावी तरीका प्रदान करता है। कोड को बाद के चरण में सार्वजनिक रूप से उपलब्ध कराने का वादा किया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →