← नवीनतम पेपर
💬 NLP

RECON: Reasoning with Condensation for Efficient Retrieval-Augmented Generation

RECON एक फ्रोजन, टू-स्टेज प्रशिक्षित ऑब्जर्वेशन कंप्रेसर को RL-आधारित सर्च एजेंटों के रीजनिंग लूप में एकीकृत करता है ताकि मल्टी-टर्न टूल ऑब्जर्वेशन्स को कुशलतापूर्वक कंडेंस किया जा सके, जिससे संदर्भ लागत और लेटेंसी में काफी कमी आती है और साथ ही रीजनिंग प्रदर्शन और ट्रेनिंग स्थिरता में सुधार होता है।

मूल लेखक: Zhichao Xu, Minheng Wang, Yawei Wang, Wenqian Ye, Yuntao Du, Yunpu Ma, Yijun Tian

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhichao Xu, Minheng Wang, Yawei Wang, Wenqian Ye, Yuntao Du, Yunpu Ma, Yijun Tian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं। आपके पास एक प्रतिभाशाली सहायक (AI एजेंट) है जो बहुत बुद्धिमान है लेकिन अगर आप उन्हें एक साथ सबूतों का एक विशाल, बिखरा हुआ ढेर थमा देते हैं, तो वे घबरा जाते हैं।

AI सर्च की दुनिया में, यह "सबूतों का ढेर" इंटरनेट से आता है। हर बार जब AI कोई सवाल पूछता है, तो उसे टेक्स्ट का एक बहुत बड़ा हिस्सा वापस मिलता है—वेब पेज, लेख और सर्च परिणाम। वर्तमान प्रणालियों में, AI को हर परिणाम के हर एक शब्द को बार-बार पढ़ना पड़ता है, जैसे-जैसे वह अधिक प्रश्न पूछता है। यह एक घास के ढेर में सुई खोजने जैसा है, लेकिन हर बार जब आप एक नया सुराग मांगते हैं, तो कोई पुराने ढेर के ऊपर एक पूरा नया घास का ढेर डाल देता है। ढेर इतना बड़ा हो जाता है कि AI भ्रमित हो जाता है, धीमा हो जाता है, और कभी-कभी चीजें बनाने लगता है क्योंकि वह महत्वपूर्ण विवरणों को देख नहीं पाता।

मिलिए RECON से: "स्मार्ट समराइज़र" (सारांशकार) जासूस।

यह पेपर एक नई विधि पेश करता है जिसे RECON (Reasoning with Condensation) कहा जाता है। RECON को एक अत्यधिक कुशल एविडेंस फ़िल्टर के रूप में समझें जो इंटरनेट और आपके जासूसी सहायक के बीच स्थित है।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. समस्या: "शोर" का ओवरलोड

कल्पना कीजिए कि आपका जासूस गवाहों से पूछताछ कर रहा है।

  • पुराना तरीका (Search-R1): हर बार जब कोई गवाह बोलता है, तो जासूस उनकी पूरी बड़बड़ाहट लिख लेता है, जिसमें उनके लंच का ऑर्डर, मौसम के बारे में शिकायतें और असंबंधित गपशप भी शामिल होती है। पांच गवाहों के बाद, जासूस की नोटबुक 500 पन्नों की हो जाती है, जो शोर से भरी होती है। जासूस थक जाता है, मुख्य सुरागों को मिस कर देता है, और केस सुलझाने में बहुत समय लेता है।
  • लागत: यह समय (पैसा) बर्बाद करता है और जासूस को धीमा और कम सटीक बनाता है।

2. समाधान: "कंडेंसेशन" (संक्षेपण) चरण

RECON, गवाह के बोलने के तुरंत बाद और जासूस द्वारा नोट्स पढ़ने से पहले, एक विशेष Summarizer (एक छोटा, विशिष्ट AI) को बीच में डाल देता है।

  • यह कैसे काम करता है: Summarizer गवाह की बात सुनता है, लंच के ऑर्डर और गपशप को अनदेखा करता है, और केवल उन तथ्यों का एक संक्षिप्त, सटीक 3-लाइन का सारांश लिखता है जो रहस्य के लिए महत्वपूर्ण हैं।
  • परिणाम: अब जासूस को केवल एक छोटा, साफ नोट पढ़ना पड़ता है। नोटबुक छोटी रहती है, जासूस केंद्रित रहता है, और केस तेजी से सुलझ जाता है।

3. उन्होंने Summarizer को कैसे प्रशिक्षित किया (दो-चरणीय स्कूल)

लेखकों ने केवल यह अनुमान नहीं लगाया कि इस फ़िल्टर को कैसे बनाया जाए; उन्होंने इसे दो विशिष्ट चरणों में प्रशिक्षित किया ताकि यह एकदम सटीक हो सके:

  • चरण 1: "प्रासंगिकता" परीक्षण (Pre-training): सबसे पहले, उन्होंने Summarizer को यह सिखाया कि एक उपयोगी सुराग और एक भटकाने वाले संकेत (red herring) के बीच अंतर कैसे किया जाए। उन्होंने इसे सिखाने के लिए प्रश्नों और उत्तरों के एक विशाल डेटासेट (MS MARCO) का उपयोग किया: "यदि टेक्स्ट सवाल का जवाब नहीं देता है, तो उसे फेंक दें।"
    • यह क्यों महत्वपूर्ण है: पेपर में पाया गया कि यदि आप इस चरण को छोड़ देते हैं, तो पूरा सिस्टम क्रैश हो जाता है। सारांश बनाने से पहले Summarizer को यह जानना आवश्यक है कि क्या महत्वपूर्ण है।
  • चरण 2: "मानवीय शैली" का पाठ (Distillation): इसके बाद, उन्होंने एक सुपर-स्मार्ट AI (GPT-4o-mini) से सटीक सारांश लिखवाए। उन्होंने Summarizer को इस शैली की नकल करने के लिए प्रशिक्षित किया, जिसमें स्पष्ट, तथ्यात्मक और पढ़ने में आसान होने पर ध्यान दिया गया। उन्होंने इसे विभिन्न "पहलूओं" (aspects) के आधार पर सारांशित करना सिखाया, जैसे कि "स्पष्टता" या "पूर्णता", लेकिन अंतिम प्रयोग में, उन्होंने "स्पष्टता" (Clarity) सेटिंग को चुना क्योंकि इसने सबसे छोटे, साफ नोट्स दिए।

4. "फ्रोजन" (जमी हुई) नियम

यहाँ एक महत्वपूर्ण विवरण है: एक बार जब Summarizer प्रशिक्षित हो जाता है, तो वह "फ्रोजन" होता है।

  • कल्पना कीजिए कि Summarizer एक विशेष उपकरण है, जैसे कि एक हाई-टेक कैमरा। मुख्य जासूस (AI एजेंट) ट्रायल एंड एरर (प्रयास और त्रुटि) के माध्यम से अपराध सुलझाना सीख रहा है।
  • यदि कैमरा हर बार जासूस की गलती होने पर अपनी सेटिंग्स बदल देता, तो जासूस कभी सीख ही नहीं पाता। इसलिए, जब जासूस सीख रहा होता है, तब Summarizer बिल्कुल वैसा ही रहता है। यह सिस्टम को स्थिर रखता है।

5. परिणाम: तेज़, स्मार्ट और सस्ता

जब शोधकर्ताओं ने RECON का पुराने तरीके (Search-R1) के मुकाबले परीक्षण किया, तो परिणाम प्रभावशाली थे:

  • छोटे नोटबुक: जासूस को पढ़ने के लिए उपलब्ध टेक्स्ट की कुल मात्रा 35% कम हो गई।
  • तेजी से समाधान: AI ने समस्याओं को 30.9% तेजी से (वास्तविक समय में) सुलझाया क्योंकि वह कचरे के ढेर में नहीं फंस रहा था।
  • बेहतर सटीकता: AI ने अधिक सही उत्तर प्राप्त किए, विशेष रूप से कठिन "मल्टी-हॉप" प्रश्नों पर (जहाँ आपको तीन या चार अलग-अलग स्रोतों से सुराग जोड़ने की आवश्यकता होती है)।
    • छोटे AI मॉडल (3B) के लिए, सटीकता 14.5% बढ़ गई।
    • बड़े AI मॉडल (7B) के लिए, सटीकता 3.0% बढ़ गई।
  • प्रशिक्षण गति: यहाँ तक कि AI को सिखाने की प्रक्रिया भी 5.4% तेज हो गई।

कमी (सीमाएं)

पेपर अपनी खामियों के बारे में ईमानदार है। क्योंकि Summarizer जानकारी को "संक्षिप्त" (condense) कर रहा है, इसलिए यह कभी-कभी अनजाने में एक छोटा विवरण (जैसे कोई विशिष्ट तारीख या व्यक्ति का नाम) छोड़ देता है।

  • समाधान: सिस्टम को इस तरह डिज़ाइन किया गया है कि यदि जासूस कोई सुराग मिस कर देता है, तो वह अगले दौर में उसे वापस पाने के लिए दूसरा सवाल पूछ सकता है।
  • समझौता: यह नोट्स को छोटा रखने और हर एक विवरण को बनाए रखने के बीच का संतुलन है। पेपर में पाया गया कि "छोटा और स्पष्ट" दृष्टिकोण बेहतर रहा, जिससे समग्र प्रदर्शन में सुधार हुआ।

संक्षेप में

RECON एक ऐसा सिस्टम है जो AI सर्च एजेंटों को टेक्स्ट के समुद्र में डूबने से रोकता है। इंटरनेट के शोर को साफ करने के लिए एक स्मार्ट, फ्रोजन "समराइज़र" को बीच में डालकर, यह सिस्टम तेज़, सस्ता और जटिल समस्याओं को हल करने में काफी बेहतर हो जाता है। यह एक अस्त-व्यस्त, भारी-भरकम लाइब्रेरी को एक व्यवस्थित, संगठित फाइलिंग कैबिनेट में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →