← नवीनतम पेपर
💬 NLP

Supervising the search process produces reliable and generalizable information-seeking agents

यह शोध पत्र RAG-Gym और Re2^2Search++ एजेंट को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि पर्यवेक्षण (supervision) को अंतिम उत्तरों से हटाकर स्वयं खोज प्रक्रिया पर केंद्रित करने से अधिक विश्वसनीय और सामान्यीकरण योग्य सूचना-खोज एजेंट प्राप्त होते हैं, विशेष रूप से आउट-ऑफ-डोमेन सेटिंग्स में।

मूल लेखक: Guangzhi Xiong, Qiao Jin, Xiao Wang, Yin Fang, Haolin Liu, Yifan Yang, Fangyuan Chen, Zhixing Song, Dengyu Wang, Minjia Zhang, Zhiyong Lu, Aidong Zhang

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guangzhi Xiong, Qiao Jin, Xiao Wang, Yin Fang, Haolin Liu, Yifan Yang, Fangyuan Chen, Zhixing Song, Dengyu Wang, Minjia Zhang, Zhiyong Lu, Aidong Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके शोध पत्र (paper) का स्पष्टीकरण दिया गया है।

मुख्य विचार: केवल क्विज़ लेने वाले को नहीं, बल्कि एक जासूस को सिखाना

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान छात्र (एक AI) है जो एक कठिन परीक्षा दे रहा है।

  • पुराना तरीका (Outcome Supervision): शिक्षक केवल अंतिम उत्तर पुस्तिका को देखता है। यदि छात्र सही उत्तर देता है, तो उसे "A" ग्रेड मिलता है, भले ही उसने अंदाज़ा लगाया हो, याददाश्त के आधार पर तथ्य दोहराए हों, या वह भाग्यशाली रहा हो। यदि वह गलत होता है, तो उसे "F" मिलता है, भले ही उसने शोध के सभी सही कदम उठाए हों लेकिन अंत में एक छोटी सी गणना में गलती कर दी हो।
  • नया तरीका (Process Supervision): शिक्षक छात्र को काम करते दौरान देखता है। वह छात्र के रफ पेपर, उनके खोज प्रश्नों (search queries) और हर चरण में उनके तर्क की जाँच करता है। यदि छात्र किसी लापता तथ्य को खोजने के लिए एक स्मार्ट प्रश्न पूछता है, तो उसे एक अंक मिलता है। यदि वह एक अस्पष्ट प्रश्न पूछता है या बिना देखे अंदाज़ा लगाता है, तो उसके अंक काट लिए जाते हैं।

यह शोध पत्र, जिसका शीर्षक है "Supervising the search process produces reliable and generalizable information-seeking agents," यह तर्क देता है कि AI को एक अच्छा जासूस बनना सिखाना (उनके प्रोसेस को देखकर) केवल उनके अंतिम उत्तर को ग्रेड देने से कहीं बेहतर है।


समस्या: "भाग्यशाली अंदाज़े" का जाल (The "Lucky Guess" Trap)

लेखकों ने पाया कि जब AI मॉडल को केवल अंतिम उत्तर सही होने के लिए पुरस्कृत किया जाता है, तो वे "सिस्टम को चकमा देने" (game the system) लगते हैं।

  • उदाहरण: कल्पना कीजिए कि एक छात्र गणित के सवाल का जवाब जानता है क्योंकि उसने पिछली कक्षा में इसे याद कर लिया था। जब शिक्षक उसी सवाल का एक नया संस्करण पूछता है, तो छात्र वही पुराना उत्तर लिख देता है। उसे अंक तो मिल जाते हैं, लेकिन उसने वास्तव में नया सवाल हल नहीं किया।
  • AI के संदर्भ में: AI नए तथ्य खोजने के बजाय अपने आंतरिक "मेमोरी" (पैरामीट्रिक ज्ञान) पर निर्भर होकर उत्तरों का अंदाज़ा लगाने लगता है। यह उन सवालों के लिए ठीक काम करता है जो उसने पहले देखे हैं, लेकिन जब AI के सामने कोई बिल्कुल नया विषय (out-of-domain) आता है, तो वह विफल हो जाता है क्योंकि वह अंदाज़ों के सहारे आगे नहीं बढ़ सकता।

समाधान: RAG-Gym और Re2Search++

लेखकों ने एक नया प्रशिक्षण जिम बनाया जिसे RAG-Gym कहा गया है। इसे एक वीडियो गेम की तरह समझें जहाँ AI एक जासूस की भूमिका निभाता है।

1. नया आर्किटेक्चर: Re2Search

लेखकों ने AI के सोचने का एक विशिष्ट तरीका डिज़ाइन किया है, जिसे Re2Search (Reason, Reflection, Search) कहा जाता है।

  • Reason (तर्क): AI पहले अपने दिमाग में पहेली को सुलझाने की कोशिश करता है।
  • Reflection (चिंतन): यह सबसे महत्वपूर्ण हिस्सा है। AI रुकता है और खुद से पूछता है, "रुको, क्या मुझे वास्तव में यह तथ्य पता है, या मैं बस मनगढ़ंत बातें बना रहा हूँ?" यदि उसे एहसास होता है कि जानकारी का एक हिस्सा गायब है, तो वह उसे चिह्नित (flag) कर देता है।
  • Search (खोज): अंदाज़ा लगाने के बजाय, वह उस लापता जानकारी को खोजने के लिए एक बहुत ही विशिष्ट प्रश्न पूछता है।

उदाहरण: कल्पना कीजिए कि एक जासूस अपराध को सुलझा रहा है।

  • पुराना AI: "मुझे लगता है कि बटलर ने यह किया!" (अंतर्ज्ञान के आधार पर अंदाज़ा लगाना)।
  • Re2Search AI: "मुझे लगता है कि बटलर ने यह किया, लेकिन मैंने अभी तक उसका एलीबाई (घटनास्थल पर उपस्थिति का प्रमाण) चेक नहीं किया है। मुझे अपना दावा करने से पहले उसका एलीबाई चेक करने की ज़रूरत है।"

2. प्रशिक्षण: एक कोच (The Critic) से सीखना

AI केवल प्रयास करने और असफल होने से नहीं सीखता। उसके पास एक Critic (एक कोच) है जो उसे देख रहा है।

  • Critic केवल अंतिम उत्तर को नहीं देखता। वह AI द्वारा किए गए हर सर्च क्वेरी को देखता है।
  • यदि AI एक अस्पष्ट प्रश्न पूछता है जैसे "मुझे नदी के बारे में बताओ," तो Critic कहता है, "नहीं, यह बहुत व्यापक है। यांग्त्ज़ी की लंबाई के बारे में विशिष्ट रूप से पूछो।"
  • यदि AI एक सटीक प्रश्न पूछता है जो पहेली को सुलझाने में मदद करता है, तो Critic उसे उच्च स्कोर देता है।

यह क्यों महत्वपूर्ण है: परिणाम

शोधकर्ताओं ने इस नई पद्धति का परीक्षण चार अलग-अलग "परीक्षा कक्षों" (डेटासेट्स) पर किया, जिसमें सामान्य ज्ञान और चिकित्सा संबंधी प्रश्न शामिल थे। यहाँ उन्हें क्या मिला:

  1. बेहतर सामान्यीकरण (Better Generalization): जब AI का परीक्षण उन सवालों पर किया गया जो उसने पहले कभी नहीं देखे थे (जैसे कि एक मेडिकल परीक्षा जिसके लिए उसे प्रशिक्षित नहीं किया गया था), तो "प्रोसेस-सुपरवाइज्ड" AI ने बहुत बेहतर प्रदर्शन किया। वह अंदाज़ा लगाने पर निर्भर नहीं रहा; वह वास्तव में सबूत खोजने के लिए बाहर निकला।

    • उदाहरण: पुराना AI एक ऐसे पर्यटक की तरह है जो केवल प्रसिद्ध स्थलों को जानता है। नया AI एक स्थानीय गाइड की तरह है जो किसी भी गली में रास्ता खोजने का ज्ञान रखता है, क्योंकि वह जानता है कि दिशा-निर्देश कैसे मांगे जाते हैं।
  2. कम "भ्रम" (Fewer Hallucinations): नया AI चीज़ें बनाने (मनगढ़ंत बातें कहने) की संभावना बहुत कम रखता था। क्योंकि उसे वास्तविक सबूत खोजने के लिए पुरस्कृत किया गया था, इसलिए उसने अंदाज़ा लगाना बंद कर दिया।

    • उदाहरण: पुराना AI कहेगा, "फ्रांस की राजधानी पेरिस है" (सही) या "फ्रांस की राजधानी लंदन है" (गलत, लेकिन उसने अंदाज़ा लगाया)। नया AI कहता है, "मुझे नहीं पता, मुझे एक नक्शा देखने दो," और फिर सही उत्तर ढूँढ लेता है।
  3. कोच किसी के भी लिए काम करता है: "Critic" (कोच) को एक छोटे, ओपन-सोर्स AI पर प्रशिक्षित किया गया था। आश्चर्यजनक रूप से, यही कोच एक बहुत बड़े, महंगे, "ब्लैक बॉक्स" AI (जैसे GPT-4) को बेहतर प्रदर्शन करने में मदद कर सकता है।

    • उदाहरण: यह एक छोटे, बुद्धिमान कोच की तरह है जो एक विशाल, शक्तिशाली एथलीट को दौड़ना सिखा सकता है। आपको एथलीट की मांसपेशियों को बदलने की ज़रूरत नहीं है; आपको बस सही कोचिंग की ज़रूरत है।

निष्कर्ष (The Takeaway)

यह शोध पत्र निष्कर्ष निकालता है कि वास्तव में विश्वसनीय और नए, कठिन कार्यों को संभालने वाले AI बनाने के लिए, हमें केवल अंतिम टेस्ट स्कोर को ग्रेड नहीं देना चाहिए। हमें छात्र के काम को देखना चाहिए, उनकी खोज की आदतों को सुधारना चाहिए, और उन्हें यह सिखाना चाहिए कि वे क्या जानते हैं और वे क्या नहीं जानते, इस पर चिंतन कैसे करें।

खोज प्रक्रिया (search process) की निगरानी करके, हमें एक ऐसा AI मिलता है जो ईमानदार, संपूर्ण और उन समस्याओं को हल करने में सक्षम है जिन्हें उसने पहले कभी नहीं देखा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →