← नवीनतम पेपर
💻 computer science

SubSearch: Intermediate Rewards for Unsupervised Guided Reasoning in Complex Retrieval

SubSearch एक अनसुपरवाइज्ड (unsupervised) फ्रेमवर्क है जो जनरेटर्स को आंतरिक मध्यवर्ती पुरस्कारों (intrinsic intermediate rewards) के साथ सीधे अनुकूलित करके लार्ज लैंग्वेज मॉडल्स में जटिल पुनर्प्राप्ति और तर्क क्षमता को बढ़ाता है, जिससे बाहरी पर्यवेक्षण की आवश्यकता समाप्त हो जाती है और केवल परिणाम-आधारित दृष्टिकोणों की तुलना में अधिक सुदृढ़ तर्क पथ (reasoning traces) उत्पन्न होते हैं।

मूल लेखक: Roxana Petcu, Evangelos Kanoulas, Maarten de Rijke

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Roxana Petcu, Evangelos Kanoulas, Maarten de Rijke

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही जटिल रहस्य सुलझाने की कोशिश कर रहे हैं, जैसे यह पता लगाना कि दुनिया में दो प्रसिद्ध बैंकों में से किसके पास अधिक शाखाएं (branches) हैं। एक मानक AI (लार्ज लैंग्वेज मॉडल) उस प्रतिभाशाली जासूस की तरह है जिसने लाइब्रेरी की हर किताब पढ़ ली है लेकिन कभी इमारत से बाहर नहीं निकला है। वह जो कुछ भी याद करता है उसके आधार पर उत्तर का अनुमान लगाने की कोशिश करता है। कभी-कभी वह सही होता है, लेकिन अक्सर वह भ्रमित हो जाता है या अटक जाता है क्योंकि उसके पास नवीनतम तथ्य नहीं होते।

इसे ठीक करने के लिए, हम जासूस को एक फोन और एक सर्च इंजन देते हैं। अब, जासूस तथ्यों को खोजने के लिए लाइब्रेरी को कॉल कर सकता है। इसे रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) कहा जाता है।

हालाँकि, एक नई समस्या है। यदि आप बस जासूस को कहते हैं, "सही उत्तर लाओ वरना तुम फेल हो जाओगे," तो वे आलसी हो सकते हैं। वे तुरंत उत्तर का अनुमान लगा सकते हैं, या वे गलत चीजें खोज सकते हैं और भाग्य से सही हो सकते हैं। वे यह नहीं सीख रहे हैं कि कैसे सोचना है; वे केवल खेल जीतने की कोशिश कर रहे हैं।

यहीं पर यह पेपर SubSearch पेश करता है।

मुख्य विचार: केवल फिनिश लाइन को नहीं, बल्कि कदमों को पुरस्कृत करना

एक AI को प्रशिक्षित करना एक कुत्ते को एक जटिल करतब दिखाने के लिए प्रशिक्षित करने जैसा है, जैसे बाड़ के ऊपर से कूदना, गेंद को पकड़ना और फिर बैठ जाना।

  • पुराना तरीका (आउटकम रिवॉर्ड्स): आप कुत्ते को तभी ट्रीट (इनाम) देते हैं जब वह पूरा करतब पूरी तरह से कर लेता है। यदि कुत्ता बाड़ के ऊपर से कूदता है लेकिन गेंद को पकड़ने में चूक जाता है, तो उसे कुछ नहीं मिलता। कुत्ता निराश हो जाता है, कोशिश करना छोड़ देता है, या गलती से ट्रीट पाने के लिए बस बैठ जाने और भौंकने के लिए सीख जाता है।
  • SubSearch का तरीका (इंटरमीडिएट रिवॉर्ड्स): आप कुत्ते को बाड़ के ऊपर से कूदने के लिए एक छोटा ट्रीट देते हैं, गेंद पकड़ने के लिए दूसरा, और अंत में बैठने के लिए एक बड़ा ट्रीट देते हैं। भले ही वह अंतिम चरण में चूक जाए, उसे पता होता है कि उसने पहला हिस्सा सही किया था। यह कुत्ते को करतब करने की प्रक्रिया सिखाता है।

SubSearch AI के लिए बिल्कुल यही करता है। यह देखने के बजाय कि अंत में उत्तर सही है या नहीं, यह रास्ते में AI को "पॉइंट्स" (पुरस्कार) देता है:

  1. समस्या को तोड़ना: क्या AI ने बड़े प्रश्न को छोटे, प्रबंधनीय प्रश्नों में विभाजित किया? (जैसे, "बैंक A की कितनी शाखाएं हैं?" और "बैंक B की कितनी शाखाएं हैं?")
  2. खोज की जाँच करना: क्या AI ने सर्च इंजन के लिए एक अच्छा प्रश्न पूछा?
  3. उत्तर को समझना: क्या AI ने खोज परिणामों को सही ढंग से पढ़ा?

यह कैसे काम करता है ("SubSearch" का जादू)

पेपर इसे इंट्रिन्सिक प्रोसेस रिवॉर्ड्स (Intrinsic Process Rewards) कहता है। यहाँ रूपक (metaphor) है:

कल्पना कीजिए कि आप एक भूलभुलैया (maze) में रास्ता खोज रहे हैं।

  • मानक AI: आपकी आँखों पर पट्टी बंधी है। आप बेतरतीब ढंग से चलते हैं जब तक कि आप निकास तक नहीं पहुँच जाते। यदि आप निकास तक पहुँच जाते हैं, तो आपको पुरस्कार मिलता है। यदि आप दीवार से टकराते हैं, तो आपको कुछ नहीं मिलता। आप कभी नहीं सीख पाते कि आप दीवार से क्यों टकराए।
  • SubSearch: आपके पास एक GPS है जो हर बार "डिंग" की आवाज़ करता है जब आप सही दिशा में बढ़ते हैं या सही मोड़ लेते हैं। भले ही आप अभी तक निकास तक नहीं पहुँचे हैं, "डिंग" आपको बताता है, "अच्छा काम किया, यह एक स्मार्ट चाल थी।"

AI निम्नलिखित चीजें सीखता है:

  1. डिकम्पोज़ (Decompose): एक विशाल, डरावने प्रश्न को छोटे, आसान कंकड़ों में तोड़ना।
  2. सर्च (Search): प्रत्येक कंकड़ के लिए उत्तर खोजना।
  3. सिंथेसाइज (Synthesize): अंतिम उत्तर बनाने के लिए कंकड़ों को एक साथ जोड़ना।

यह क्यों महत्वपूर्ण है

शोधकर्ताओं ने सात अलग-अलग "रहस्यमय" डेटासेट्स (जैसे ट्रिविया और जटिल तर्क कार्य) पर इसका परीक्षण किया। उन्होंने पाया कि:

  • बेहतर तर्क: AI ने केवल अनुमान नहीं लगाया; वास्तव में इसने उत्तर के लिए एक तार्किक पथ बनाया।
  • अतिरिक्त शिक्षकों की आवश्यकता नहीं: आमतौर पर, AI को यह सब अच्छी तरह से करने के लिए सिखाने के लिए, आपको मनुष्यों द्वारा सटीक स्टेप-बाय-स्टेप उदाहरण लिखने की आवश्यकता होती है (जो महंगा और धीमा है)। SubSearch अपनी प्रगति को देखकर खुद को सिखाता है। यह एक ऐसे छात्र की तरह है जो शिक्षक द्वारा सुधार किए जाने का इंतज़ार करने के बजाय, एक रूब्रिक के आधार पर अपने स्वयं के होमवर्क को ग्रेड करता है।
  • मजबूती (Robustness): AI जटिल प्रश्नों को संभालने में बहुत बेहतर हो गया जहाँ उत्तर स्पष्ट नहीं है।

निचोड़ (The Bottom Line)

SubSearch एक नया प्रशिक्षण तरीका है जो AI एजेंटों को बेहतर जासूस बनने के लिए सिखाता है। केवल अंत में "इसे सही करो!" चिल्लाने के बजाय, यह रास्ते में "इसे तोड़ने के लिए अच्छा काम किया" और "अच्छा सर्च क्वेरी" फुसफुसाता है। यह AI को जटिल समस्याओं के माध्यम से सोचने का तरीका सीखने में मदद करता है, जिससे यह अधिक स्मार्ट, अधिक विश्वसनीय और नकली तथ्य बनाने की कम संभावना वाला बनता है।

यह उस छात्र के बीच का अंतर है जो उत्तर कुंजी (answer key) रट लेता है और उस छात्र के बीच जो वास्तव में गणित की समस्या को हल करना सीखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →