← नवीनतम पेपर
🤖 AI

SearchMaster: Grounded and Regulated Self-Play for Search Agents

SearchMaster एक सेल्फ-प्ले फ्रेमवर्क है जो एक स्थानीय वातावरण में कार्यों को उत्पन्न और हल करके LLM-आधारित सर्च एजेंटों को प्रशिक्षित करता है, जिसमें उच्च-गुणवत्ता वाले, ग्राउंडेड डेटा को सुनिश्चित करने के लिए एविडेंस-चेन जनरेटर (Evidence-Chain Generator), सर्च-डेप्थ रिवॉर्ड (Search-Depth Reward) और ओवर-ओपनिंग पेनल्टी (Over-Opening Penalty) का उपयोग किया जाता है जो मानव-लेबल वाले उदाहरणों पर निर्भर किए बिना डीप-सर्च बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Wentao Tan, Qiong Cao, Jiaqi Wang, Nan Duan

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wentao Tan, Qiong Cao, Jiaqi Wang, Nan Duan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल चैट नहीं करते, बल्कि उत्तर खोजने के लिए इंटरनेट की खोज करने निकलते हैं, ठीक वैसे ही जैसे एक जासूस सुरागों के लिए पुस्तकालय में छानबीन करता है। यह "सर्च एजेंटों" (search agents) का क्षेत्र है, जो लार्ज लैंग्वेज मॉडल्स (LLMs) पर आधारित स्मार्ट प्रोग्राम हैं जो वेब पेजों को पढ़ सकते हैं, लिंक पर क्लिक कर सकते हैं, और जटिल पहेलियों को सुलझाने के लिए सूचनाओं को जोड़ सकते हैं। लंबे समय तक, इन डिजिटल जासूसों को अपना काम अच्छी तरह से करना सिखाना एक सिरदर्द था। इसके लिए आमतौर पर महंगे मानव शिक्षकों की आवश्यकता होती थी जो यह लिखने के लिए कि कैसे खोज की जाए, सटीक उदाहरण तैयार करते थे, या रास्ता दिखाने के लिए और भी शक्तिशाली AI मॉडल्स की जरूरत होती थी। लेकिन क्या होगा अगर AI खुद को सिखा सके? यह "सेल्फ-प्ले" (self-play) का सपना है, एक ऐसी अवधारणा जहाँ एक AI खुद ही अपनी चुनौतियाँ उत्पन्न करता है और उन्हें हल करके सीखता है। यह एक वीडियो गेम चरित्र की तरह है जो अपने स्वयं के स्तर (levels) बनाता है और फिर बेहतर होने के लिए उन्हें खेलता है। हालाँकि, बड़ा सवाल यह है: क्या होगा अगर AI शॉर्टकट ले ले? क्या होगा अगर वह एक ऐसा पहेली बनाए जो कठिन दिखे लेकिन वास्तव में एक चाल हो, या यदि वह गहराई तक जाने के बजाय सतह को छूकर समस्या को हल कर दे? यह शोध पत्र ठीक इसी समस्या को संबोधित करता है, यह पूछता है कि हम इन सर्च एजेंटों को ईमानदार, गहन और वास्तव में स्मार्ट बनने के लिए कैसे प्रशिक्षित कर सकते हैं, बिना किसी मानवीय हाथ के हर कदम पर मार्गदर्शन किए।

पेश है SearchMaster, एक नया चतुर फ्रेमवर्क जिसे AI सेल्फ-प्ले में "शॉर्टकट लेने" की समस्या को ठीक करने के लिए डिज़ाइन किया गया है। SearchMaster को AI जासूसों की एक टीम के लिए एक सख्त लेकिन निष्पक्ष कोच के रूप में समझें। AI को बिना किसी दिशा के भटकने देने के बजाय, SearchMaster इसे पालन करने के लिए तीन विशिष्ट नियम देता है, यह सुनिश्चित करता है कि इसके द्वारा बनाया गया प्रशिक्षण डेटा वास्तव में उपयोगी हो।

पहला, AI को एक एविडेंस चेन (Evidence Chain) बनानी होगी। कल्पना कीजिए कि AI एक रहस्य को सुलझाने की कोशिश कर रहा है। केवल एक पेज पढ़ने के बाद उत्तर का अनुमान लगाने के बजाय, इसे विभिन्न दस्तावेजों से सुरागों को भौतिक रूप से आपस में जोड़ना होगा, जैसे मानचित्र पर बिंदुओं को जोड़ना। यदि यह एक दस्तावेज़ से दूसरे दस्तावेज़ तक साक्ष्य का एक स्पष्ट मार्ग नहीं दिखा सकता, तो कार्य को अस्वीकार कर दिया जाता है। यह AI को ऐसे "नकली" कठिन प्रश्न बनाने से रोकता है जिन्हें वास्तव में एक त्वरित नज़र से हल किया जा सकता था।

दूसरा, AI को सर्च-डेप्थ रिवॉर्ड (Search-Depth Reward) मिलता है। अतीत में, यदि किसी AI ने कोई समस्या हल की, तो उसे इस बात की परवाह किए बिना एक गोल्ड स्टार मिल जाता था कि उसने कितनी मेहनत की। SearchMaster खेल बदल देता है: AI को बड़ा इनाम तभी मिलता है जब उसे वास्तव में गहराई तक जाना पड़ा हो। यदि AI केवल एक पेज को सरसरी तौर पर देखकर पहेली सुलझाता है, तो उसे कम स्कोर मिलता है। लेकिन यदि उसे उत्तर खोजने के लिए कई पेजों की खोज करनी पड़ती है, तो उसे प्रशंसा मिलती है। यह AI को वास्तविक, बहु-चरणीय जांच की आवश्यकता वाले कार्यों को बनाने और हल करने के लिए प्रोत्साहित करता है, न कि सतही अनुमान लगाने के लिए।

तीसरा, एक ओवर-ओपनिंग पेनल्टी (Over-Opening Penalty) है। कभी-कभी, एक AI अक्षम या भ्रमित हो सकता है और वास्तव में उन्हें पढ़े बिना बस लाखों दस्तावेज़ खोल सकता है, इस उम्मीद में कि वह उत्तर पर ठोकर खा लेगा। SearchMaster इस व्यवहार को दंडित करता है। यह एक कोच की तरह है जो कहता है, "आप घर के हर दरवाजे को नहीं खोल सकते; आपको सही चाबी ढूंढनी होगी।" यह AI को कुशल होने के लिए मजबूर करता है, जिससे वह केवल तभी दस्तावेज़ खोलता है जब उसे वास्तव में नई जानकारी की आवश्यकता होती है।

इस सख्त प्रशिक्षण के परिणाम प्रभावशाली हैं। जब शोधकर्ताओं ने अपने तरीके का परीक्षण एक मानक AI मॉडल (विशेष रूप से एक Qwen3.5-9B बैकबोन) पर किया, तो गहरे-खोज (deep-search) समस्याओं को हल करने की मॉडल की क्षमता औसतन 38.19% से बढ़कर 51.52% हो गई। एक विशेष रूप से कठिन परीक्षण, जिसे BrowseComp-Plus कहा जाता है, पर सुधार जबरदस्त था, जो 30.1 अंक (30.12% से 60.24% तक) की छलांग लगा गया। सबसे अच्छी बात क्या है? AI ने यह सब खुद सीखा, बिना किसी मानव-लिखित उदाहरण या विशेषज्ञ प्रदर्शन के, एक स्थानीय खोज वातावरण का उपयोग करके। वास्तविक एविडेंस चेन में अपने सीखने को आधार बनाकर और अपने व्यवहार को विनियमित करके, SearchMaster दिखाता है कि AI खुद को एक बहुत बेहतर जासूस बनाने के लिए सिखा सकता है, बशर्ते उसे नियमों के अनुसार खेलना सिखाया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →