← नवीनतम पेपर
🤖 machine learning

Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents

यह शोध पत्र स्टेप-लेवल सेल्फ-डिस्टिल्ड पॉलिसी ऑप्टिमाइज़ेशन (SSPO) प्रस्तुत करता है, जो एक नवीन ढांचा है जो वेब-एक्सट्रैक्टेड एविडेंस एंकर्स और स्टेप-लेवल एडवांटेज वेट्स का लाभ उठाकर डीप सर्च एजेंट्स के प्रशिक्षण में सूचना विषमता को हल करता है, जिससे क्रेडिट असाइनमेंट में सुधार होता है और न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ मानक GRPO से बेहतर प्रदर्शन होता है।

मूल लेखक: Haoze Wu, Chuqiao Kuang, Tianyi Zhuang, Xiaoguang Li

प्रकाशित 2026-08-14
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Haoze Wu, Chuqiao Kuang, Tianyi Zhuang, Xiaoguang Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक कुशल जासूस बनना सिखा रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस रोबोट को "एजेंट" कहा जाता है, और इसका काम इंटरनेट खोजने, पन्ने पढ़ने और कड़ियों को जोड़ने के माध्यम से जटिल पहेलियों को सुलझाना है। इसमें वास्तव में माहिर होने के लिए, रोबोट को अभ्यास करने की आवश्यकता होती है, लेकिन पेचीदा बात यह है कि आमतौर पर शिक्षक केस के बिल्कुल अंत में ही ग्रेड देता है। यदि रोबोट रहस्य सुलझा लेता है, तो उसे एक गोल्ड स्टार मिलता है; यदि वह विफल हो जाता है, तो उसे शून्य मिलता है। समस्या यह है कि रहस्य सुलझाने में पचास कदम लग सकते थे। क्या रोबोट अंतिम सुराग छूट जाने के कारण विफल हुआ? या क्या तीसरे कदम पर हुई एक छोटी सी गलती ने सब कुछ बर्बाद कर दिया? केवल खेल के अंत के स्कोर के साथ, रोबोट अंधेरे में हाथ पैर मार रहा है, यह अनुमान लगाने की कोशिश कर रहा है कि कौन से कदम अच्छे थे और कौन से बुरे। यह स्मार्ट सर्च एजेंट बनाने के लिए एक बहुत बड़ी बाधा है।

इसे ठीक करने के लिए, वैज्ञानिकों ने "सेल्फ-डिस्टिलेशन" (self-distillation) नामक एक तकनीक आज़माई है। इसे ऐसे समझें कि रोबोट अपने ही एक "घोस्ट" (भूतिया) संस्करण से सीखने की कोशिश कर रहा है जो पहले से ही उत्तर जानता है। घोस्ट (शिक्षक) समाधान और सुरागों को देखता है, जबकि असली रोबोट (छात्र) को शुरुआत से सब कुछ समझना पड़ता है। विचार यह है कि छात्र को शिक्षक की सोच की नकल करनी चाहिए। हालाँकि, इंटरनेट की इस अव्यवस्त और खुली दुनिया में, यह अक्सर उल्टा पड़ जाता है। शिक्षक, उत्तर जानते हुए, एक शॉर्टकट लेता है और तीन चरणों में मामला सुलझा लेता है। छात्र, इस शॉर्टकट को कॉपी करने की कोशिश में, शॉर्टकट लेना भी सीख जाता है, जिससे वह वास्तव में खोजने की मेहनत करना छोड़ देता है। यह एक छात्र की तरह है जो किताबें पढ़े बिना शिक्षक के अंतिम निबंध की नकल करता है; उन्हें सही शब्द तो मिल जाते हैं लेकिन वे शोध करने का तरीका नहीं सीख पाते।

यह शोध पत्र इन जासूसी रोबोटों को प्रशिक्षित करने का एक नया तरीका पेश करता है, जिसे SSPO (स्टेप-लेवल सेल्फ-डिस्टिल्ड पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। रोबोट को केवल शिक्षक के शॉर्टकट की नकल करने देने के बजाय, लेखकों ने एविडेंस एंकर्स (Evidence Anchors) नामक एक विशेष उपकरण बनाया है। कल्पना कीजिए कि ये वे स्टिकी नोट्स हैं जो शिक्षक डेस्क पर छोड़ देता है। वे अंतिम उत्तर नहीं बताते; इसके बजाय, वे जांच के प्रत्येक चरण में आवश्यक विशिष्ट, महत्वपूर्ण साक्ष्य को हाइलाइट करते हैं। उदाहरण के लिए, "संदिग्ध पेरिस में है" कहने के बजाय, एक स्टिकी नोट कह सकता है, "मंगलवार के फ्लाइट लॉग्स की जाँच करें।"

जादू इस बात में है कि रोबोट इन नोट्स से कैसे सीखता है। लेखकों ने महसूस किया कि यदि रोबोट पहले से ही किसी केस को सही ढंग से सुलझा रहा है, तो उसे अपनी शैली बदलने के लिए मजबूर नहीं किया जाना चाहिए। इसलिए, SSPO इस विशेष शिक्षण पद्धति का उपयोग केवल तभी करता है जब रोबोट किसी केस में विफल होता है। जब रोबोट विफल हो जाता है, तो सिस्टम रोबोट के बिखरे हुए खोज पथ की तुलना शिक्षक के "एविडेंस एंकर्स" से करता है। यदि रोबोट ने उस महत्वपूर्ण साक्ष्य को मिस कर दिया जिसे शिक्षक ने हाइलाइट किया था, तो सिस्टम उस विशिष्ट चरण को एक बड़ा "पेनल्टी" (एक कठिन सबक) देता है। यदि रोबोट ने एक अजीब रास्ता लिया लेकिन फिर भी एक उपयोगी सुराग ढूंढ लिया, तो सिस्टम उसे ढील देता है।

महत्वपूर्ण रूप से, यह शोध पत्र दिखाता है कि यह विधि न केवल रोबोट को स्मार्ट बनाती है; यह इसे एक बेहतर खोजकर्ता भी बनाती है। रोबोट सही सबूत खोजने के लिए सटीक, लक्षित प्रश्न पूछना सीखता है, बजाय इसके कि वह व्यापक, अस्पष्ट जाल फेंके। तीन अलग-अलग चुनौतीपूर्ण सर्च बेंचमार्क (BrowseComp, GAIA, और FRAMES) पर परीक्षणों में, इस नई विधि ने रोबोट को तेजी से सीखने और बेहतर प्रदर्शन करने में मदद की। वास्तव में, इस नई विधि के साथ 100 चरणों तक प्रशिक्षित रोबोट ने पुरानी विधि के साथ 200 चरणों तक प्रशिक्षित रोबोट से बेहतर प्रदर्शन किया। लेखक सुझाव देते हैं कि केवल अंतिम ग्रेड के बजाय प्रत्येक खोज चरण की गुणवत्ता पर ध्यान केंद्रित करके, हम ऐसे एजेंट बना सकते हैं जो केवल भाग्यशाली अनुमान लगाने वाले नहीं, बल्कि वास्तविक, कुशल अन्वेषक हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →