← नवीनतम पेपर
🤖 AI

STAMP: Provenance-Guided Credit Assignment for Deep Search Agents

STAMP एक प्रोवेनेंस-गाइडेड क्रेडिट असाइनमेंट तंत्र पेश करके डीप-सर्च एजेंटों में रिवॉर्ड-क्रेडिट मिसमैच को संबोधित करता है जो सहायक दस्तावेजों को उनके एक्सपोजिंग एक्शन्स तक ट्रैक करता है और साइन-प्रिजर्विंग मॉड्यूलेशन के माध्यम से एडवांटेज को पुनर्वितरित करता है, जिससे कई बेंचमार्क पर GRPO बेसलाइनों की तुलना में प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Ke Xu, Han Xu, Xinran Chen, Yuqian Wang, Zhixuan Li, Xiaojian Liu, Changwo Wu, Jianqiang Xia, Yuchen Li

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ke Xu, Han Xu, Xinran Chen, Yuqian Wang, Zhixuan Li, Xiaojian Liu, Changwo Wu, Jianqiang Xia, Yuchen Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट डिजिटल जासूस को इंटरनेट पर पेचीदा रहस्यों को सुलझाने के लिए प्रशिक्षित कर रहे हैं। यह जासूस, जिसे "डीप-सर्च एजेंट" कहा जाता है, केवल अनुमान नहीं लगाता; यह सुरागों की तलाश करता है, वेबपेजों को पढ़ता है और सवाल का जवाब देने के लिए सबूतों को जोड़ता है। लंबे समय तक, इन जासूसों को सिखाने का तरीका कुछ ऐसा था जैसे किसी पूरी फिल्म को केवल उसके अंतिम दृश्य के आधार पर ग्रेड देना। यदि जासूस अंत में सही उत्तर तक पहुँच जाता था, तो पूरी फिल्म को एक गोल्ड स्टार मिलता था। यदि वह गलत उत्तर देता था, तो उसे एक लाल "F" ग्रेड मिलता था।

लेकिन यह एक समस्या है: कभी-कभी जासूस फिल्म के बीच में एक शानदार सुराग ढूंढ लेता है लेकिन बाद में भ्रमित होने के कारण अंतिम उत्तर गलत कर देता है। अन्य मामलों में, वह बिना वास्तविक सबूत खोजे ही भाग्य से सही उत्तर तक पहुँच जाता है। पुराना तरीका अंतर नहीं कर पाता था। यह जासूस के हर कदम को समान क्रेडिट (या दोष) देता था, चाहे वे कदम कितने भी बेकार क्यों न हों। लेखक इस समस्या को "रिवॉर्ड-क्रेडिट मिसमैच" (reward-credit mismatch) कहते हैं। यह एक शिक्षक की तरह है जो एक छात्र को पूरे निबंध के लिए फेल कर देता है क्योंकि उसका निष्कर्ष गलत था, भले ही छात्र ने बीच में तीन बेहतरीन शोध पैराग्राफ लिखे हों।

बड़ी अवधारणा: STAMP
शोधकर्ता एक नई प्रशिक्षण विधि प्रस्तावित करते हैं जिसे STAMP (स्टेप-लेवल ट्रेस-गाइडेड एडवांटेज मॉड्यूलेशन विद प्रोवेनेंस) कहा जाता है। STAMP को एक सुपर-ऑब्ज़र्वेंट फिल्म क्रिटिक की तरह समझें जो जासूस की फिल्म को फ्रेम-दर-फ्रेम देखता है।

केवल अंतिम उत्तर देखने के बजाय, STAMP दो विशिष्ट प्रश्न पूछता है:

  1. क्या जासूस ने वास्तव में सही सबूत ढूँढा? (क्या उन्होंने वह विशिष्ट व्यक्ति या तथ्य ढूँढा जिसकी वे तलाश कर रहे थे?)
  2. कौन सा विशिष्ट कदम उस सबूत को पहली बार प्रकट करता है? (क्या उन्होंने इसे तब पाया जब उन्होंने एक सर्च क्वेरी टाइप की, या जब उन्होंने एक लिंक पर क्लिक किया?)

STAMP एक "रेफरेंस-बेस्ड वेरीफायर" (reference-based verifier) का उपयोग करता है—जो मूल रूप से एक स्मार्ट चेकर है जो जासूस द्वारा खोजे गए दस्तावेजों को देखता है और पूछता है, "क्या यह दस्तावेज़ वास्तव में उस तथ्य को सिद्ध करता है जिसकी हमें आवश्यकता है?" यदि वह करता है, तो STAMP उस दस्तावेज़ को उस सटीक क्षण तक ट्रैक करता है जब जासूस ने उसे पहली बार देखा था। उस विशिष्ट क्षण को "क्रेडिट बूस्ट" मिलता है।

फिल्म को खराब किए बिना यह कैसे काम करता है
यहाँ चतुर हिस्सा है: STAMP फिल्म के अंतिम ग्रेड को नहीं बदलता है। यदि जासूस अभी भी अंतिम उत्तर गलत देता है, तो फिल्म अभी भी एक विफलता है। लेकिन, STAMP "स्पेशल साइन-प्रिजर्विंग एडवांटेज मॉड्यूलेशन" (sign-preserving advantage modulation) का उपयोग करके प्रशिक्षण को ट्यून करता है।

कल्पना कीजिए कि जासूस एक रोलरकोस्टर पर है। यदि सवारी सफल रही (पॉजिटिव एडवांटेज), तो STAMP उन विशिष्ट क्षणों को थोड़ा अतिरिक्त बढ़ावा देता है जहाँ उन्होंने अच्छे सुराग पाए, जिससे वे कदम और भी अधिक पुरस्कृत महसूस होते हैं। यदि सवारी एक दुर्घटना थी (नेगेटिव एडवांटेज), तो STAMP अच्छे कदमों को उतनी कठोरता से दंडित नहीं करता है। यह कहता है, "ठीक है, आप मिशन में विफल रहे, लेकिन वह एक सर्च क्वेरी जो आपने की थी वह वास्तव में शानदार थी—आइए उस सबक को मिटा न दें।" यह सुनिश्चित करता है कि जासूस ठीक से सीख सके कि कौन से सर्च मूव काम करते हैं, बिना अंतिम परिणाम के साथ सबक को भ्रमित किए।

यह पेपर क्या नहीं है
लेखक इस बात को लेकर बहुत स्पष्ट हैं कि यह विधि क्या नहीं है। वे इस विचार का खंडन करते हैं कि हमें खोज के प्रत्येक चरण के लिए जटिल नई रिवॉर्ड सिस्टम बनाने की आवश्यकता है। वे इस विचार को भी खारिज करते हैं कि हमें बिना प्रमाण के यह अनुमान लगाने की आवश्यकता है कि कौन से मूव अच्छे थे। STAMP सिद्ध सबूतों पर निर्भर करता है: यदि दस्तावेज़ वहां नहीं है, या यदि वेरीफायर कहता है कि यह तथ्य का समर्थन नहीं करता है, तो कोई क्रेडिट नहीं दिया जाता है। वे स्पष्ट रूप से कहते हैं कि चरणों में रैंडम बोनस जोड़ना काम नहीं करता क्योंकि पुराने सिस्टम उन्हें फिर से औसत निकाल देते हैं।

परिणाम: क्या यह काम करता है?
टीम ने STAMP का परीक्षण तीन अलग-अलग चैलेंज सेट्स पर किया: BrowseComp, BrowseComp-ZH (एक चीनी संस्करण), और xbench-DS। उन्होंने बिल्कुल उसी शुरुआती मॉडल, समान प्रशिक्षण डेटा और समान सर्च टूल्स का उपयोग करके एक मानक प्रशिक्षण विधि GRPO के विरुद्ध इसकी तुलना की।

परिणामों ने दिखाया कि STAMP ने लगातार जासूस के प्रदर्शन में सुधार किया:

  • BrowseComp पर, सटीकता +2.0 अंक बढ़ गई।
  • BrowseComp-ZH पर, यह +5.5 अंक उछल गया।
  • xbench-DS पर, इसमें +3.0 का सुधार हुआ।

पेपर सुझाव देता है कि ये लाभ इसलिए होते हैं क्योंकि STAMP "छिपे हुए रत्नों" (hidden gems) को पकड़ लेता है—वे चरण जिन्होंने विफल प्रयासों में भी उपयोगी सबूत खोजे, जिन्हें पुरानी विधि अनदेखा कर देती थी। वास्तव में, उन्होंने पाया कि सही प्रयासों में, 83.5% चरण वास्तव में कोई उपयोगी सबूत नहीं दे रहे थे, जबकि गलत प्रयासों में, 7.0% चरणों ने वास्तव में उपयोगी सुराग खोजे थे। STAMP इसे इस प्रकार ठीक करता है कि अंतिम परिणाम की परवाह किए बिना उपयोगी चरणों को पुरस्कृत किया जाए।

वे कितने आश्वस्त हैं?
लेखक इन नंबरों के बारे में आश्वस्त हैं क्योंकि उन्होंने नियंत्रित प्रयोग किए जहाँ प्रशिक्षण विधि को छोड़कर सब कुछ समान था। उन्होंने "एब्लेशन स्टडीज" (ablation studies) भी चलाईं (जो मशीन को यह देखने के लिए अलग करने जैसा है कि कौन सा हिस्सा क्या करता है) और पाया कि STAMP का हर हिस्सा—वेरीफायर, पहले एक्सपोज़र को ट्रैक करना, और विशेष मॉड्यूलेशन—सफलता में योगदान देता है।

हालाँकि, वे एक सीमा भी नोट करते: उन्होंने इसे केवल एक विशिष्ट मॉडल आकार (Qwen3-30B) पर टेस्ट किया है। वे सुझाव देते हैं कि जबकि यह वहां अच्छी तरह काम करता है, यह अभी तक सिद्ध नहीं हुआ है कि क्या यह विधि बहुत बड़े मॉडलों (जैसे 70B+) पर भी उतना ही अच्छा काम करती है। इसलिए, जबकि उनके द्वारा किए गए परीक्षणों के लिए परिणाम ठोस हैं, बड़े दिमागों के लिए इसकी पूर्ण क्षमता अभी भी एक खुला प्रश्न है।

संक्षेप में, STAMP जासूसों को केवल मंजिल के बजाय यात्रा की सराहना करना सिखाता है, उन विशिष्ट कदमों को क्रेडिट देकर जो वास्तव में सच्चाई को उजागर करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →