← नवीनतम पेपर
💬 NLP

Negative Advantage Is a Double-Edged Sword: Calibrating Advantage in GRPO for Deep Search

यह शोध पत्र CalibAdv को प्रस्तुत करता है, जो एक नवीन एडवांटेज कैलिब्रेशन विधि है जो मध्यवर्ती चरण की शुद्धता के आधार पर अत्यधिक नकारात्मक एडवांटेज के सूक्ष्म डाउनस्केलिंग और एडवांटेज वितरण को पुनर्संतुलित करके डीप सर्च एजेंटों में ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) की अस्थिरता और प्रदर्शन ह्रास को कम करता है।

मूल लेखक: Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li

प्रकाशित 2026-04-21
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यह रोबोट को फॉर्मेट को लेकर भ्रमित होने से रोकता है और उसे वास्तविक सोच पर केंद्रित रखता है।

परिणाम

CalibAdv के साथ, रोबोट जासूस:

  • तेजी से सीखता है: उसे उठाए गए अच्छे कदमों के लिए श्रेय मिलता है।
  • मानसिक संतुलन बनाए रखता है: वह घबराकर बड़बड़ाने (gibberish) नहीं लगता।
  • कठिन मामलों को सुलझाता है: वह पहले की तुलना में कठिन प्रश्नों पर बहुत बेहतर प्रदर्शन करता है।

संक्षेप में: यह पेपर हमें सिखाता है कि जब जटिल, बहु-चरणीय कार्यों (multi-step tasks) के लिए AI को प्रशिक्षित किया जाता है, तो आप केवल अंतिम विफलता को ही दंडित नहीं कर सकते। आपको बीच में उठाए गए अच्छे कदमों के प्रति निष्पक्ष होना होगा, अन्यथा AI हार मान लेगा और ठीक से काम करना बंद कर देगा। CalibAdv वह उपकरण है जो उस निष्पक्षता को संभव बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →