← नवीनतम पेपर
💻 computer science

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

यह शोध पत्र OpenRM को प्रस्तुत करता है, जो एक टूल-ऑगमेंटेड रिवॉर्ड मॉडल है जिसे ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन के माध्यम से प्रशिक्षित किया गया है ताकि लंबे-फॉर्म एजेंटिक कार्यों का सटीक मूल्यांकन करने के लिए बाहरी साक्ष्य का लाभ उठाया जा सके, जिससे डाउनस्ट्रीम LLM अलाइनमेंट और मूल्यांकन प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

प्रकाशित 2026-07-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लाइब्रेरियन (AI) है जो लंबी और विस्तृत रिपोर्ट लिखने में माहिर है। लेकिन कभी-कभी, यह लाइब्रेरियन चीजें बना लेता है या तथ्यों को गलत बताता है क्योंकि वह केवल अपने दिमाग के भीतर मौजूद जानकारी पर निर्भर रहता है, न कि अलमारियों में रखी वास्तविक किताबों को जाँचने पर।

इसे ठीक करने के लिए, हमें लाइब्रेरियन की रिपोर्टों को ग्रेड देने के लिए एक जज (Judge) की आवश्यकता है। अतीत में, ये जज उन छात्रों की तरह थे जिन्हें पूरी लाइब्रेरी को अपने दिमाग में याद करना पड़ता था। यदि प्रश्न किसी विशिष्ट, अज्ञात तथ्य या किसी नई चिकित्सा खोज के बारे में होता, तो जज अक्सर गलत अनुमान लगा देता क्योंकि उसके सामने सही "किताब" खुली नहीं होती थी।

OPENREWARD एक नए प्रकार का जज है जो केवल याददाश्त पर निर्भर नहीं करता है। यह एक जासूस की तरह है जिसके पास एक जादुई फोन है

यह कैसे काम करता है, यहाँ सरल रूप में दिया गया है:

1. समस्या: "केवल स्मृति" वाला जज

कल्पना कीजिए कि आप एक जज से दो लंबी यात्रा गाइडों की तुलना करने के लिए कहते हैं। एक गाइड कहता है, "पेरिस में एफिल टॉवर देखें," और दूसरी कहती है, "लंदन में एफिल टॉवर देखें।"

  • पुराने जज: वे केवल अनुमान लगा सकते हैं कि उन्हें क्या लगता है। यदि वे थके हुए हैं या प्रश्न कठिन है, तो वे यह पहचानने में विफल हो सकते हैं कि लंदन में कोई एफिल टॉवर नहीं है।
  • समस्या: लंबे, जटिल उत्तरों (जैसे चिकित्सा सलाह या वैज्ञानिक अनुसंधान) के लिए, अनुमान लगाना पर्याप्त नहीं है। आपको प्रमाण की आवश्यकता है।

2. समाधान: "जासूस" जज (OPENREWARD)

OPENREWARD अलग है। जब यह दो उत्तर देखता है, तो यह तुरंत एक को नहीं चुनता। इसके बजाय, यह कहता है, "रुको, मुझे पहले तथ्यों की जाँच करने की ज़रूरत है।"

  • जादुई फोन (टूल्स): इसके पास एक फोन है जो तुरंत विकिपीडिया को कॉल कर सकता है, वैज्ञानिक शोध पत्रों को खोज सकता है, या मेडिकल डेटाबेस देख सकता है।
  • जांच (Investigation): यह साक्ष्य एकत्र करने के लिए इन टूल्स का सक्रिय रूप से उपयोग करता है। यह वास्तविक डेटा क्या कहता है यह देखने के लिए "बैलेंस्ड विनो क्लासिफायर" या "मेडिकल सिम्पटम्स" खोज सकता है।
  • फैसला (Verdict): इस साक्ष्य को इकट्ठा करने के बाद ही यह तय करता है कि कौन सा उत्तर बेहतर है। यह एक ऐसे जज की तरह है जो वास्तविक पुलिस रिपोर्ट पढ़ने के बाद ही अपना फैसला सुनाने से इनकार कर देता है।

3. हमने जासूस को कैसे सिखाया (प्रशिक्षण)

आप कंप्यूटर को सिर्फ यह नहीं कह सकते कि, "जाओ एक जासूस बनो।" आपको इसे बिना विचलित हुए अपने टूल्स का उपयोग करना सिखाना होगा।

  • "नकली" लाइब्रेरी: शोधकर्ता इन जटिल कार्यों के लिए "अच्छे उत्तर बनाम बुरे उत्तर" के पर्याप्त वास्तविक उदाहरण नहीं ढूंढ सके। इसलिए, उन्होंने एक सिम्युलेटेड लाइब्रेरी (Simulated Library) बनाई।
    • उन्होंने एक वास्तविक दस्तावेज़ लिया (जैसे विकिपीडिया पेज)।
    • उन्होंने एक AI से उस पर एक प्रश्न लिखने के लिए कहा।
    • फिर, उन्होंने AI से दो उत्तर लिखने के लिए कहा:
      1. अच्छा उत्तर: AI को दस्तावेज़ पढ़ने की अनुमति दी गई।
      2. बुरा उत्तर: AI को दस्तावेज़ पढ़ने की अनुमति नहीं दी गई (इसलिए उसे अनुमान लगाना पड़ा या गलत जानकारी देनी पड़ी)।
  • सबक: उन्होंने इन जोड़ियों (अच्छे बनाम बुरे) को डिटेक्टिव जज को दिखाया और उसे सिखाया: "यदि तुम तथ्यों की जाँच करने के लिए अपने फोन का उपयोग करते हो, तो तुम्हें गोल्ड स्टार मिलेगा। यदि तुम केवल अनुमान लगाते हो, तो तुम्हें पेनल्टी मिलेगी।"
  • रिवॉर्ड सिस्टम: जज ने सीखा कि सबसे अच्छा स्कोर पाने के लिए, उसे सच खोजने के लिए अपने टूल्स का सही ढंग से उपयोग करना ही होगा, न कि केवल एक त्वरित अनुमान लगाना।

4. परिणाम: यह क्यों मायने रखता है

शोधकर्ताओं ने इस नए डिटेक्टिव जज का परीक्षण अन्य प्रसिद्ध जजों (जैसे GPT-4 या विशेष AI जज) के विरुद्ध किया।

  • बेहतर सटीकता: OPENREWARD विज्ञान, चिकित्सा और सामान्य ज्ञान में लंबे, जटिल उत्तरों में सच्चाई को पहचानने में बहुत बेहतर था।
  • बेहतर शिक्षक: उन्होंने अन्य AI को प्रशिक्षित करने में मदद करने के लिए OPENREWARD का उपयोग किया। अव्यवस्थित डेटा के ढेर से सबसे अच्छे उत्तरों को चुनने के लिए OPENREWARD का उपयोग करके, उन्होंने अन्य AI के सीखने के लिए एक "साफ" टेक्स्टबुक तैयार की। इस "साफ" डेटा के साथ प्रशिक्षित हुए AI अधिक स्मार्ट और विश्वसनीय बन गए।

सारांश उपमा (Summary Analogy)

पुराने AI जजों को उन छात्रों के रूप में सोचें जिन्हें बिना किसी पाठ्यपुस्तक के परीक्षा देनी होती है। उन्हें अनुमान लगाना पड़ता है।
OPENREWARD वह छात्र है जिसे परीक्षा के दौरान लाइब्रेरी और इंटरनेट का उपयोग करने की अनुमति है। क्योंकि यह उत्तर खोजने के लिए देख सकता है, इसलिए इसे बहुत अधिक स्कोर मिलता है और यह पूरी कक्षा को बेहतर तरीके से सीखने में मदद करता है।

पेपर का दावा है कि यह तरीका जटिल कार्यों के लिए AI मूल्यांकन को अधिक विश्वसनीय बनाता है और बेहतर AI मॉडल को प्रशिक्षित करने में मदद करता है, लेकिन यह कहने से बचता है कि यह अध्ययन में परीक्षण किए गए विशिष्ट भविष्य के अनुप्रयोगों जैसे वास्तविक दुनिया के क्लिनिकल डायग्नोसिस के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →