← नवीनतम पेपर
🤖 AI

Owen-Shapley Policy Optimization: A Principled RL Algorithm for Generative Search LLMs

यह शोध पत्र ओवेन-शापली पॉलिसी ऑप्टिमाइज़ेशन (OSPO) को प्रस्तुत करता है, जो एक सिद्धांत-आधारित सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो शापली-ओवेन एट्रिब्यूशंस का उपयोग करके अनुक्रम-स्तरीय पुरस्कारों को अर्थपूर्ण रूप से सुसंगत टोकन में पुनर्वितरित करके जेनेरेटिव सर्च LLMs में क्रेडिट असाइनमेंट अंतराल को संबोधित करता है, जिससे बिना किसी पैरामीट्रिक वैल्यू मॉडल की आवश्यकता के प्रदर्शन और मजबूती में सुधार होता है।

मूल लेखक: Abhijnan Nath, Alireza Bagheri Garakani, Tianchen Zhou, Fan Yang, Yan Gao, Nikhil Krishnaswamy

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abhijnan Nath, Alireza Bagheri Garakani, Tianchen Zhou, Fan Yang, Yan Gao, Nikhil Krishnaswamy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "ओवेन-शैपली पॉलिसी ऑप्टिमाइज़ेशन" (OSPO) के पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: "ग्रुप ग्रेड" की गलती

कल्पना कीजिए कि आप एक छात्र के निबंध को ग्रेड दे रहे हैं। पुराने तरीके से AI को प्रशिक्षित करने में (विशेष रूप से GRPO नामक एक विधि में), शिक्षक निबंध के बिल्कुल अंत में केवल एक एकल ग्रेड देता है।

  • परिदृश्य: छात्र एक लंबा पैराग्राफ लिखता है। शिक्षक उसे पढ़ता है और कहता है, "बहुत बढ़िया! +10 अंक।"
  • खामी: शिक्षक छात्र को यह नहीं बताता कि किन वाक्यों ने वे अंक अर्जित किए। क्या शुरुआती वाक्य ने काम बनाया? क्या बीच का पैराग्राफ महत्वपूर्ण था? या क्या निष्कर्ष ने मदद की?
  • परिणाम: छात्र सोचता है कि उन्होंने जो कुछ भी लिखा वह समान रूप से शानदार था। वे शायद वही लंबे, भ्रामक वाक्य लिखना जारी रखेंगे जो काम के नहीं हैं, या वे गलती से उस एक सटीक वाक्य को हटा सकते हैं जो उन्होंने लिखा था, यह सोचकर कि उसका कोई महत्व नहीं था। वे "अनुमान" लगा रहे हैं कि क्या काम आया क्योंकि उन्हें केवल पूरे समूह के लिए एक स्कोर मिला, न कि व्यक्तिगत हिस्सों के लिए।

AI शॉपिंग असिस्टेंट की दुनिया में, इसका मतलब है कि AI को यह नहीं पता होता कि उसके सर्च क्वेरी (खोज शब्द) के कौन से विशिष्ट शब्दों ने वास्तव में सही उत्पाद खोजने में मदद की। उसे बस इतना पता है कि पूरी क्वेरी को "अच्छा" या "बुरा" स्कोर मिला।

समाधान: OSPO (एक "फेयर शेयर" कैलकुलेटर)

लेखक OSPO नामक एक नई विधि पेश करते हैं। पूरे निबंध को एक ग्रेड देने के बजाय, OSPO एक सुपर-फेयर अकाउंटेंट की तरह काम करता है जो बिल्कुल इस बात का विवरण देता है कि प्रत्येक वाक्य ने अंतिम स्कोर में कितना योगदान दिया।

वे गेम थ्योरी की एक गणितीय अवधारणा का उपयोग करते हैं जिसे ओवेन-शैपली वैल्यूज (Owen-Shapley values) कहा जाता है। यहाँ इसका उदाहरण है:

कल्पना कीजिए कि दोस्तों का एक समूह (AI के वाक्य में शब्द या वाक्यांश) एक पुरस्कार जीतने (सही उत्पाद खोजने) की कोशिश कर रहा है।

  1. प्रयोग: AI इन दोस्तों के विभिन्न संयोजनों को आज़माता है। कभी-कभी यह केवल पहले दोस्त को भेजता है। कभी-कभी यह पहले दो को भेजता है। कभी-कभी यह पूरे समूह को भेजता है।
  2. मापन: हर बार जब एक नया दोस्त समूह में शामिल होता है, तो AI जाँचता है: "क्या पुरस्कार इसलिए बेहतर हुआ क्योंकि यह विशिष्ट दोस्त शामिल हुआ?"
  3. गणना: यदि वाक्यांश "ब्लू ड्रेस" (नीली ड्रेस) सर्च रिजल्ट को "औसत" से "परफेक्ट" बना देता है, तो उस वाक्यांश को श्रेय का एक बड़ा हिस्सा मिलता है। यदि वाक्यांश "उम, शायद" कुछ भी नहीं बदलता है, तो उसे शून्य क्रेडिट मिलता है।

यह एक पोटलक डिनर (Potluck Dinner) की तरह है। यदि आप एक स्वादिष्ट व्यंजन लाते हैं जिससे पूरी पार्टी हिट हो जाती है, तो आपको सबसे अधिक प्रशंसा मिलती है। यदि आप सादे बिस्कुट का कटोरा लाते हैं जिसे कोई नोटिस भी नहीं करता, तो आपको दोष तो नहीं दिया जाता, लेकिन आपको श्रेय भी नहीं मिलता। OSPO यह पता लगा लेता है कि व्यंजन कौन लाया था।

यह वास्तविक जीवन में कैसे काम करता है (शॉपिंग)

मान लीजिए आप AI को कहते हैं: "मुझे सर्दियों के लिए एक काला कोट चाहिए।"

  • पुराना तरीका (GRPO): AI एक लंबा, फैंसी वाक्य बनाता है। इसे एक अच्छा स्कोर मिलता है क्योंकि इसने एक कोट ढूँढ लिया। AI सोचता है, "मैं लंबे वाक्य लिखने में बहुत अच्छा हूँ!" और वह इसे जारी रखता है, भले ही लंबाई से कोई मदद न मिल रही हो।
  • नया तरीका (OSPO): AI अपने वाक्य को टुकड़ों में तोड़ देता है: "काला," "कोट," "सर्दियों," "गर्म," "जैकेट।"
    • यह परीक्षण करता है: "अगर मैं सिर्फ 'काला' कहूँ तो क्या होगा?" (बुरा परिणाम)।
    • यह परीक्षण करता है: "अगर मैं 'काला कोट' कहूँ तो क्या होगा?" (अच्छा परिणाम)।
    • यह परीक्षण करता है: "अगर मैं 'काला कोट सर्दियों' कहूँ तो क्या होगा?" (शानदार परिणाम)।
    • फैसला: OSPO को एहसास होता है कि "सर्दियों" ने बहुत मूल्य जोड़ा, लेकिन "जैकेट" केवल अतिरिक्त शोर (noise) था। यह "जीतने वाले" शब्दों को अधिक "पॉइंट्स" (ग्रेडिएंट अपडेट) देता है और AI को यह सीखने के लिए कहता है कि "सर्दियों" का बेहतर उपयोग कैसे किया जाए, जबकि फालतू शब्दों को अनदेखा किया जाए।

यह क्यों महत्वपूर्ण है

  1. तेजी से सीखना: क्योंकि AI को पता है कि कौन से शब्द काम आए, इसलिए वह बहुत तेज़ी से सीखता है। पेपर दिखाता है कि यह पुराने तरीके की तुलना में लगभग आधे समय में उच्च प्रदर्शन तक पहुँच जाता है।
  2. "चीट कोड्स" का अभाव: कभी-कभी AI "गलत तरीके से स्मार्ट" हो जाता है। उसे लग सकता है कि बहुत लंबा, भ्रमित करने वाला पैराग्राफ लिखने से सिस्टम को उच्च स्कोर दिलाने में मदद मिलेगी (इसे "रिवॉर्ड हैकिंग" कहा जाता है)। OSPO इसे रोकता है क्योंकि यह हर छोटे हिस्से की जाँच करता है। यदि अतिरिक्त शब्द वास्तव में उत्पाद खोजने में मदद नहीं करते हैं, तो उन्हें कोई क्रेडिट नहीं मिलता, इसलिए AI उन्हें लिखना बंद कर देता है।
  3. "क्रिटिक" के बिना काम करना: आमतौर पर, विस्तृत फीडबैक देने के लिए, आपको एक दूसरे AI (एक "क्रिटिक") की आवश्यकता होती है जो पहले वाले को देखता रहे। OSPO चतुर है क्योंकि यह सर्च रिजल्ट्स का उपयोग करके ही क्रेडिट वितरण का पता लगा लेता है, इसलिए इसे उस अतिरिक्त, महंगे दूसरे AI की आवश्यकता नहीं होती।

"टीमवर्क" का मोड़ (कोलिशन/Coalitions)

पेपर में उल्लेख है कि शब्द तब सबसे अच्छा काम करते हैं जब वे कंटीगुअस कोलिशन (contiguous coalitions) में होते हैं (ऐसे शब्द जो एक-दूसरे के बगल में होते हैं)।

इसे एक रिले रेस की तरह समझें।

  • अच्छा: दौड़ 1 से दौड़ 2 और फिर दौड़ 3 तक बैटन (baton) सुचारू रूप से पास किया जाता है। वे एक टीम के रूप में काम करते हैं।
  • बुरा: यदि आप दौड़ 2 को छोड़ देते हैं और 1 से सीधे 3 को बैटन पास करते हैं, तो टीम बिखर जाती है।

OSPO केवल उन शब्दों को देखता है जो एक-दूसरे के बगल में खड़े हैं (जैसे "काला कोट"), न कि वाक्य में बिखरे हुए यादृच्छिक (random) शब्दों को। यह अर्थ को स्पष्ट रखता है और सुनिश्चित करता है कि AI सुसंगत, तार्किक वाक्यांश बनाना सीखे।

सारांश

OSPO शॉपिंग सिफारिशों जैसे कार्यों के लिए AI को प्रशिक्षित करने का एक स्मार्ट तरीका है। AI को उसके पूरे उत्तर के लिए एक एकल ग्रेड देने के बजाय, यह एक जासूस की तरह काम करता है, जो यह पता लगाता है कि किन शब्दों ने इनाम अर्जित किया। इससे AI तेजी से सीखता है, अंक पाने के लिए बकवास लिखना टालता है, और यह समझने में बहुत बेहतर बनता है कि आप वास्तव में क्या खरीदना चाहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →