← नवीनतम पेपर
💬 NLP

Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization

यह शोध पत्र 'पर्सनलाइज्ड रिवॉर्डबेंच' (Personalized RewardBench) का परिचय देता है, जो एक नया बेंचमार्क है जो सख्त रूब्रिक्स का उपयोग करके व्यक्तिगत उपयोगकर्ता प्राथमिकताओं के साथ संरेखित होने की क्षमता पर रिवॉर्ड मॉडल्स का मूल्यांकन करता है, यह प्रदर्शित करते हुए कि वर्तमान अत्याधुनिक मॉडल वैयक्तिकरण (personalization) में संघर्ष करते हैं और यह बेंचमार्क डाउनस्ट्रीम प्रदर्शन की भविष्यवाणी करने में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Qiyao Ma, Dechen Gao, Rui Cai, Boqi Zhao, Hanchu Zhou, Junshan Zhang, Zhe Zhao

प्रकाशित 2026-04-09
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Qiyao Ma, Dechen Gao, Rui Cai, Boqi Zhao, Hanchu Zhou, Junshan Zhang, Zhe Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप लाखों ग्राहकों वाले एक विशाल रेस्तरां के लिए एक पर्सनल शेफ हैं। आपका काम ऐसे व्यंजन बनाना है जिन्हें हर कोई पसंद करता है।

लंबे समय से, रेस्तरां के "हेड शेफ" (AI) को पूरी तरह से सुरक्षित और सार्वभौमिक रूप से स्वादिष्ट भोजन पकाने के लिए प्रशिक्षित किया गया है। यदि आप बर्गर मांगते हैं, तो AI आपको एक ऐसा बर्गर देगा जो बिल्कुल सही तापमान पर पका हुआ है, जिसे सही ढंग से सीजन किया गया है और एक साफ प्लेट पर परोसा गया है। इसे हम "जनरल अलाइनमेंट" कहते हैं। यह अच्छा है, लेकिन यह उबाऊ है। इसे यह नहीं पता कि आपको अचार पसंद नहीं है, या आप अपना स्टेक 'रेयर' (कम पका हुआ) पसंद करते हैं, या आप डाइट पर हैं और आपको सलाद की जरूरत है।

समस्या यह है कि भोजन का न्याय करने के लिए उपयोग किए जाने वाले वर्तमान टेस्ट टेस्टर्स (रिवॉर्ड मॉडल्स) भी केवल "पूरी तरह से सुरक्षित" बर्गर की ही तलाश कर रहे हैं। वे यह अंतर नहीं कर सकते कि एक बर्गर तकनीकी रूप से उत्तम है या वह आपके विशिष्ट स्वाद के लिए एकदम सही है।

नया विचार: "पर्सनलाइज्ड रिवॉर्डबेंच" (Personalized RewardBench)

लेखकों ने एक नया, अत्यंत सख्त टेस्ट टेस्ट बनाया है जिसे पर्सनलाइज्ड रिवॉर्डबेंच कहा जाता है। यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं का उपयोग किया गया है:

1. "जुड़वां" व्यंजन (चुना गया बनाम खारिज किया गया)

पुराने परीक्षणों में, टेस्ट टेस्टर्स को दो व्यंजन दिए जाते थे: एक शानदार बर्गर, और दूसरा जला हुआ, नमकीन और खराब खाना। विजेता को चुनना आसान था।

इस नए परीक्षण में, लेखकों ने दो ऐसे व्यंजन बनाए जो दोनों ही शानदार (गॉरमेट) हैं

  • व्यंजन A (विजेता): एक बर्गर ठीक वैसे ही बनाया गया जैसा आपको पसंद है (बिना अचार के, एक्स्ट्रा स्पाइसी, और साथ में फ्राइज़)।
  • व्यंजन B (हारने वाला): एक बर्गर ठीक वैसा ही जैसा बाकी सभी को पसंद है (मानक, अचार के साथ, बिना किसी तीखेपन के)।

दोनों व्यंजन स्वादिष्ट, सुरक्षित और अच्छी तरह से पकाए गए हैं। एकमात्र अंतर यह है कि व्यंजन A आपके विशिष्ट व्यक्तित्व के अनुकूल है, जबकि व्यंजन B उसे अनदेखा करता है।

2. AI के लिए चुनौती

लेखकों ने वर्तमान शीर्ष AI "टेस्ट टेस्टर्स" से इन दोनों व्यंजनों को देखने और यह चुनने के लिए कहा कि कौन सा आपके लिए सही है।

  • परिणाम: AI को इसमें संघर्ष करना पड़ा! यहाँ तक कि सबसे स्मार्ट AI भी केवल लगभग 76% उत्तर सही दे पाए। वे "मानक" बर्गर को चुनते रहे क्योंकि वह अधिक "सुरक्षित" और सामान्य रूप से सही लग रहा था, वे यह समझने में विफल रहे कि आपको विशेष रूप से तीखा बर्गर चाहिए था।

3. क्रिस्टल बॉल (डाउनस्ट्रीम वैलिडेशन)

यहाँ सबसे महत्वपूर्ण हिस्सा है। लेखक यह जानना चाहते थे कि: "क्या इस नए टेस्ट में अच्छा स्कोर करने का वास्तव में मतलब यह है कि AI भविष्य में आपके लिए बेहतर भोजन पकाएगा?"

उन्होंने इसे वास्तविक उपयोगकर्ताओं के लिए दो अलग-अलग तरीकों से AI को "पकाने" (उत्तर उत्पन्न करने) के लिए देकर टेस्ट किया:

  • मेथड A (बेस्ट-ऑफ-एन): AI 16 अलग-अलग बर्गर बनाता है और उनमें से सबसे अच्छा चुनता है।
  • मेथड B (PPO): AI अपनी गलतियों से सीखता है और समय के साथ बेहतर खाना बनाना सीखता है।

उन्होंने एक जादुई संबंध पाया: वे AI मॉडल जिन्होंने इस नए "पर्सनलाइज्ड टेस्ट" में उच्च स्कोर किया था, वे ही थे जिन्होंने बाद में वास्तविक उपयोगकर्ताओं के लिए सबसे अच्छा भोजन पकाया। पुराने परीक्षण एक खराब क्रिस्टल बॉल की तरह थे—वे भविष्यवाणी नहीं कर सकते थे कि कौन सा शेफ आपके लिए अच्छा होगा। यह नया टेस्ट एक ऐसी क्रिस्टल बॉल है जो काम करती है।

मुख्य निष्कर्ष

इस पेपर को AI के लिए एक नए ड्राइवर लाइसेंस टेस्ट के रूप में समझें।

  • पुराना टेस्ट: "क्या आप पेड़ से टकराए बिना कार चला सकते हैं?" (सामान्य सुरक्षा)।
  • नया टेस्ट: "क्या आप कार बिल्कुल उसी तरह चला सकते हैं जैसे आपका यात्री चाहता है? क्या उन्हें तेज़ त्वरण पसंद है? क्या उन्हें स्मूथ टर्न पसंद हैं? क्या वे रेडियो से नफरत करते हैं?"

यह पेपर सिद्ध करता है कि:

  1. वर्तमान AI सुरक्षित रूप से चलाने में बहुत अच्छा है, लेकिन आपके तरीके से चलाने में बहुत बुरा है।
  2. हमें AI को टेस्ट करने के लिए एक नए तरीके की आवश्यकता है जो व्यक्तिगत प्राथमिकताओं पर ध्यान केंद्रित करे, न कि केवल सामान्य नियमों पर।
  3. यदि कोई AI इस नए टेस्ट को पास कर लेता है, तो वह भविष्य में वास्तविक लोगों के लिए बहुत अधिक सहायक होगा।

संक्षेप में: AI को एक ऐसे रोबोट के रूप में सिखाना बंद करें जो सबको खुश करता है। AI को एक ऐसे दोस्त के रूप में सिखाना शुरू करें जो जानता है कि आपको वास्तव में क्या चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →