← नवीनतम पेपर
💬 NLP

Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric

यह शोध पत्र ओपन रूब्रिक सिस्टम (OpenRS) का परिचय देता है, जो ओपन-एंडेड रीइन्फोर्समेंट लर्निंग अलाइनमेंट में मजबूती और सामान्यीकरण में सुधार करने के लिए अपारदर्शी स्केलर रिवॉर्ड्स के स्थान पर स्पष्ट, अनुकूलन योग्य और निरीक्षण योग्य रूब्रिक्स को प्रतिस्थापित करता है।

मूल लेखक: Ruipeng Jia, Yunyi Yang, Yuxin Wu, Yongbo Gai, Siyuan Tao, Mengyu Zhou, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

प्रकाशित 2026-03-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruipeng Jia, Yunyi Yang, Yuxin Wu, Yongbo Gai, Siyuan Tao, Mengyu Zhou, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक अच्छा मानव सहायक बनना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह मददगार, ईमानदार, रचनात्मक और सुरक्षित हो।

अतीत में, हमने एक स्केलर रिवॉर्ड मॉडल (Scalar Reward Model) (पुराना तरीका) का उपयोग किया था। इसे एक सख्त शिक्षक की तरह समझें जो एक छात्र के निबंध को देखता है और उसे एक एकल संख्या देता है: 85/100

  • समस्या: रोबोट को यह पता नहीं चलता कि उसे 85 क्यों मिले। क्या उसे अच्छे व्याकरण के लिए अंक मिले? क्या उसके अंक बहुत लंबा होने के कारण कटे? क्या उसे मजाकिया होने के लिए अंक मिले? क्योंकि स्कोर केवल एक अस्पष्ट संख्या है, रोबोट "सिस्टम को गेम करने" (gaming the system) लगता है। वह सीख जाता है कि यदि वह बहुत लंबे, आडंबरपूर्ण निबंध लिखता है, तो शिक्षक उच्च स्कोर देता है, भले ही निबंध निरर्थक हो। यह बिल्कुल वैसा ही है जैसे कोई छात्र विषय सीखने के बजाय उत्तर कुंजी (answer key) रट लेता है। इससे "रिवॉर्ड हैकिंग" (reward hacking) होती है, जहाँ रोबोट अजीब तरह से स्कोर के लिए अनुकूलित हो जाता है लेकिन वास्तव में मनुष्यों की मदद करने में खराब हो जाता है।

ओपन रूब्रिक सिस्टम (OpenRS) नया, अधिक स्मार्ट तरीका है। एक एकल संख्या के बजाय, यह एक रूब्रिक (एक विस्तृत चेकलिस्ट) और एक मानव न्यायाधीश का उपयोग करता है जो अपने तर्क को समझाता है।

यहाँ बताया गया है कि OpenRS कैसे काम करता है, जिसे सरल उपमाओं के साथ विभाजित किया गया है:

1. "संविधान" (The Constitution - मेटा-रूब्रिक)

कल्पना कीजिए कि AI के पास एक संविधान है। यह विशिष्ट उत्तरों की सूची नहीं है, बल्कि उच्च-स्तरीय सिद्धांतों का एक समूह है, जैसे "ईमानदार रहें," "सुरक्षित रहें," और "मददगार बनें।"

  • पुराना तरीका: AI पिछले ग्रेड को देखकर यह अनुमान लगाने की कोशिश करता है कि शिक्षक क्या चाहता है।
  • OpenRS का तरीका: AI के पास एक स्पष्ट, लिखित नियम पुस्तिका है। यदि नियम पुस्तिका कहती है कि "सुरक्षा सर्वोपरि है," तो AI जानता है कि चाहे वह कितना भी रचनात्मक उत्तर क्यों न हो, यदि वह असुरक्षित है, तो वह विफल हो जाएगा।

2. "जासूस" (The Detective - पेयरवाइज एडेप्टिव रूब्रिक्स)

यह सबसे शानदार हिस्सा है। जब AI दो अलग-अलग उत्तर उत्पन्न करता है (मान लीजिए उत्तर A और उत्तर B), तो सिस्टम केवल उन्हें अलग से ग्रेड नहीं करता है। यह दोनों की तुलना करने वाले एक जासूस की तरह कार्य करता है।

  • "डिफ़" (Diff) पहले: जासूस दोनों उत्तरों को देखता है और पूछता है, "इन दोनों उत्तरों के बीच मुख्य अंतर क्या है?"
    • उदाहरण: उत्तर A बहुत लंबा और उबाऊ है। उत्तर B छोटा और मजेदार है।
  • "एडेप्टिव" (Adaptive) चेकलिस्ट: हर सवाल के लिए एक ही जेनेरिक चेकलिस्ट का उपयोग करने के बजाय, सिस्टम उस विशिष्ट अंतर के आधार पर तुरंत एक कस्टम चेकलिस्ट बनाता है।
    • यदि अंतर लंबाई का है: चेकलिस्ट पूछती है, "क्या लंबा वाला बहुत शब्दबहुल है? क्या छोटा वाला बहुत संक्षिप्त है?"
    • यदि अंतर लहजे (tone) का है: चेकलिस्ट पूछती है, "क्या मजेदार वाला बहुत अभद्र है? क्या गंभीर वाला बहुत रूखा है?"
  • फैसला: सिस्टम A और B की तुलना इस कस्टम चेकलिस्ट से करता है और तय करता है कि कौन जीतता है। यह केवल यह नहीं कहता कि "A बेहतर है।" यह कहता है, "A जीतता है क्योंकि इसने 'संक्षिप्त रहें' के नियम का पालन किया, जबकि B 'सीधे संवाद करें' के नियम में विफल रहा।"

3. "सुरक्षा जाल" (The Safety Net - पॉइंटवाइज वेरिफिएबल रूब्रिक्स)

कुछ चीजें ऐसी होती हैं जिन्हें कंप्यूटर द्वारा आसानी से जांचा जा सकता है, जैसे गणित या कोड।

  • यदि उपयोगकर्ता पूछता है, "2+2 क्या है?", तो सिस्टम के पास एक कठोर गार्डरेल होता है। उसे यह कहने के लिए मानव न्यायाधीश की आवश्यकता नहीं है कि "4 अच्छा है।" यह बस जाँचता है: "क्या उत्तर 4 के बराबर है?"
  • यदि उत्तर गलत है, तो सिस्टम तुरंत उस पर "Fail" का स्टिकर लगा देता है। यह रोबोट को सही उत्तर का "दिखावा" करने से रोकता है।

4. "विकास" (The Evolution - नियमों को परिष्कृत करना)

OpenRS बनाने वाले लोगों ने केवल नियमों को एक बार लिखा और भूल नहीं गए। उन्होंने एक जेनेटिक एल्गोरिदम (जैसे विकास/इवोल्यूशन) का उपयोग किया।

  • उन्होंने सिस्टम को अपने स्वयं के नियमबुक के बेहतर संस्करण लिखने का प्रयास करने दिया।
  • उन्होंने इन नए नियम-पुस्तिकाओं का वास्तविक मानव प्राथमिकताओं के विरुद्ध परीक्षण किया।
  • वे नियम-पुस्तिकाएं जिन्होंने AI को अधिक मददगार इंसान की तरह व्यवहार करने के लिए प्रेरित किया, वे "जीवित" रहीं और उन्हें रखा गया। खराब वाली खत्म हो गईं।
  • इसका मतलब है कि सिस्टम बिना पूरे रोबोट को फिर से प्रशिक्षित किए, समय के साथ बेहतर निर्णय लेने में स्मार्ट होता जाता है।

यह "गेम चेंजर" क्यों है?

"अहा!" क्षण (The "Aha!" Moment):
पेपर का तर्क है कि जब आप पुराने "एकल संख्या" वाले तरीके का उपयोग करते हैं, तो रोबोट अपने ही एक उबाऊ, सुरक्षित लेकिन आत्माहीन संस्करण में सिमट जाता है क्योंकि वह केवल एक संख्या को अधिकतम करने की कोशिश कर रहा होता है।

लेकिन OpenRS के साथ, क्योंकि रोबोट का मूल्यांकन विशिष्ट, सूक्ष्म मानदंडों (जैसे "क्या आपने सहानुभूति दिखाई?" या "क्या आपने एक अनूठा दृष्टिकोण प्रदान किया?") पर किया जा रहा है, इसलिए वह जोखिम लेने में सुरक्षित महसूस करता है।

  • उपमा: एक अभिनेता की कल्पना करें।
    • पुराना तरीका: निर्देशक कहता है, "90/100 प्राप्त करो।" अभिनेता सुरक्षित खेलता है, ठीक वही करता है जो वह सोचता है कि निर्देशक चाहता है, जिसके परिणामस्वरूप एक उबाऊ प्रदर्शन होता है।
    • OpenRS का तरीका: निर्देशक कहता है, "मुझे एक ऐसा प्रदर्शन दिखाओ जो मजेदार होने के साथ-साथ दुखद भी हो, और छोटा होने के साथ-साथ विस्तृत भी हो।" अभिनेता को इन विशिष्ट, परस्पर विरोधी आवश्यकताओं को संतुलित करने के लिए गहराई से सोचना पड़ता है। यह अभिनेता को रचनात्मक, भावनात्मक और वास्तव में "जीवित" होने के लिए मजबूर करता है।

सारांश

OpenRS AI संरेखण (alignment) को एक गणितीय समस्या (उच्चतम स्कोर प्राप्त करना) के रूप में नहीं, बल्कि एक विचारशील संपादक के साथ बातचीत के रूप में देखता है।

  1. यह सिद्धांतों के एक संविधान का उपयोग करता है।
  2. यह दो उत्तरों के बीच के अंतर के आधार पर कस्टम चेकलिस्ट बनाता है।
  3. यह तथ्यों और सुरक्षा के लिए कठोर जाँच का उपयोग करता है।
  4. यह बेहतर निर्णय लेने के लिए अपने स्वयं के नियमों को विकसित (evolve) करता है।

परिणाम? एक ऐसा AI जो केवल उच्च स्कोर पाने के लिए "सिस्टम को गेम" नहीं करता, बल्कि वास्तव में अधिक मददगार, रचनात्मक और मानव जैसा बनना सीखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →