← नवीनतम पेपर
💬 NLP

QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards

QUBRIC एक अभिनव ढांचा है जो परिदृश्य-आधारित प्रश्नों और शिक्षक-आधारित रूब्रिक्स को सह-डिज़ाइन करके मौजूदा रूब्रिक-आधारित सुदृढीकरण शिक्षण की संरचनात्मक सीमाओं को दूर करता है, जिससे खुले अंत वाले कार्यों पर प्रभावी प्रशिक्षण सक्षम होता है और तर्क एवं निर्देश-अनुपालन बेंचमार्क में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

मूल लेखक: Rongzhi Zhang, Rui Feng, Zhihan Zhang, Jingfeng Yang, Qingyu Yin, Xin Liu, Zixuan Zhang, Priyanka Nigam, Bing Yin, Tuo Zhao, Chao Zhang

प्रकाशित 2026-06-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rongzhi Zhang, Rui Feng, Zhihan Zhang, Jingfeng Yang, Qingyu Yin, Xin Liu, Zixuan Zhang, Priyanka Nigam, Bing Yin, Tuo Zhao, Chao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बेहतरीन कहानी लिखना या एक कठिन समस्या को हल करना सिखाने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning - RL) कहा जाता है। आमतौर पर, हम रोबोट को "हाँ" या "ना" के स्पष्ट स्कोर देकर सिखाते हैं। उदाहरण के लिए, गणित में, यदि उत्तर "42" है, तो रोबोट को एक गोल्ड स्टार मिलता है। यदि यह "43" है, तो उसे कुछ नहीं मिलता। यह गणित और कोडिंग के लिए बहुत अच्छा काम करता है।

लेकिन क्या होता है जब कोई एक सही उत्तर मौजूद न हो? क्या होगा यदि आप पूछें, "मैं एक अच्छी कॉफी कैसे बनाऊं?" या "खोए हुए कुत्ते के बारे में एक नैतिक कहानी लिखें"? यहाँ कोई "42" नहीं है। यहीं पर QUBRIC पेपर काम आता है।

समस्या: "अस्पष्ट प्रश्न" का जाल (The "Vague Question" Trap)

लेखकों ने पाया कि हम वर्तमान में रोबोट को इन खुले अंत वाले (open-ended) प्रश्नों को संभालने के लिए कैसे सिखाते हैं, इसमें एक बड़ी बाधा है।

इसे ऐसे सोचिए: आप एक छात्र से कहते हैं, "बताओ केक कैसे बनाया जाता है।"

  • पुराना तरीका: आप शिक्षक के लिए उत्तर को ग्रेड करने हेतु एक चेकलिस्ट (एक "रूब्रिक") बनाने की कोशिश करते हैं। लेकिन क्योंकि प्रश्न बहुत व्यापक है, इसलिए चेकलिस्ट अस्पष्ट हो जाती है। "क्या उन्होंने मैदा बताया?" "क्या उन्होंने अंडे बताए?" यह निष्पक्ष होना कठिन है।
  • नादान समाधान (The Naive Fix): कोई प्रश्न को अधिक विशिष्ट बनाने की कोशिश करता है: "बताओ केक कैसे बनाया जाता है, 2024 ग्रैंडमास्टर बेकिंग गाइड का उपयोग करके।"
    • तबाही: रोबोट के पास यह गाइड नहीं है। यह अस्तित्व में ही नहीं है! इसलिए, रोबोट या तो उत्तर देने से मना कर देता है (क्योंकि वह गाइड नहीं ढूंढ पाता) या एक नकली गाइड बना लेता है। शिक्षक की चेकलिस्ट फिर केवल यह जांचती है: "क्या आपने उत्तर देने से मना किया?" या "क्या आपने झूठ बोला?" रोबोट को यह सीखने के लिए कोई उपयोगी फीडबैक नहीं मिलता कि केक कैसे बनाया जाता है। वह केवल चुप रहना या झूठ बोलना सीख जाता है।

पेपर इसे "फैब्रिकेटेड रेफरेंस फेलियर" (Fabricated Reference Failure) कहता है। आप रोबोट को उस नियम पुस्तिका पर ग्रेड नहीं दे सकते जो मौजूद ही नहीं है।

समाधान: QUBRIC (द "को-डिज़ाइनर" अप्रोच)

लेखकों ने QUBRIC नामक एक नया सिस्टम बनाया है। केवल एक अव्यवस्थित प्रश्न के लिए चेकलिस्ट बनाने के बजाय, QUBRIC प्रश्न और चेकलिस्ट दोनों को एक साथ बदल देता है, जैसे आर्किटेक्ट्स और इंस्पेक्टरों की एक टीम कंधे से कंधा मिलाकर काम कर रही हो।

यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:

1. "की पॉइंट" डिटेक्टिव (प्रश्न को फिर से लिखना)

रोबोट को "मशीन लर्निंग समझाएं" (जो बहुत विशाल है) कहने के बजाय, सिस्टम देखता है कि एक मानव विशेषज्ञ (एक "शिक्षक") क्या कहेगा। यह सबसे महत्वपूर्ण, सूक्ष्म तथ्यों (Key Points) को निकालता है।

  • उपमा: कल्पना कीजिए कि आप एक बच्चे को "जानवरों" के बारे में पढ़ाना चाहते हैं। इसके बजाय, आप कहते हैं, "कल्पना करो कि तुम एक विशिष्ट चिड़ियाघर में ज़ूकीपर हो जहाँ एक भूखा शेर है। शेर केवल बाड़े के उत्तरी हिस्से से मांस खाता है। तुम उसे कैसे खिलाओगे?"
  • यह क्यों काम करता है: आपने विषय नहीं बदला है (यह अभी भी जानवरों/खिलाने के बारे में है), लेकिन आपने एक विशिष्ट परिदृश्य (scenario) बना दिया है जिसमें एक स्पष्ट उत्तर का दायरा है। आप किसी नकली किताब के बारे में नहीं पूछ रहे हैं; आप एक वास्तविक, सीमित समस्या के समाधान के बारे में पूछ रहे हैं।

2. "कॉन्ट्रास्टिव" इंस्पेक्टर (चेकलिस्ट बनाना)

अब, सिस्टम चेकलिस्ट (रूब्रिक) तैयार करता है। यह केवल यह अनुमान नहीं लगाता कि एक अच्छा उत्तर कैसा दिखता है। यह एक "शिक्षक" के आदर्श उत्तर की तुलना "छात्र" (रोबोट) के वर्तमान उत्तर से करता है।

  • उपमा: इंस्पेक्टर शिक्षक के उत्तर को देखता है और कहता है, "आह, शिक्षक ने शेर को खिलाने से पहले उसके दांतों की जाँच करने का उल्लेख किया। छात्र यह भूल गया।"
  • चेकलिस्ट बनती है: "क्या उत्तर में शेर के दांतों की जाँच करने का उल्लेख है?"
  • यह एक कॉन्सटिट्यूटिव रूब्रिक (Constitutive Rubric) है: नियम अपने आप में पूर्ण है। आपको ग्रेड देने के लिए बाहरी तथ्यों को जानने की आवश्यकता नहीं है; आपको बस यह देखना है कि क्या विशिष्ट विवरण वहां मौजूद है।

3. "डिफिकल्टी फ़िल्टर" (सही अभ्यास प्रश्न चुनना)

हर प्रश्न सीखने के लिए अच्छा नहीं होता।

  • यदि प्रश्न बहुत आसान है, तो रोबोट पहले से ही उत्तर जानता है। कोई सीखना नहीं होता।
  • यदि यह बहुत कठिन है, तो रोबोट हर बार विफल हो जाता है और भ्रमित हो जाता है।
  • QUBRIC एक कोच की तरह कार्य करता है जो केवल ऐसे अभ्यास प्रश्न चुनता है जहाँ छात्र के सही होने की संभावना 20% से 50% के बीच हो। यह वह "स्वीट स्पॉट" है जहाँ वास्तव में सीखना होता है।

क्या हुआ? (परिणाम)

लेखकों ने इस सिस्टम का परीक्षण एक ऐसे रोबोट पर किया जो निर्देशों का पालन करने में अच्छा था लेकिन जटिल तर्क (complex reasoning) में नहीं।

  • परीक्षण: उन्होंने रोबोट को कठिन, खुले अंत वाले कार्यों (जैसे रचनात्मक कहानियाँ लिखना या जटिल तर्क पहेलियाँ सुलझाना) और यहाँ तक कि उन कार्यों (जैसे कानूनी तर्क या नैतिक दुविधाएं) को संभालने के लिए कहा जो उसने पहले कभी नहीं देखे थे।
  • परिणाम: रोबोट में काफी सुधार हुआ।
    • निर्देश पालन के लिए एक कठिन "एरिना" टेस्ट पर, यह 5.5 अंक बढ़ गया।
    • तीन पूरी तरह से अलग प्रकार के रीजनिंग टेस्ट (कानूनी, नैतिक, कथात्मक) पर, इसमें औसतन 6.3 अंक का सुधार हुआ।

मुख्य निष्कर्ष (The Big Takeaway)

यह पेपर सिद्ध करता है कि आप केवल एक अस्पष्ट प्रश्न के लिए रोबोट को चेकलिस्ट नहीं दे सकते और उम्मीद नहीं कर सकते कि वह सीखेगा। प्रश्न को स्वयं जांचने योग्य (checkable) बनाया जाना चाहिए।

प्रश्न को एक विशिष्ट, वास्तविक परिदृश्य में बदलकर (जो वास्तविक तथ्यों पर आधारित हो, न कि नकली किताबों पर) और फिर उस विशिष्ट परिदृश्य के आधार पर एक चेकलिस्ट बनाकर, रोबोट को स्पष्ट, उपयोगी फीडबैक मिलता है। वह बेहतर सोचना सीखता है, न कि केवल अनुमान लगाना या उत्तर देने से मना करना।

संक्षेप में: QUBRIC हमें सिखाता है कि रोबोट को सोचने के लिए सिखाने हेतु, आपको पहले उसे सही प्रकार का प्रश्न पूछना होगा। आप एक छात्र को ऐसी परीक्षा पर ग्रेड नहीं दे सकते जिसका कोई अर्थ ही न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →