← नवीनतम पेपर
💬 NLP

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

यह शोध पत्र "थिंक-विथ-रुब्रिक्स" (Think-with-Rubrics) को प्रस्तुत करता है, जो एक नया प्रतिमान (paradigm) है जो प्रशिक्षण के दौरान LLMs द्वारा प्रतिक्रियाओं के साथ रुब्रिक्स उत्पन्न करवाकर, रुब्रिक्स को बाहरी मूल्यांकनकर्ताओं से आंतरिक तर्क मार्गदर्शन में बदल देता है, जिसके परिणामस्वरूप मौजूदा रिवॉर्ड-आधारित बेसलाइनों की तुलना में निरंतर प्रदर्शन सुधार प्राप्त होता है।

मूल लेखक: Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कहानी लिखना, कोई पहेली सुलझाना या निर्देशों का एक जटिल सेट पालन करना सिखा रहे हैं। अतीत में, हम इन रोबोट्स को अनुमान लगाने देते थे, और फिर काम पूरा होने के बाद उनके काम को ग्रेड देते थे। यदि वे गलत होते, तो हम उन्हें कहते, "यह रहा तुम्हारा ग्रेड, फिर से कोशिश करो।" यह एक शिक्षक द्वारा टेस्ट पेपर वापस करने जैसा है जिसके नीचे लाल स्याही से "F" लिखा हो, लेकिन इस बात पर कोई नोट न हो कि विशिष्ट गलतियों को कैसे सुधारा जाए।

"Think-with-Rubrics" नामक शोध पत्र एक स्मार्ट तरीका प्रस्तावित करता है। केवल अंतिम उत्तर को ग्रेड देने के बजाय, यह रोबोट को काम शुरू करने से पहले अपना खुद का ग्रेडिंग शीट लिखने के लिए सिखाता है।

यहाँ यह पेपर इसे सरल उपमाओं (analogies) का उपयोग करके समझाता है:

1. समस्या: "पोस्ट-गेम" आलोचक (The "Post-Game" Critic)

वर्तमान में, अधिकांश AI प्रशिक्षण Rubrics as Rewards का उपयोग करता है। इसे एक स्पोर्ट्स कोच की तरह समझें जो केवल खेल खत्म होने के बाद आता है। कोच अंतिम स्कोर देखता है और कहता है, "तुमने तीन बार गेंद मिस की।" खिलाड़ी स्कोर से सीखता है, लेकिन खेल के दौरान कोच की चेकलिस्ट उसके दिमाग में नहीं थी। वह नियमों का उपयोग वास्तविक समय में अपने आंदोलनों को निर्देशित करने के लिए नहीं कर सका।

2. समाधान: "प्री-गेम" कोच (The "Pre-Game" Coach)

लेखक Think-with-Rubrics पेश करते हैं। यह रोबोट की सोचने की प्रक्रिया को बदल देता है। अब, उत्तर का एक भी शब्द लिखने से पहले, रोबोट को अपने लिए एक Rubric (नियमों की एक चेकलिस्ट) तैयार करनी होगी।

  • उपमा: कल्पना कीजिए कि आप केक बना रहे हैं।
    • पुराना तरीका: आप केक बनाते हैं, उसे चखते हैं, और फिर जज कहता है, "इसमें नमक बहुत है और फ्रॉस्टिंग बिखरी हुई है।" आप अगली बार फिर कोशिश करते हैं।
    • नया तरीका (Think-with-Rubrics): ओवन चालू करने से पहले, आप एक चेकलिस्ट लिखते हैं: "1. ठीक 2 कप मैदा लें। 2. नमक न डालें। 3. फ्रॉस्टिंग चिकनी होनी चाहिए।" फिर आप उस चेकलिस्ट को लगातार चेक करते हुए केक बनाते हैं।

AI को पहले नियम लिखने के लिए मजबूर करके, नियम उसके "सोचने की प्रक्रिया" का हिस्सा बन जाते हैं, न कि केवल एक बाहरी ग्रेड।

3. प्रशिक्षण कैसे काम करता है (The "Double-Check" System)

पेपर एक प्रशिक्षण प्रक्रिया का वर्णन करता है जिसमें दो मुख्य चरण हैं, जैसे कि एक छात्र बड़े एग्जाम की तैयारी कर रहा हो:

  • चरण 1: फॉर्मेट सीखना (SFT Warm-up)
    रोबोट को एक चेकलिस्ट के बाद उत्तर लिखने के उदाहरण दिखाए जाते हैं। यह संरचना सीखता है: <Rubric> और फिर <Answer>। यह एक छात्र को यह सिखाने जैसा है कि अपना होमवर्क कैसे फॉर्मेट करना है ताकि शिक्षक उसे पढ़ सके।

  • चरण 2: रीइन्फोर्समेंट लर्निंग (The "Coach" Phase)
    यहीं असली जादू होता है। रोबोट अपनी खुद की चेकलिस्ट और उत्तर बनाता है। फिर, एक "वेरिफायर" (एक स्मार्ट जज) दो चीजों की जांच करता है:

    1. द गोल्डन चेक (The Golden Check): क्या उत्तर परफेक्ट, मानव-निर्मित चेकलिस्ट से मेल खाता है? (यह बाहरी ग्रेड है)।
    2. द सेल्फ-चेक (The Self-Check): क्या उत्तर वास्तव में रोबोट की अपनी चेकलिस्ट का पालन करता है? (यह आंतरिक निरंतरता है)।

मुख्य अंतर्दृष्टि (Key Insight):
पेपर में पाया गया कि यदि आप केवल "गोल्डन चेक" (मानव ग्रेड) का उपयोग करते हैं, तो रोबोट मानव नियमों का पालन करने में बेहतर हो जाता है, लेकिन उसकी अपनी सोच अभी भी अव्यवस्थित हो सकती है। लेकिन यदि आप "सेल्फ-चेक" जोड़ते हैं, तो रोबंतु अपने स्वयं के प्रति सुसंगत होना सीख जाता है।

4. आश्चर्यजनक खोज: स्व-विकास (Self-Evolution)

इस पेपर की सबसे रोमांचक खोज यह है कि रोबोट वास्तव में बिना किसी मानव शिक्षक की चेकलिस्ट के खुद को सिखा सकता है!

  • उपमा: कल्पना कीजिए कि एक छात्र इतना अच्छा है कि वह अपने स्वयं के स्टडी गाइड बनाता है और फिर उनका पालन करता है, जिससे वह उन छात्रों से भी बेहतर ग्रेड प्राप्त करता है जो केवल शिक्षक की उत्तर कुंजी पर निर्भर रहते हैं।
  • परिणाम: पेपर दिखाता है कि केवल अपने स्वयं के जनरेट किए गए चेकलिस्ट का पालन करने के लिए प्रशिक्षित मॉडल (बिना मानव "गोल्डन" चेकलिस्ट के) उन मॉडल्स के समान ही प्रदर्शन करता है, और कभी-कभी उनसे भी बेहतर, जिन्हें मानव चेकलिस्ट के साथ प्रशिक्षित किया गया था। यह सुझाव देता है कि AI "स्व-विकसित" (self-evolve) हो सकता है, अपने स्वयं के नियम बनाने और फिर उनका पालन करने में बेहतर होकर।

5. यह बेहतर क्यों काम करता है

लेखक बताते हैं कि यह तरीका इसलिए काम करता है क्योंकि यह एक विशिष्ट समस्या को ठीक करता है: असंगति (Inconsistency)
अक्सर, एक AI सोच सकता है, "मुझे छोटा होना चाहिए," लेकिन फिर वह एक लंबा पैराग्राफ लिख देता है। यह इस बात के बीच का अंतर है कि वह क्या सोचता है और वह वास्तव में क्या करता है।

  • Think-with-Rubrics AI को यह कहने के लिए मजबूर करता है, "मैं छोटा रहूँगा," और फिर तुरंत एक छोटा उत्तर लिखकर उसे सिद्ध करता है।
  • प्रशिक्षण AI को केवल सही होने के लिए ही नहीं, बल्कि अपने स्वयं के प्लान के प्रति सुसंगत (consistent) होने के लिए भी पुरस्कृत करता है।

परिणामों का सारांश

पेपर ने कई बेंचमार्क (जैसे IFEval और IFBench) पर इसका परीक्षण किया और पाया कि:

  • नया तरीका पुराने "Rubric-as-Reward" तरीकों को औसतन लगभग 3.87 अंक से लगातार पीछे छोड़ देता है।
  • यह बड़े और छोटे दोनों AI मॉडल्स पर अच्छी तरह काम करता है।
  • इसने AI की सोचने की प्रक्रिया को छोटा और अधिक कुशल बनाया (सोचने को एक संरचित चेकलिस्ट में समेट दिया)।

संक्षेप में: यह पेपर AI को अनुमान लगाना बंद करने और योजना बनाना शुरू करने के लिए सिखाता है। AI को काम शुरू करने से पहले अपना नियम पुस्तिका लिखने के लिए मजबूर करके, और फिर उस नियम पुस्तिका का पालन करने के लिए पुरस्कृत करके, AI अधिक विश्वसनीय, अधिक सुसंगत और निरंतर मानव पर्यवेक्षण के बिना सुधार करने में सक्षम हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →