← नवीनतम पेपर
💬 NLP

Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling

यह शोध पत्र एक डेटा-संचालित विधि प्रस्तावित करता है जो स्वचालित रूप से सूक्ष्म तर्क त्रुटि वर्गीकरण (reasoning error taxonomies) उत्पन्न करती है जो जटिल तकनीकी डोमेन के लिए LLM-as-judge रिवॉर्ड मॉडलिंग को महत्वपूर्ण रूप से उन्नत करती है, और काफी कम गोल्ड लेबल्स के साथ लगभग 'वेरिफिएबल-रिवॉर्ड' प्रदर्शन प्राप्त करती है।

मूल लेखक: Kate Sanders, Nathaniel Weir, Sapana Chaudhary, Kaj Bostrom, Huzefa Rangwala

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kate Sanders, Nathaniel Weir, Sapana Chaudhary, Kaj Bostrom, Huzefa Rangwala

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत बुद्धिमान लेकिन अनुभवहीन छात्र (एक लार्ज लैंग्वेज मॉडल, या LLM) को उन्नत गणित, कोडिंग या इंजीनियरिंग जैसी जटिल समस्याओं को हल करना सिखा रहे हैं। आप चाहते हैं कि वे करके सीखें, लेकिन वे अक्सर अपनी सोचने की प्रक्रिया में गलतियाँ करते हैं। समस्या यह है कि जब आप उन्हें अपने काम की जाँच करने के लिए कहते हैं, या किसी सामान्य "शिक्षक" AI से उनके काम को ग्रेड करने के लिए कहते हैं, तो वे अक्सर सूक्ष्म गलतियों को पकड़ नहीं पाते, खासकर लंबे और जटिल उत्तरों में।

यह शोध पत्र आपको इन AI छात्रों को सिखाने का एक नया तरीका प्रस्तावित करता है, जिसमें उन्हें केवल "बेहतर करने" के बजाय गलतियों की एक विशिष्ट चेकलिस्ट (जांच सूची) दी जाती है।

यह कैसे काम करता है, इसके लिए यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "अस्पष्ट शिक्षक" (The Vague Teacher)

वर्तमान में, यदि कोई AI गलती करता है, तो एक सामान्य AI "न्यायाधीश" केवल यह कह सकता है कि "यह उत्तर गलत है," बिना यह बताए कि क्यों। यह एक शिक्षक की तरह है जो गणित के टेस्ट पर पूरे पैराग्राफ पर गोला लगा देता है और लाल स्याही से "खराब" लिख देता है। छात्र को पता ही नहीं चलेगा कि उसने फॉर्मूला गलत लगाया, अंकगणित में गलती की, या तर्क (logic) में चूक की। क्योंकि शिक्षक बहुत अस्पष्ट है, छात्र बार-बार एक ही प्रकार की गलतियाँ करता रहता है।

2. समाधान: "त्रुटि रूब्रिक" (The Error Rubric - द चेकलिस्ट)

लेखकों ने एक रूब्रिक (Rubric) बनाने के लिए एक प्रणाली विकसित की है। इसे एक अत्यधिक विस्तृत, डोमेन-विशिष्ट "विनाशकारी त्रुटियों" (Catastrophic Errors) की चेकलिस्ट के रूप में समझें।

  • वे इसे कैसे बनाते हैं: वे उन उदाहरणों का एक समूह लेते हैं जहाँ AI ने गलत उत्तर दिया था। वे इन गलत उदाहरणों को एक स्मार्ट AI को देते हैं और पूछते हैं, "यहाँ वास्तव में क्या गलत हुआ?"
  • परिणाम: AI विशिष्ट त्रुटि पैटर्न उत्पन्न करता है, जैसे कि "हासिल करना भूल गया (Forgot to carry the one)," "गलत रासायनिक सूत्र का उपयोग किया," या "कोड में वेरिएबल्स को भ्रमित कर दिया।"
  • संगठन: इस सूची को प्रबंधनीय बनाने के लिए, वे इसे एक लाइब्रेरी की तरह व्यवस्थित करते हैं। प्रत्येक त्रुटि का एक कीवर्ड (जैसे, "इकाई रूपांतरण/Unit Conversion") होता है। एक नया उत्तर जाँचते समय, सिस्टम पहले कीवर्ड को खोजता है। यदि उसे कीवर्ड मिल जाता है, तो वह यह देखने के लिए उस कीवर्ड से संबंधित विशिष्ट चेकलिस्ट आइटम को निकालता है कि क्या वास्तव में वह त्रुटि हुई है।

3. प्रयोग: "नया शिक्षक" का परीक्षण

शोधकर्ताओं ने तीन कठिन विषयों में इस "रूब्रिक शिक्षक" का परीक्षण किया: कोडिंग, गणित, और केमिकल इंजीनियरिंग।

  • परीक्षण: उन्होंने AI को रीजनिंग ट्रेसेस (सोचने के चरण-दर-चरण तरीके) को ग्रेड करने और यह तय करने के लिए कहा कि अंतिम उत्तर सही होगा या गलत।
  • परिणाम: रूब्रिक चेकलिस्ट का उपयोग करने वाला AI, केवल अनुमान लगाने वाले AI की तुलना में त्रुटियों को पकड़ने में बहुत बेहतर था। इसने तकनीकी क्षेत्रों में लगभग 11.6% अधिक गलतियाँ पकड़ीं। यह ऐसा था जैसे आपने शिक्षक को केवल "गलतियाँ ढूँढो" जैसा सामान्य निर्देश देने के बजाय, उसे एक आवर्धक लेंस (magnifying glass) और चीज़ों को खोजने के लिए एक विशिष्ट सूची दे दी हो।

4. बड़ी जीत: कम "गोल्ड" के साथ प्रशिक्षण

आमतौर पर, एक AI को पूर्ण बनाने के लिए प्रशिक्षित करने के लिए, आपको "गोल्ड लेबल्स" (Gold Labels) के एक विशाल डेटासेट की आवश्यकता होती है—ऐसे उत्तर जिन्हें मनुष्यों द्वारा 100% सही सत्यापित किया गया हो। यह महंगा और धीमा है, जैसे हर होमवर्क असाइनमेंट को ग्रेड करने के लिए पीएचडी विशेषज्ञों की एक टीम को काम पर रखना।

शोध पत्र दिखाता है कि इस रूब्रिक-आधारित रिवॉर्ड सिस्टम का उपयोग करके, वे AI को लगभग उतना ही अच्छा प्रशिक्षित कर सकते हैं जितना कि उन्होंने उन सभी मानव-सत्यापित उत्तरों का उपयोग करके किया होता, लेकिन इसके लिए केवल 20% मानव-सत्यापित डेटा की आवश्यकता पड़ी।

  • उपमा: कल्पना कीजिए कि आप एक रेस कार ड्राइवर को प्रशिक्षित कर रहे हैं।
    • पुराना तरीका: आपको हर एक लैप के लिए एक पेशेवर ड्राइवर को बगल वाली सीट पर बिठाना होगा ताकि वह आपको बता सके कि आपने कब कर्ब (curb) को छुआ। (महंगा, धीमा)।
    • नया तरीका: आप ड्राइवर को सामान्य गलतियों की एक चेकलिस्ट देते हैं (जैसे, "टर्न 3 पर बहुत देर से ब्रेक न लगाएं," "टायर का दबाव जांचें")। कार का कंप्यूटर इस चेकलिस्ट का उपयोग करके फीडबैक देता है। ड्राइवर उतना ही तेज़ी से सीखता है, लेकिन आपको हर लैप के लिए एक पेशेवर ड्राइवर की आवश्यकता नहीं पड़ी।

5. निष्कर्ष (The Bottom Line)

यह शोध पत्र दावा करता है कि पिछले दोषों से इन विशिष्ट "त्रुटि सूचियों" (रूब्रिक्स) को स्वचालित रूप से उत्पन्न करके, हम:

  1. तकनीकी क्षेत्रों में त्रुटियों को पकड़ने में AI न्यायाधीशों को बहुत बेहतर बना सकते हैं।
  2. AI मॉडल को कठिन समस्याओं (जैसे कोडिंग और गणित) को हल करने के लिए बहुत अधिक कुशलता से प्रशिक्षित कर सकते हैं, जिससे बहुत कम मानव-सत्यापित उदाहरणों की आवश्यकता होती है।
  3. केवल यह जाँचने से आगे बढ़ सकते हैं कि अंतिम उत्तर सही है या नहीं, बल्कि यह जाँच सकते हैं कि सोचने की प्रक्रिया कितनी सटीक थी।

संक्षेप में, उन्होंने एक अस्पष्ट "बेहतर करो" निर्देश को एक ठोस, स्वचालित "यहाँ बताया गया है कि क्या नहीं करना है" मार्गदर्शिका में बदल दिया, जो AI को तेज़ी से और अधिक सटीकता से सीखने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →