← नवीनतम पेपर
💬 NLP

ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training

ConsistRM एक सेल्फ-ट्रेनिंग फ्रेमवर्क है जो जनरेटिव रिवॉर्ड मॉडल्स को बेहतर बनाने के लिए कंसिस्टेंसी-अवेयर आंसर और क्रिटीक रिवार्ड्स पेश करता है ताकि स्थिर स्यूडो-लेबल्स जनरेट किए जा सकें और रिवॉर्ड हैकिंग को कम किया जा सके, जिससे यह महंगी मानवीय एनोटेशन पर निर्भर किए बिना वैनिला रीइन्फोर्समेंट फाइन-ट्यूनिंग से बेहतर प्रदर्शन करता है।

मूल लेखक: Yu Liang, Liangxin Liu, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Daiting Shi

प्रकाशित 2026-04-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yu Liang, Liangxin Liu, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Daiting Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ConsistRM पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) में विभाजित किया गया है।

बड़ी तस्वीर: एक शिक्षक के बिना जज को सिखाना

कल्पना कीजिए कि आप एक नए जज (एक AI मॉडल) को यह सिखाने की कोशिश कर रहे हैं कि दो कहानियों में से कौन सी बेहतर है।

  • पुराना तरीका (पारंपरिक रिवॉर्ड मॉडल्स): आप एक मानव विशेषज्ञ को हज़ारों कहानियाँ पढ़ने और यह लिखने के लिए काम पर रखते हैं कि "कहानी A बेहतर है" या "कहानी B बेहतर है।" यह महंगा, धीमा और बड़े पैमाने पर करना कठिन है।
  • नया तरीका (जेनरेटिव रिवॉर्ड मॉडल्स): आप AI जज को खुद यह कारण लिखने देते हैं कि उसे क्यों लगता है कि एक कहानी दूसरी से बेहतर है। यह अधिक लचीला है, लेकिन इसमें एक समस्या है: AI भ्रमित हो जाता है। बिना किसी इंसान द्वारा अपने काम की जाँच किए, वह "चीटिंग" (रिवॉर्ड हैकिंग) करना शुरू कर सकता है या बस अच्छे स्कोर के लिए अंदाज़ा लगाना शुरू कर सकता है।

ConsistRM एक नया प्रशिक्षण तरीका है जो AI जज को बिना किसी मानव लेबल की आवश्यकता के, खुद का सबसे अच्छा शिक्षक बनने के लिए सिखाता है। यह एक सरल प्रश्न पूछकर ऐसा करता है: "क्या आप सुसंगत (consistent) हैं?"


दो मुख्य तरकीबें (The "Secret Sauce")

पेपर AI जज को ईमानदार रखने के लिए दो चतुर तंत्र पेश करता है। इन्हें दो अलग-अलग तरीकों के रूप में समझें जिनसे जज की सच्चाई की जाँच की जाती है।

1. "समय-यात्री की स्मृति" (Consistency-Aware Answer Reward)

समस्या: यदि आप AI जज से अभी इसी वक्त एक ही सवाल 10 बार पूछते हैं, तो वह 10 अलग-अलग उत्तर दे सकता है क्योंकि वह अस्थिर या भ्रमित है। यदि आप केवल एक को चुन लेते हैं, तो आप उसे एक इत्तेफाक (fluke) पर प्रशिक्षित कर रहे होंगे।

समाधान: ConsistRM एक डायरी रखने वाले समय-यात्री की तरह कार्य करता है।

  • ऑनलाइन चेक: यह AI से अभी इसी वक्त एक ही सवाल 10 बार पूछता है ("Online" अवस्था)।
  • मेमोरी चेक: यह AI की डायरी (Memory) को देखता है, जिसमें पिछले कुछ दिनों में इसी सवाल के जवाब दर्ज होते हैं।
  • फैसला: यदि AI आज कहता है "कहानी A बेहतर है", और उसने कल भी कहा था "कहानी A बेहतर है", और अभी भी 10 में से 8 बार यही कहा है, तो सिस्टम कहता है, "ठीक है, यह एक विश्वसनीय सत्य है। आइए इसे प्रशिक्षण के लिए उपयोग करें।"
  • सेफ्टी नेट: यदि AI बार-बार बदल रहा है (आज "A" कह रहा है और कल "B"), तो सिस्टम कहता है, "हमें अभी उत्तर नहीं पता। आइए फिलहाल इसे अनदेखा करें ताकि हम AI को भ्रमित न करें।"

उपमा: एक छात्र की कल्पना करें जो परीक्षा दे रहा है। यदि वह लगातार 10 बार सही उत्तर देता है, और उसने पिछले सप्ताह भी सही उत्तर दिया था, तो शिक्षक को विश्वास है कि उसने वास्तव में सीखा है। यदि वह आज सही है लेकिन कल गलत था, तो शिक्षक जानता है कि वह केवल अंदाज़ा लगा रहा है और उसे अभी श्रेय नहीं देता।

2. "विशेषज्ञों का समूह" (Consistency-Aware Critique Reward)

समस्या: AI जज केवल विजेता का चयन नहीं करता; वह यह समझाने के लिए एक पैराग्राफ लिखता है कि वह क्यों जीता। कभी-कभी, AI गलत कारण के लिए बेहतरीन स्पष्टीकरण लिखता है, या सही कारण के लिए बहुत खराब स्पष्टीकरण लिखता है।

समाधान: ConsistRM AI के स्पष्टीकरणों को विशेषज्ञों के पैनल की तरह मानता है।

  • AI कहानियों के एक ही जोड़े के लिए 10 अलग-अलग स्पष्टीकरण (critiques) उत्पन्न करता है।
  • सिस्टम जाँचता है: "क्या ये 10 विशेषज्ञ मुख्य बिंदुओं पर सहमत हैं?"
  • यदि 9 में से 10 विशेषज्ञ कहते हैं, "कहानी A बेहतर है क्योंकि इसमें तथ्य बेहतर हैं," तो सिस्टम एक बोनस रिवॉर्ड देता है।
  • यदि विशेषज्ञ आपस में बहस कर रहे हैं (कोई कहता है "तथ्य", कोई कहता है "शैली", कोई "कुछ नहीं"), तो सिस्टम कोई रिवॉर्ड नहीं देता।

उपमा: कल्पना कीजिए कि आपने बर्गर की समीक्षा करने के लिए 10 खाद्य समीक्षकों (food critics) के एक समूह से पूछा।

  • परिदृश्य A: 9 समीक्षक कहते हैं, "मांस रसीला है, लेकिन बन सूखा है।" -> उच्च निरंतरता (High Consistency)। सिस्टम इस समीक्षा पर भरोसा करता है।
  • परिदृश्य B: एक कहता है "यह तीखा है," दूसरा कहता है "यह ठंडा है," तीसरा कहता है "यह बहुत बड़ा है।" -> कम निरंतरता (Low Consistency)। सिस्टम इस समीक्षा को अनदेखा कर देता है क्योंकि समीक्षक इस बात पर सहमत नहीं हो पा रहे हैं कि वे क्या चख रहे हैं।

यह एक बड़ी बात क्यों है?

पेपर दिखाता है कि इन दो "निरंतरता जाँचों" (Consistency Checks) का उपयोग करके, AI जज बनता है:

  1. अधिक स्थिर (More Stable): यह "भ्रमित" (hallucinating) होने या हर सेकंड अपना मन बदलने से रुक जाता है।
  2. कम पक्षपाती (Less Biased): आमतौर पर, AI जजों में स्क्रीन पर पहले दिखने वाले उत्तर को पसंद करने की एक अजीब आदत होती है (Position Bias)। ConsistRM इसे ठीक करता है। यह कंटेंट को परखना सीखता है, न कि क्रम को।
    • उपमा: यह एक 'ब्लाइंड टेस्ट' की तरह है। पहले, AI कह सकता था, "मुझे पहला कॉफी कप बेहतर लगा।" अब, वह कहता है, "मुझे वह कॉफी पसंद है जिसमें चीनी अधिक है, चाहे वह किसी भी कप में हो।"
  3. अधिक कुशल (More Efficient): AI संक्षिप्त होना सीखता है। एक साधारण चुनाव को सही ठहराने के लिए 10 पन्नों का निबंध लिखने के बजाय, यह सीधे मुद्दे पर आना सीख जाता है क्योंकि "कंसिस्टेंसी रिवॉर्ड" फालतू की बातों (rambling) को दंडित करता है।

परिणाम

शोधकर्ताओं ने विभिन्न AI मॉडल का उपयोग करके पांच अलग-अलग "परीक्षाओं" (benchmarks) पर इसका परीक्षण किया।

  • परिणाम: Consist-RM ने औसत रूप से 1.5% से बेहतर प्रदर्शन किया।
  • जादू: इसने यह सब बिना एक भी मानव लेबल लिखे किया। AI ने अपने स्वयं के निरंतरता और विभिन्न स्पष्टीकरणों की जाँच करके खुद को प्रशिक्षित किया।

एक वाक्य में सारांश

Consist-RM एक स्व-प्रशिक्षण प्रणाली है जो AI जजों को विश्वसनीय बनने के लिए सिखाती है, उन्हें केवल तभी पुरस्कृत करती है जब वे अपने अतीत के स्वयं और अपने आंतरिक विशेषज्ञों के समूह के साथ सहमत होते हैं, जिससे महंगे मानव शिक्षकों की आवश्यकता प्रभावी रूप से समाप्त हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →