← नवीनतम पेपर
💻 computer science

Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLMReward Models

यह शोध पत्र Proxy-GRM का प्रस्ताव करता है, जो एक नवीन फ्रेमवर्क है जो सुदृढीकरण शिक्षण (reinforcement learning) के दौरान रूब्रिक गुणवत्ता पर विभेदक फीडबैक (differentiable feedback) प्रदान करने के लिए हल्के प्रॉक्सी एजेंटों को प्रशिक्षित करके विजन-लैंग्वेज मॉडल रिवॉर्ड मॉडल्स के प्रदर्शन और हस्तांतरणीयता को बढ़ाता है, जिससे काफी कम प्रशिक्षण डेटा के साथ अत्याधुनिक परिणाम प्राप्त होते हैं।

मूल लेखक: Weijie Qiu, Dai Guan, Junxin Wang, Zhihang Li, Yongbo Gai, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weijie Qiu, Dai Guan, Junxin Wang, Zhihang Li, Yongbo Gai, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLM Reward Models" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

मुख्य विचार: "क्या" से अधिक "क्यों" महत्वपूर्ण है

कल्पना कीजिए कि आप एक छात्र के निबंध को ग्रेड दे रहे हैं।

  • पुराना तरीका: आप बस निबंध देखते हैं और उसे एक ग्रेड देते हैं (A, B, या F)। आप जानते हैं कि ग्रेड क्या है, लेकिन आप यह नहीं जानते कि आपने वह ग्रेड क्यों दिया। यदि कोई अन्य शिक्षक आपके ग्रेड को देखता है, तो वह आपसे असहमत हो सकता है क्योंकि उसे आपकी सोचने की प्रक्रिया नहीं दिखती।
  • समस्या: AI की दुनिया में (विशेष रूप से विजन-लैंग्वेज मॉडल्स में जो चित्रों को देखते हैं और प्रश्नों के उत्तर देते हैं), हमारे पास "रिवॉर्ड मॉडल्स" (Reward Models) होते हैं जो इन शिक्षकों की तरह कार्य करते हैं। वे दो AI उत्तरों को देखते हैं और बेहतर वाले को चुनते हैं। लेकिन अक्सर, ये AI शिक्षक बिना कोई स्पष्ट कारण लिखे विजेता का अनुमान लगा लेते हैं। वे कह सकते हैं "उत्तर A बेहतर है," लेकिन यदि आप बाद में उनसे पूछें कि क्यों, तो उनका स्पष्टीकरण अस्पष्ट, पक्षपाती या अर्थहीन हो सकता है। इसे "ब्लैक बॉक्स" कहा जाता है।

समाधान: "प्रॉक्सी" (स्वतंत्र परीक्षक)

इस शोध पत्र के लेखकों ने, Proxy-GRM के माध्यम से, महसूस किया कि एक AI शिक्षक को वास्तव में अच्छा होने के लिए, विजेता चुनने से पहले एक स्पष्ट और तार्किक चेकलिस्ट (एक रूब्रिक/Rubric) लिखनी चाहिए।

लेकिन यहाँ एक पेंच है: आप AI को एक अच्छी चेकलिस्ट लिखना कैसे सिखाएंगे यदि आपके पास हर एक चेकलिस्ट की जाँच करने के लिए कोई इंसान न हो?

यहाँ आता है "प्रॉक्सी" (Proxy)।

प्रॉक्सी को एक सख्त, स्वतंत्र शिक्षण सहायक (Teaching Assistant) के रूप में सोचें।

  1. मुख्य AI (The Policy) एक निबंध और एक चेकलिस्ट (रूब्रिक) लिखता है।
  2. प्रॉक्सी केवल चेकलिस्ट और मूल निबंध को पढ़ता है। वह मुख्य AI के अंतिम ग्रेड को अनदेखा कर देता है।
  3. परीक्षण: क्या प्रॉक्सी, केवल प्रदान की गई चेकलिस्ट का उपयोग करके, यह पता लगा सकता है कि कौन सा उत्तर वास्तव में बेहतर है?
    • यदि हाँ: तो चेकलिस्ट स्पष्ट, तार्किक और हस्तांतरणीय (transferable) थी। मुख्य AI को उच्च स्कोर मिलता है।
    • यदि नहीं: तो चेकलिस्ट भ्रमित करने वाली, पक्षपाती या निरर्थक थी। मुख्य AI को कम स्कोर मिलता है।

उपमा: "रेसिपी" बनाम "शेफ"

कल्पना कीजिए कि मुख्य AI एक शेफ (Chef) है जो एक नए प्रशिक्षु को एक आदर्श स्टेक बनाना सिखाने की कोशिश कर रहा है।

  • खराब शेफ: बस कहता है, "यह स्टेक अच्छा है क्योंकि इसका स्वाद अच्छा है।" (यह पुराना तरीका है)। यदि आप प्रशिक्षु को इसे बनाने के लिए कहते हैं, तो उसे समझ नहीं आता कि क्या करना है।
  • अच्छा शेफ (Proxy-GRM): एक विस्तृत रेसिपी लिखता है: "3 मिनट तक सेकें, पलटें, मक्खन डालें, 5 मिनट तक छोड़ दें।"
  • प्रॉक्सी: एक स्वाद-परीक्षक (Taste-tester) है जो केवल रेसिपी को देखता है। प्रॉक्सी केवल उन निर्देशों का उपयोग करके स्टेक बनाने की कोशिश करता है।
    • यदि प्रॉक्सी एक बेहतरीन स्टेक बनाता है, तो रेसिपी हस्तांतरणीय (Transferable) थी (यह किसी के लिए भी काम करती है)।
    • यदि प्रॉक्सी स्टेक जला देता है, तो रेसिपी खराब थी, भले ही शेफ ने दावा किया हो कि वह एकदम सही था।

यह पेपर शेफ (मुख्य AI) को ऐसी रेसिपी लिखना सिखाता है जिसे टेस्ट-टेस्टर (प्रॉक्सी) वास्तव में पालन कर सके।

यह एक बड़ी बात क्यों है (जादुई निष्कर्ष)

शोधकर्ताओं ने इस सिस्टम को प्रशिक्षित करते समय कुछ आश्चर्यजनक चीजें पाईं:

  1. कम डेटा, बेहतर परिणाम: आमतौर पर, AI को सीखने के लिए भारी मात्रा में डेटा की आवश्यकता होती है। इस पद्धति ने अन्य तरीकों की तुलना में 4 गुना कम डेटा का उपयोग करके पूर्ण चेकलिस्ट लिखना सीखा। यह 400 व्यंजनों को चखने के बजाय केवल 100 व्यंजनों को चखकर एक मास्टर शेफ बनने जैसा है।
  2. "SFT" बनाम "RL" का आश्चर्य: उन्होंने दो प्रकार के "शिक्षण सहायकों" (प्रॉक्सी) का परीक्षण किया:
    • Proxy-SFT: एक छात्र जिसे एक मास्टर शिक्षक के नोट्स की हुबहू नकल करने के लिए सिखाया गया था।
    • Proxy-RL: एक छात्र जिसने प्रयास और त्रुटि (trial and error - अनुमान लगाना और इनाम पाना) से सीखा।
    • परिणाम: नकल करने वाला छात्र (SFT) वास्तव में एक बेहतर निर्णायक था! "प्रयास और त्रुटि" वाला छात्र कभी-कभी अजीब आदतें विकसित कर लेता था जो उन्हें रेसिपी की जाँच करने में बुरा बना देती थीं। यह हमें सिखाता है कि काम की जाँच करने के लिए, नियमों के प्रति वफादार होना रचनात्मक होने से बेहतर है।
  3. "हस्तांतरणीय" (Transferable) सुपरपावर: मुख्य AI ने जो चेकलिस्ट लिखीं, वे इतनी अच्छी थीं कि अन्य AI मॉडल (जो प्रशिक्षण का हिस्सा भी नहीं थे) उन्हें पढ़ सकते थे और सही उत्तर प्राप्त कर सकते थे। यह एक ऐसा मैनुअल लिखने जैसा है जो इतना स्पष्ट है कि किसी दूसरे ब्रांड का रोबोट भी उसे पढ़ सकता है और काम को पूरी तरह से कर सकता है।

एक वाक्य में सारांश

Proxy-GRM AI को उत्तरों को ग्रेड करने के लिए स्पष्ट, तार्किक चेकलिस्ट लिखना सिखाता है, जिसमें एक "दूसरे राय देने वाले" रोबोट का उपयोग करके यह सत्यापित किया जाता है कि वे चेकलिस्ट वास्तव में किसी और के लिए भी सार्थक हैं, जिसके परिणामस्वरूप अधिक स्मार्ट, अधिक विश्वसनीय AI प्राप्त होता है जिसे सीखने के लिए कम डेटा की आवश्यकता होती है।

आपको इसकी परवाह क्यों करनी चाहिए?

यह AI को अधिक भरोसेमंद बनाता है। केवल यह कहने के बजाय कि "मुझे लगता है कि यह छवि सुरक्षित है," AI आपको कारणों की एक स्पष्ट, तार्किक सूची दे सकता है कि वह क्यों सुरक्षित है, और आप उस सूची पर भरोसा कर सकते हैं क्योंकि इसे एक स्वतंत्र चेकर द्वारा प्रमाणित किया गया है। यह AI को "अनुमान लगाने" से "तर्क करने" की ओर ले जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →