← नवीनतम पेपर
💻 computer science

Rethinking Reward Models for Multi-Domain Test-Time Scaling

यह शोध पत्र 14 डोमेन में एक एकीकृत मूल्यांकन प्रस्तुत करके इस पारंपरिक धारणा को चुनौती देता है कि सूक्ष्म-स्तरीय प्रक्रिया रिवॉर्ड मॉडल (fine-grained process reward models) श्रेष्ठ होते हैं, जो यह प्रकट करता है कि जनरेटिव आउटकम रिवॉर्ड मॉडल्स (gORM) सबसे सुदृढ़ और सुसंगत प्रदर्शन करने वाले हैं, जबकि स्टेपवाइज जनरेटिव प्रोसेस मॉडल्स लेबल नॉइज़ के कारण त्रुटि संचय (error compounding) से ग्रस्त होते हैं।

मूल लेखक: Dong Bok Lee, Seanie Lee, Sangwoo Park, Minki Kang, Jinheon Baek, Dongki Kim, Dominik Wagner, Jiongdao Jin, Heejun Lee, Tobias Bocklet, Jinyu Wang, Jingjing Fu, Sung Ju Hwang, Jiang Bian, Lei Song

प्रकाशित 2026-07-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dong Bok Lee, Seanie Lee, Sangwoo Park, Minki Kang, Jinheon Baek, Dongki Kim, Dominik Wagner, Jiongdao Jin, Heejun Lee, Tobias Bocklet, Jinyu Wang, Jingjing Fu, Sung Ju Hwang, Jiang Bian, Lei Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को पेचीदा पहेलियाँ हल करना सिखाने की कोशिश कर रहे हैं। आप केवल यह नहीं चाहते कि रोबोट सही उत्तर दे जाए; आप यह भी जानना चाहते हैं कि वह वहाँ कैसे पहुँचा। क्या उसने कोई शॉर्टकट लिया? क्या उसने कोई गलती की, उसे महसूस किया और खुद को सुधारा? या उसने बस अंदाज़ा लगाया और किस्मत से सही हो गया?

रोबोट को सिखाने में मदद करने के लिए, हम एक "रिवॉर्ड मॉडल" (Reward Model) का उपयोग करते हैं—इसे एक सख्त शिक्षक के रूप में समझें जो रोबoret के काम को ग्रेड देता है। लंबे समय तक, गणित की दुनिया के सबसे स्मार्ट शिक्षक प्रोसेस रिवॉर्ड मॉडल्स (PRMs) थे। ये शिक्षक रोबोट की सोचने की प्रक्रिया के हर एक कदम को ग्रेड देते थे। यदि रोबोट ने स्टेप 3 में एक छोटी सी गलती की, तो शिक्षक रुक जाता और कहता, "खेल खत्म, यह गलत है!" विचार यह था कि हर कदम को ग्रेड करना एक आवर्धक लेंस (magnifying glass) रखने जैसा था; यह सीखने का सबसे विस्तृत, सहायक तरीका लगता था।

लेकिन यहाँ एक मोड़ है: यह पेपर सुझाव देता है कि अधिकांश वास्तविक दुनिया की पहेलियों (जैसे कानून, चिकित्सा, या सामान्य ज्ञान) के लिए, वह आवर्धक लेंस शिक्षक को अंधा कर सकता है।

बड़ा प्रयोग: 14 अलग-अलग दुनिया

शोधकर्ताओं ने केवल गणित की समस्याओं को नहीं देखा। उन्होंने चार अलग-अलग प्रकार के "शिक्षकों" का 14 विविध डोमेन (जिसमें कानून, जीव विज्ञान, इतिहास और मनोविज्ञान शामिल हैं) में परीक्षण किया। वे यह देखना चाहते थे कि कौन सा शिक्षक रोबोट को कई अनुमानों में से सबसे अच्छा समाधान चुनने में मदद करने में सर्वश्रेष्ठ है।

वे चार शिक्षक थे:

  1. द फाइनल-आंसर ग्रेडर (dORM): केवल अंतिम परिणाम को देखता है। "क्या आपको सही उत्तर मिला? हाँ/नहीं।"
  2. द स्टेप-बाय-स्टेप ग्रेडर (dPRM): हर कदम की जाँच करता है। "स्टेप 1 अच्छा है, स्टेप 2 बुरा है, रुकिए।"
  3. द चैटबॉट फाइनल-आंसर ग्रेडर (gORM): एक स्मार्ट AI जो एक छोटा सा स्पष्टीकरण लिखता है और साथ ही एक अंतिम निर्णय देता है।
  4. द चैटबॉट स्टेप-बाय-स्टेप ग्रेडर (gPRM): एक स्मार्ट AI जो हर एक कदम के लिए एक स्पष्टीकरण लिखता है और उन्हें एक-एक करके ग्रेड करता है।

चौंकाने वाले परिणाम

गणित की दुनिया में, स्टेप-बाय-स्टेप शिक्षक (PRMs) आमतौर पर जीतते हैं। लेकिन जब शोधकर्ताओं ने अन्य 13 डोमेन में बदलाव किया, तो परिणाम पूरी तरह बदल गए:

  • "स्टेप-बाय-स्टेप" चैटबॉट (gPRM) सबसे खराब था। इसे तालमेल बिठाने में संघर्ष करना पड़ा।
  • "स्टेप-बाय-स्टेप" मानव-शैली वाला शिक्षक (dPRM) बस ठीक-ठाक था। इसने साधारण फाइनल-आंसर ग्रेडर के समान प्रदर्शन किया।
  • "चैटबॉट फाइनल-आंसर" शिक्षक (gORM) विजेता रहा। यह सबसे मजबूत था, जिसने परीक्षण किए गए प्रत्येक डोमेन में निरंतर सुधार दिया।

स्टेप-बाय-स्टेप शिक्षक क्यों विफल हुए?

पेपर दो मुख्य कारण बताता है, और वे काफी चतुर हैं।

1. "अहा!" मोमेंट (Aha! Moment) की समस्या
कल्पना कीजिए कि एक रोबोट पहेली सुलझा रहा है। वह स्टेप 2 में एक गलती करता है, लेकिन फिर उसे एहसास होता, "ओह नहीं, मैंने गड़बड़ कर दी!" और वह स्टेप 3 में इसे ठीक कर देता है, और अंततः सही उत्तर प्राप्त कर लेता है। इसे "अहा!" मोमेंट कहा जाता है।

  • PRM की समस्या: स्टेप-बाय-स्टेप शिक्षक प्रशिक्षित होने के लिए सोचते हैं कि यदि एक कदम गलत है, तो पूरी प्रक्रिया गलत है। वे एक रेफरी की तरह हैं जो खिलाड़ी के लड़खड़ाते ही सीटी बजा देते हैं, भले ही खिलाड़ी उठकर विजयी गोल कर दे। पेपर दिखाता है कि इन मल्टी-डोमेन परीक्षणों में, ये शिक्षक अक्सर "अहा!" रिकवरी को मिस कर देते हैं क्योंकि वे बहुत जल्दी ग्रेडिंग रोक देते हैं।
  • लंबाई की समस्या: जैसे-जैसे रोबोट की सोचने की श्रृंखला लंबी होती जाती है, स्टेप-बाय-स्टेप शिक्षक के अपने ग्रेडिंग में गलती करने की संभावना उतनी ही अधिक होती जाती है। पेपर सुझाव देता है कि जैसे-जैसे तर्क की श्रृंखला लंबी होती है, स्टेप-बाय-स्टेप शिक्षक के स्कोर में त्रुटि बढ़ती जाती है, जिससे यह कम विश्वसनीय हो जाता है।

2. "नॉइजी लेबल" (Noisy Label) का जाल
गणित में, हमारे पास हर स्टेप को पूरी तरह से ग्रेड करने के लिए परफेक्ट मानव शिक्षक होते हैं। लेकिन कानून या चिकित्सा में, रोबोट की सोच के हर एक स्टेप को ग्रेड करने के लिए इंसानों को काम पर रखना बहुत महंगा है। इसलिए, हम स्टेप्स को स्वचालित रूप से ग्रेड करने के लिए अन्य AI का उपयोग करते हैं।

  • समस्या: ये स्वचालित ग्रेडर गलतियाँ करते हैं (नॉइज़)। पेपर ने पाया कि स्टेप-बाय-स्टेप शिक्षक इन गलतियों के प्रति बहुत संवेदनशील हैं। यदि स्वचालित ग्रेडर कहता है कि "स्टेप 3 गलत है" जबकि वह वास्तव में सही है, तो स्टेप-बाय-स्टेप शिक्षक भ्रमित हो जाता है और विफल हो जाता है।
  • विजेता: फाइनल-आंसर शिक्षक (विशेष रूप से चैटबॉट संस्करण, gORM) बहुत अधिक मजबूत हैं। वे बीच के छोटे शोर (noise) को अनदेखा कर सकते हैं और इस बात पर ध्यान केंद्रित कर सकते हैं कि अंतिम परिणाम समझ में आता है या नहीं।

"कंसेंसस फ़िल्टर" (Consensus Filter) ग्लिच

एक और कारण जिससे स्टेप-बाय-स्टेप चैटबॉट (gPRM) विफल हुआ। इसे प्रशिक्षित करने के लिए, शोधकर्ताओं ने एक विधि का उपयोग किया जिसे "कंसेंसस फ़िल्टरिंग" कहा जाता है। उन्होंने AI को अपने स्टेप्स को ग्रेड करने के लिए कहा, लेकिन यदि AI की ग्रेडिंग "ग्राउंड ट्रुथ" (उत्तर कुंजी) से मेल नहीं खाती थी, तो उन्होंने उस डेटा को हटा दिया।

  • परिणाम: इस प्रक्रिया ने अनजाने में सभी लंबी, जटिल, "अहा!"-शैली वाली सोचने की श्रृंखलाओं को हटा दिया। इसने शिक्षक को केवल छोटे, सरल उदाहरणों से सीखने के लिए छोड़ दिया। जब शिक्षक ने वास्तविक दुनिया में एक लंबी, जटिल पहेली को ग्रेड करने की कोशिश की, तो वह पूरी तरह से अप्राप्त (unprepared) था। पेपर दिखाता है कि इस शिक्षक के लिए प्रशिक्षण डेटा (training data) और टेस्ट डेटा बहुत अलग थे, जैसे किसी छात्र को केवल 5वीं कक्षा का गणित सिखाना और फिर उनका 12वीं कक्षा के कैलकुलस का टेस्ट लेना।

मुख्य निष्कर्ष (The Takeaway)

यदि आप रोबोट को जटिल, वास्तविक दुनिया की समस्याओं (जैसे कानूनी मामले या चिकित्सा सलाह) को सोचने में मदद करने के लिए एक सिस्टम बना रहे हैं, तो हर एक स्टेप को ग्रेड करने के पीछे पागल न हों।

पेपर सुझाव देता है कि एक जेनरेटिव आउटकम रिवॉर्ड मॉडल (gORM)—एक स्मार्ट AI जो अपने तर्क को समझाता है और पूरे समाधान पर एक अंतिम "हाँ/नहीं" का निर्णय देता है—सबसे विश्वसनीय उपकरण है। यह मजबूत है, लंबी सोच की श्रृंखलाओं को बेहतर ढंग से संभालता है, और नॉइजी डेटा से विचलित नहीं होता है।

जबकि स्टेप-बाय-स्टेप शिक्षक (PRMs) उन गणित के लिए महान हैं जहाँ हमारे पास परफेक्ट लेबल्स और छोटी समस्याएं हैं, यह पेपर तर्क देता है कि बिखरी हुई, लंबी और जटिल वास्तविक दुनिया के लिए, "बिग पिक्चर" वाला शिक्षक (gORM) ही वह है जिसे आप अपने साथ चाहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →