← नवीनतम पेपर
💬 NLP

Optimal Aggregation of LLM and PRM Signals for Efficient Test-Time Scaling

यह शोध पत्र एक सैद्धांतिक रूप से आधारित, कुशल अंशांकन (कैलिब्रेशन) पद्धति प्रस्तावित करता है जो सीखे गए भारों—ऋणात्मक भारों सहित—के साथ LLM और PRM संकेतों को इष्टतम रूप से संयोजित करने के लिए है, ताकि मानक दृष्टिकोणों द्वारा आवश्यक गणना के केवल एक अंश का उपयोग करते हुए टेस्ट-टाइम स्केलिंग दक्षता और प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके।

मूल लेखक: Peng Kuang, Yanli Wang, Xiaoyu Han, Yaowenqi Liu, Kaidi Xu, Haohan Wang

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peng Kuang, Yanli Wang, Xiaoyu Han, Yaowenqi Liu, Kaidi Xu, Haohan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जज हैं जिसे 100 ड्राफ्ट्स के ढेर में से सबसे अच्छा निबंध चुनना है, जो एक प्रतिभाशाली लेकिन कभी-कभी भ्रमित होने वाले छात्र (LLM) द्वारा लिखे गए हैं। आपके पास एक सख्त, अत्यधिक प्रशिक्षित संपादक (PRM) भी है जो प्रत्येक ड्राफ्ट के तर्क (reasoning) को चरण-दर-चरण ग्रेड कर सकता है।

लंबे समय तक, विजेता चुनने का मानक तरीका सरल था: "Best-of-N"। आप बस संपादक के स्कोर देखते हैं, उच्चतम स्कोर वाले एकल ड्राफ्ट को चुनते हैं, और उसे विजेता घोषित कर देते हैं।

लेकिन हाल ही में, शोधकर्ताओं ने देखा कि एक बहुत अधिक सरल तरीका—Majority Voting—बेहतर काम करता है। यह वह है जहाँ आप संपादक को पूरी तरह से अनदेखा कर देते हैं और बस उस उत्तर को चुन लेते हैं जो 100 ड्राफ्ट्स में सबसे अधिक बार आया है। यह ऐसा है जैसे कहने के लिए कि, "यदि 60 छात्रों ने स्वतंत्र रूप से एक ही उत्तर लिखा है, तो वह संभवतः सही है," भले ही संपादक ने उसे उच्च स्कोर न दिया हो।

इसने एक पहेली खड़ी कर दी: एक स्मार्ट, महंगे संपादक से साधारण वोट गिनती कभी बेहतर क्यों होती है?

यह पेपर इस पहेली को हल करता है। यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. बड़ी गलती: "ना" के वोटों को अनदेखा करना

लेखकों ने महसूस किया कि मानक तरीके एक महत्वपूर्ण जानकारी को मिस कर रहे थे।

  • Majority Voting संपादक को पूरी तरह से अनदेखा कर देता है।
  • Best-of-N केवल "हाँ" के वोटों (उच्चतम स्कोर) को देखता है।

पेपर का तर्क है कि संपादक वास्तव में "ना" कहने में बहुत अच्छा है। यदि संपादक किसी विशिष्ट ड्राफ्ट को बहुत कम स्कोर देता है, तो वह केवल एक "खराब" ड्राफ्ट नहीं है; यह इस बात का पुख्ता सबूत है कि उत्तर गलत है।

उपमा: कल्पना कीजिए कि आप एक पार्क में खोए हुए कुत्ते को ढूंढ रहे हैं।

  • Majority Voting 100 लोगों से पूछना है, "कुत्ता कहाँ है?" और उस स्थान पर जाना है जिसकी ओर सबसे अधिक लोग इशारा कर रहे हैं।
  • Best-of-N एक पुलिस ट्रैकर से पूछना है, "कुत्ता कहाँ है?" और उस एक स्थान पर जाना जिसके बारे में ट्रैकर सबसे अधिक आश्वस्त है।
  • नया तरीका ट्रैकर से पूछना है, "कुत्ता कहाँ है?" लेकिन साथ ही तब भी सुनना है जब ट्रैकर कहता है, "मुझे 100% यकीन है कि कुत्ता फव्वारे में नहीं है।"

पेपर दिखाता है कि यह जानना कि कुत्ता कहाँ नहीं है, उतना ही महत्वपूर्ण है जितना कि यह जानना कि वह कहाँ हो सकता है।

2. समाधान: एक "स्मार्ट वेटेड वोट" (Smart Weighted Vote)

लेखकों ने एक गणितीय सूत्र विकसित किया है जो छात्र के वोटों और संपादक के स्कोर को एक पूर्ण रणनीति में जोड़ता है। वे इसे Optimal Aggregation कहते हैं।

केवल विजेता चुनने या वोटों को गिनने के बजाय, वे हर एक उत्तर को एक वेट (weight) असाइन करते हैं।

  • यदि किसी उत्तर का संपादक से उच्च स्कोर है, तो उसे एक सकारात्मक वेट (positive weight) मिलता है (यह वोट को उस उत्तर की ओर खींचता है)।
  • यदि किसी उत्तर का स्कोर बहुत कम है, तो उसे एक नकारात्मक वेट (negative weight) मिलता है (यह वोट को उस उत्तर से सक्रिय रूप से दूर धकेलता है)।

रचनात्मक रूपक: रस्साकशी (Tug-of-war) के बारे में सोचें।

  • पुराना तरीका (Best-of-N): आप केवल उस टीम की रस्सी खींचते हैं जिसे रेफरी पसंद करता है।
  • पुराना तरीका (Majority Vote): आप उस टीम की रस्सी खींचते हैं जिसके पास सबसे अधिक लोग हैं, रेफरी को अनदेखा करते हुए।
  • नया तरीका: आप उन टीमों की रस्सियों को खींचते हैं जिन्हें रेफरी पसंद करता है, लेकिन आप उन टीमों की रस्सियों को भी धकेलते (push) हैं जिन्हें रेफरी नापसंद करता है। यदि रेफरी चिल्लाता है "वह टीम धोखाधड़ी कर रही है!", तो आप उन्हें केवल अनदेखा नहीं करते; आप उन्हें सक्रिय रूप से नीचे धकेलते हैं।

3. "एक-आकार-सभी-के-लिए" (One-Size-Fits-All) का जाल

शोधकर्ताओं ने एक आश्चर्यजनक खोज की: प्रत्येक छात्र और संपादक की जोड़ी अलग होती है।

  • कभी-कभी संपादक बहुत सख्त होता है और खराब तर्क से नफरत करता है।
  • कभी-कभी छात्र बहुत आत्मविश्वासी होता है लेकिन अक्सर गलत होता है।
  • कभी-कभी संपादक गणित की गलतियों को पकड़ने में अच्छा होता है लेकिन तर्क की गलतियों को पकड़ने में बुरा।

इस कारण से, आप सभी के लिए एक ही नियम का उपयोग नहीं कर सकते। आपको सिस्टम को कैलिब्रेट (calibrate) करना होगा। यह एक गिटार ट्यून करने जैसा है; आप वायलिन, गिटार और ड्रम के लिए एक ही ट्यूनिंग का उपयोग नहीं कर सकते। आपको उस विशिष्ट छात्र और संपादक के लिए विशेष रूप से "वेट्स" को एडजस्ट करना होगा जिनका आप उपयोग कर रहे हैं।

4. परिणाम: कम में अधिक करना

सबसे रोमांचक हिस्सा दक्षता (efficiency) है।
आमतौर पर, बेहतर परिणाम प्राप्त करने के लिए, आपको अधिक उत्तर जेनरेट करने होते हैं (जिसमें बहुत अधिक पैसा और कंप्यूटर पावर खर्च होती है)।

  • पुराना तरीका: 100 उत्तर जेनरेट करें, उन सभी की जाँच करें, और सर्वश्रेष्ठ चुनें।
  • नया तरीका: कम उत्तर जेनरेट करें (शायद केवल 30), लेकिन इस "स्मार्ट वेटेड वोट" का उपयोग करके विजेता चुनें।

पेपर दिखाता है कि उनका नया तरीका पुराने "Best-of-N" तरीके को हरा सकता है, जबकि वह केवल लगभग 20% से 37% कंप्यूटर पावर का उपयोग करता है।

सारांश

यह पेपर हमें सिखाता है कि जब हमारे पास एक स्मार्ट AI (छात्र) और एक स्मार्ट वेरीफायर (संपादक) हो, तो हमें केवल "विजेता" को नहीं चुनना चाहिए या केवल "वोटों को नहीं गिनना" चाहिए। हमें संपादक के नकारात्मक फीडबैक को उसके सकारात्मक फीडबैक जितने ध्यान से सुनना चाहिए। इन संकेतों को गणितीय रूप से संयोजित करके और विशिष्ट मॉडल जोड़ी के लिए उन्हें ट्यून करके, हम बहुत अधिक कंप्यूटर पावर खर्च किए बिना कहीं अधिक स्मार्ट परिणाम प्राप्त कर सकते हैं।

संक्षेप में: केवल सबसे अच्छे उत्तर की तलाश न करें; बुरे उत्तरों को सक्रिय रूप से दंडित करें। जीत हासिल करने का यही तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →