VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
यह शोधपत्र VerifyBench और VerifyBench-Hard को प्रस्तुत करता है, जो बड़े रीजनिंग मॉडलों के लिए संदर्भ-आधारित रिवॉर्ड सिस्टम का मूल्यांकन करने के लिए डिज़ाइन किए गए दो नए बेंचमार्क हैं, जो यह प्रकट करते हैं कि हालांकि वर्तमान वेरीफायर मानक कार्यों पर आशाजनक प्रदर्शन दिखाते हैं, फिर भी उन्हें सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) प्रशिक्षण को पूर्ण रूप से समर्थन देने के लिए चुनौतीपूर्ण उदाहरणों पर महत्वपूर्ण सुधार की आवश्यकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन कभी-कभी अति-आत्मविश्वासी छात्र (एक लार्ज लैंग्वेज मॉडल) को जटिल गणित और तर्क संबंधी पहेलियाँ हल करना सिखा रहे हैं। आप चाहते हैं कि वह बेहतर बने, इसलिए आप एक प्रणाली का उपयोग करते हैं जिसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है। इस प्रणाली में, छात्र एक समस्या को हल करने की कोशिश करता है, और एक "शिक्षक" (रिवॉर्ड सिस्टम) उसे एक स्कोर देता है: "बहुत अच्छा!" या "फिर से प्रयास करें।"
लंबे समय तक, शिक्षकों ने छात्र द्वारा दिए गए दो अलग-अलग उत्तरों की तुलना की और कहा, "उत्तर A, उत्तर B से बेहतर है।" लेकिन हाल ही में, सुपर-स्मार्ट छात्रों (जैसे OpenAI का o1 या DeepSeek-R1) की एक नई पीढ़ी उभरी है। ये छात्र केवल अनुमान नहीं लगाते; वे चरण-दर-चरण सोचते हैं। उन्हें प्रशिक्षित करने के लिए, हमें एक अलग तरह के शिक्षक की आवश्यकता है: एक ऐसा जो छात्र के उत्तर की तुलना एक गोल्डन आंसर की (Golden Answer Key - वास्तविक उत्तर) से करे और कहे, "हाँ, यह बिल्कुल सही है," या "नहीं, यह गलत है।"
समस्या यह है कि हमारे पास यह जांचने का कोई अच्छा तरीका नहीं था कि ये "आंसर की चेकर" (Answer Key Checkers) वास्तव में अपना काम कितनी अच्छी तरह कर रहे हैं।
यहाँ आता है VerifyBench, जो इस शोध पत्र में पेश किया गया एक नया बेंचमार्क है। इसे एक मानकीकृत "शिक्षक की परीक्षा" के रूप में समझें जिसे विशेष रूप से इन 'आंसर की चेकर' के काम करने के तरीके को परखने के लिए डिज़ाइन किया गया है।
परीक्षा के दो स्तर
शोधकर्ताओं ने शिक्षकों के विभिन्न कौशल स्तरों का परीक्षण करने के लिए इस परीक्षा के दो संस्करण बनाए:
VerifyBench (मानक परीक्षा):
- यह क्या है: गणित, तर्क और सामान्य तर्कशक्ति को कवर करने वाले 1,000 प्रश्नों का एक संग्रह।
- सेटअप: प्रत्येक प्रश्न के लिए, उनके पास प्रश्न, गोल्डन आंसर (वास्तविक उत्तर), और दो छात्र उत्तर हैं: एक जो सही (Correct) है और एक जो गलत (Incorrect) है।
- लक्ष्य: "शिक्षक" (AI verifier) को छात्र के उत्तर और गोल्डन आंसर को देखना होगा और निर्णय लेना होगा: "क्या यह छात्र सही है या गलत?"
- परिणाम: अधिकांश वर्तमान AI शिक्षक इस मामले में काफी अच्छे हैं, जो आसान मामलों में 90% से अधिक सटीकता प्राप्त करते हैं।
VerifyBench-Hard ("दुःस्वप्न" परीक्षा):
- यह क्या है: 945 प्रश्नों वाला एक कठिन संस्करण।
- इसे कैसे बनाया गया: शोधकर्ताओं ने उन प्रश्नों को लिया जहाँ सबसे स्मार्ट AI मॉडल भी उत्तर पर सहमत नहीं हो सके। यदि मॉडल A ने "सही" कहा और मॉडल B ने "गलत" कहा, तो उस प्रश्न को "कठिन" (Hard) के रूप में चिह्नित किया गया।
- लक्ष्य: क्या शिक्षक सच को पहचान सकता है जब अन्य AI भी भ्रमित हों?
- परिणाम: यहीं पर चीजें गड़बड़ा जाती हैं। यहाँ तक कि सर्वश्रेष्ठ AI शिक्षक भी गिरकर लगभग 70-80% सटीकता पर आ गए। यह दर्शाता है कि हालांकि AI स्मार्ट हो रहा है, फिर भी वह पेचीदा चीजों के मामले में एक पूर्ण निर्णायक बनने के लिए संघर्ष करता है।
यह क्यों मायने रखता है? ("कचरा अंदर, कचरा बाहर" का उदाहरण)
कल्पना कीजिए कि आप एक दौड़ने वाले घोड़े को प्रशिक्षित कर रहे हैं।
- यदि आपका कोच (रिवॉर्ड सिस्टम) एक महान निर्णायक है, तो वे घोड़े को बताते हैं, "शानदार चाल!" जब वह अच्छा दौड़ता है, और "धीमे चलो!" जब वह लड़खड़ाता है। घोड़ा तेज़ होता जाता है।
- यदि आपका कोच एक बुरा निर्णायक है, तो वे घोड़े को प्रशंसा दे सकते हैं जब वह लड़खड़ाता है और डांट सकते हैं जब वह तेज़ दौड़ता है। घोड़ा भ्रमित हो जाता है और सुधार करना बंद कर देता है।
शोध पत्र दिखाता है कि यदि हम अपने रीजनिंग मॉडल्स को प्रशिक्षित करने के लिए एक कमजोर "शिक्षक" का उपयोग करते हैं, तो मॉडल गलत चीजें सीख सकते हैं। VerifyBench हमें यह खोजने में मदद करता है कि अगली पीढ़ी के सुपर-AI को प्रशिक्षित करने से पहले कौन से "शिक्षक" सबसे अच्छे हैं।
मुख्य निष्कर्ष (सरल भाषा में)
- रेफरेंस उत्तर (Reference Answers) महत्वपूर्ण हैं: शोध पत्र ने पाया कि AI शिक्षक ग्रेडिंग करते समय बहुत बेहतर प्रदर्शन करते हैं जब उन्हें "गोल्डन आंसर की" देखने की अनुमति दी जाती है। इसके बिना, वे एक उत्तर कुंजी के बिना परीक्षा ग्रेड करने वाले शिक्षक की तरह हैं—अनुमान लगाना बहुत कठिन है!
- आकार मायने रखता है (लेकिन सब कुछ नहीं): बड़े AI मॉडल आमतौर पर बेहतर शिक्षक बनाते हैं। हालाँकि, शोधकर्ताओं ने पाया कि छोटे, तेज़ मॉडल भी सही ढंग से प्रशिक्षित किए जाने पर अच्छे शिक्षक हो सकते हैं, जो महत्वपूर्ण है क्योंकि बड़े मॉडल चलाना महंगा होता है।
- वे कहाँ विफल होते हैं: AI शिक्षक सबसे अधिक संघर्ष करते हैं:
- जटिल गणित: जब उत्तर में कई संख्याएँ या पेचीदा सूत्र शामिल होते हैं।
- शब्दार्थ सूक्ष्मता (Semantic Nuance): जब उत्तर एक वाक्य होता है जिसका अर्थ वही होता है लेकिन उसे अलग तरह से लिखा जाता है (जैसे, "बिल्ली खुश है" बनाम "खुश है बिल्ली")।
- क्रम (Ordering): कभी-कभी संख्याओं का क्रम मायने नहीं रखता (जैसे, "1, 2" वही है जैसे "2, 1"), लेकिन AI भ्रमित हो जाता है और इसे गलत मार्क कर देता है।
निष्कर्ष
लेखकों ने AI की दुनिया में एक विशाल शून्य को भरने के लिए VerifyBench बनाया है। इससे पहले, हमारे पास यह जांचने का कोई मानक तरीका नहीं था कि AI उत्तरों को ग्रेड करने वाले सिस्टम वास्तव में ग्रेडिंग करने में कितने अच्छे हैं।
इस नए बेंचमार्क का उपयोग करके, शोधकर्ता अब:
- पहचान सकते हैं कि कौन से AI शिक्षक सबसे विश्वसनीय हैं।
- प्रशिक्षित कर सकते हैं कि गलतियों को ठीक करने के लिए बेहतर शिक्षक कैसे बनाए जाएं।
- वास्तविक दुनिया की समस्याओं को कम त्रुटियों के साथ हल करने के लिए बेहतर रीजनिंग मॉडल बना सकते हैं।
संक्षेप में, VerifyBench वह गुणवत्ता नियंत्रण जांच है जो सुनिश्चित करती है कि AI की दुनिया के "शिक्षक" वास्तव में पढ़ाने के लिए योग्य हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।