← नवीनतम पेपर
💬 NLP

VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models

यह शोधपत्र VerifyBench और VerifyBench-Hard को प्रस्तुत करता है, जो बड़े रीजनिंग मॉडलों के लिए संदर्भ-आधारित रिवॉर्ड सिस्टम का मूल्यांकन करने के लिए डिज़ाइन किए गए दो नए बेंचमार्क हैं, जो यह प्रकट करते हैं कि हालांकि वर्तमान वेरीफायर मानक कार्यों पर आशाजनक प्रदर्शन दिखाते हैं, फिर भी उन्हें सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) प्रशिक्षण को पूर्ण रूप से समर्थन देने के लिए चुनौतीपूर्ण उदाहरणों पर महत्वपूर्ण सुधार की आवश्यकता है।

मूल लेखक: Yuchen Yan, Jin Jiang, Zhenbang Ren, Yijun Li, Xudong Cai, Yang Liu, Xin Xu, Mengdi Zhang, Jian Shao, Yongliang Shen, Jun Xiao, Yueting Zhuang

प्रकाशित 2026-02-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuchen Yan, Jin Jiang, Zhenbang Ren, Yijun Li, Xudong Cai, Yang Liu, Xin Xu, Mengdi Zhang, Jian Shao, Yongliang Shen, Jun Xiao, Yueting Zhuang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन कभी-कभी अति-आत्मविश्वासी छात्र (एक लार्ज लैंग्वेज मॉडल) को जटिल गणित और तर्क संबंधी पहेलियाँ हल करना सिखा रहे हैं। आप चाहते हैं कि वह बेहतर बने, इसलिए आप एक प्रणाली का उपयोग करते हैं जिसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है। इस प्रणाली में, छात्र एक समस्या को हल करने की कोशिश करता है, और एक "शिक्षक" (रिवॉर्ड सिस्टम) उसे एक स्कोर देता है: "बहुत अच्छा!" या "फिर से प्रयास करें।"

लंबे समय तक, शिक्षकों ने छात्र द्वारा दिए गए दो अलग-अलग उत्तरों की तुलना की और कहा, "उत्तर A, उत्तर B से बेहतर है।" लेकिन हाल ही में, सुपर-स्मार्ट छात्रों (जैसे OpenAI का o1 या DeepSeek-R1) की एक नई पीढ़ी उभरी है। ये छात्र केवल अनुमान नहीं लगाते; वे चरण-दर-चरण सोचते हैं। उन्हें प्रशिक्षित करने के लिए, हमें एक अलग तरह के शिक्षक की आवश्यकता है: एक ऐसा जो छात्र के उत्तर की तुलना एक गोल्डन आंसर की (Golden Answer Key - वास्तविक उत्तर) से करे और कहे, "हाँ, यह बिल्कुल सही है," या "नहीं, यह गलत है।"

समस्या यह है कि हमारे पास यह जांचने का कोई अच्छा तरीका नहीं था कि ये "आंसर की चेकर" (Answer Key Checkers) वास्तव में अपना काम कितनी अच्छी तरह कर रहे हैं।

यहाँ आता है VerifyBench, जो इस शोध पत्र में पेश किया गया एक नया बेंचमार्क है। इसे एक मानकीकृत "शिक्षक की परीक्षा" के रूप में समझें जिसे विशेष रूप से इन 'आंसर की चेकर' के काम करने के तरीके को परखने के लिए डिज़ाइन किया गया है।

परीक्षा के दो स्तर

शोधकर्ताओं ने शिक्षकों के विभिन्न कौशल स्तरों का परीक्षण करने के लिए इस परीक्षा के दो संस्करण बनाए:

  1. VerifyBench (मानक परीक्षा):

    • यह क्या है: गणित, तर्क और सामान्य तर्कशक्ति को कवर करने वाले 1,000 प्रश्नों का एक संग्रह।
    • सेटअप: प्रत्येक प्रश्न के लिए, उनके पास प्रश्न, गोल्डन आंसर (वास्तविक उत्तर), और दो छात्र उत्तर हैं: एक जो सही (Correct) है और एक जो गलत (Incorrect) है।
    • लक्ष्य: "शिक्षक" (AI verifier) को छात्र के उत्तर और गोल्डन आंसर को देखना होगा और निर्णय लेना होगा: "क्या यह छात्र सही है या गलत?"
    • परिणाम: अधिकांश वर्तमान AI शिक्षक इस मामले में काफी अच्छे हैं, जो आसान मामलों में 90% से अधिक सटीकता प्राप्त करते हैं।
  2. VerifyBench-Hard ("दुःस्वप्न" परीक्षा):

    • यह क्या है: 945 प्रश्नों वाला एक कठिन संस्करण।
    • इसे कैसे बनाया गया: शोधकर्ताओं ने उन प्रश्नों को लिया जहाँ सबसे स्मार्ट AI मॉडल भी उत्तर पर सहमत नहीं हो सके। यदि मॉडल A ने "सही" कहा और मॉडल B ने "गलत" कहा, तो उस प्रश्न को "कठिन" (Hard) के रूप में चिह्नित किया गया।
    • लक्ष्य: क्या शिक्षक सच को पहचान सकता है जब अन्य AI भी भ्रमित हों?
    • परिणाम: यहीं पर चीजें गड़बड़ा जाती हैं। यहाँ तक कि सर्वश्रेष्ठ AI शिक्षक भी गिरकर लगभग 70-80% सटीकता पर आ गए। यह दर्शाता है कि हालांकि AI स्मार्ट हो रहा है, फिर भी वह पेचीदा चीजों के मामले में एक पूर्ण निर्णायक बनने के लिए संघर्ष करता है।

यह क्यों मायने रखता है? ("कचरा अंदर, कचरा बाहर" का उदाहरण)

कल्पना कीजिए कि आप एक दौड़ने वाले घोड़े को प्रशिक्षित कर रहे हैं।

  • यदि आपका कोच (रिवॉर्ड सिस्टम) एक महान निर्णायक है, तो वे घोड़े को बताते हैं, "शानदार चाल!" जब वह अच्छा दौड़ता है, और "धीमे चलो!" जब वह लड़खड़ाता है। घोड़ा तेज़ होता जाता है।
  • यदि आपका कोच एक बुरा निर्णायक है, तो वे घोड़े को प्रशंसा दे सकते हैं जब वह लड़खड़ाता है और डांट सकते हैं जब वह तेज़ दौड़ता है। घोड़ा भ्रमित हो जाता है और सुधार करना बंद कर देता है।

शोध पत्र दिखाता है कि यदि हम अपने रीजनिंग मॉडल्स को प्रशिक्षित करने के लिए एक कमजोर "शिक्षक" का उपयोग करते हैं, तो मॉडल गलत चीजें सीख सकते हैं। VerifyBench हमें यह खोजने में मदद करता है कि अगली पीढ़ी के सुपर-AI को प्रशिक्षित करने से पहले कौन से "शिक्षक" सबसे अच्छे हैं।

मुख्य निष्कर्ष (सरल भाषा में)

  • रेफरेंस उत्तर (Reference Answers) महत्वपूर्ण हैं: शोध पत्र ने पाया कि AI शिक्षक ग्रेडिंग करते समय बहुत बेहतर प्रदर्शन करते हैं जब उन्हें "गोल्डन आंसर की" देखने की अनुमति दी जाती है। इसके बिना, वे एक उत्तर कुंजी के बिना परीक्षा ग्रेड करने वाले शिक्षक की तरह हैं—अनुमान लगाना बहुत कठिन है!
  • आकार मायने रखता है (लेकिन सब कुछ नहीं): बड़े AI मॉडल आमतौर पर बेहतर शिक्षक बनाते हैं। हालाँकि, शोधकर्ताओं ने पाया कि छोटे, तेज़ मॉडल भी सही ढंग से प्रशिक्षित किए जाने पर अच्छे शिक्षक हो सकते हैं, जो महत्वपूर्ण है क्योंकि बड़े मॉडल चलाना महंगा होता है।
  • वे कहाँ विफल होते हैं: AI शिक्षक सबसे अधिक संघर्ष करते हैं:
    • जटिल गणित: जब उत्तर में कई संख्याएँ या पेचीदा सूत्र शामिल होते हैं।
    • शब्दार्थ सूक्ष्मता (Semantic Nuance): जब उत्तर एक वाक्य होता है जिसका अर्थ वही होता है लेकिन उसे अलग तरह से लिखा जाता है (जैसे, "बिल्ली खुश है" बनाम "खुश है बिल्ली")।
    • क्रम (Ordering): कभी-कभी संख्याओं का क्रम मायने नहीं रखता (जैसे, "1, 2" वही है जैसे "2, 1"), लेकिन AI भ्रमित हो जाता है और इसे गलत मार्क कर देता है।

निष्कर्ष

लेखकों ने AI की दुनिया में एक विशाल शून्य को भरने के लिए VerifyBench बनाया है। इससे पहले, हमारे पास यह जांचने का कोई मानक तरीका नहीं था कि AI उत्तरों को ग्रेड करने वाले सिस्टम वास्तव में ग्रेडिंग करने में कितने अच्छे हैं।

इस नए बेंचमार्क का उपयोग करके, शोधकर्ता अब:

  1. पहचान सकते हैं कि कौन से AI शिक्षक सबसे विश्वसनीय हैं।
  2. प्रशिक्षित कर सकते हैं कि गलतियों को ठीक करने के लिए बेहतर शिक्षक कैसे बनाए जाएं।
  3. वास्तविक दुनिया की समस्याओं को कम त्रुटियों के साथ हल करने के लिए बेहतर रीजनिंग मॉडल बना सकते हैं।

संक्षेप में, VerifyBench वह गुणवत्ता नियंत्रण जांच है जो सुनिश्चित करती है कि AI की दुनिया के "शिक्षक" वास्तव में पढ़ाने के लिए योग्य हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →