LLM-as-a-Verifier: A General-Purpose Verification Framework
यह शोध पत्र "LLM-as-a-Verifier" प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो टोकन लॉजिट अपेक्षाओं (token logit expectations) के माध्यम से निरंतर स्कोरिंग का लाभ उठाकर सत्यापन को एक नए स्केलिंग अक्ष (scaling axis) के रूप में स्थापित करता है, जिससे विविध एजेंटिक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है और बेहतर कार्य निगरानी एवं सुदृढीकरण शिक्षण (reinforcement learning) नमूना दक्षता सक्षम होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास प्रतिभाशाली लेकिन कभी-कभी अति-आत्मविश्वासी AI सहायक हैं जो जटिल समस्याओं को हल करने की कोशिश कर रहे हैं, जैसे कि कोड लिखना, एक रोबोट को ठीक करना, या किसी मरीज का निदान करना। आप जानते हैं कि यदि आप उनसे एक ही समस्या को 100 बार करने के लिए कहते हैं, तो उनमें से कम से कम एक उन्हें सही ढंग से कर लेगा। असली चुनौती उत्तर प्राप्त करना नहीं है; बल्कि यह जानना है कि कौन सा उत्तर वास्तव में सबसे अच्छा है, बिना हर बार किसी मानव विशेषज्ञ को जांच करने के लिए नियुक्त किए।
यह पेपर एक नया टूल पेश करता है जिसे LLM-as-a-Verifier कहा जाता है। इसे एक "सुपर-जज" के रूप में समझें जो केवल विजेता नहीं चुनता; बल्कि यह समझता है कि क्यों एक उत्तर दूसरे से बेहतर है, भले ही उनके बीच का अंतर बहुत सूक्ष्म हो।
यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:
1. समस्या: "टाई" (Tie) का जाल
आमतौर पर, जब हम किसी AI से दूसरे AI के काम का न्याय करने के लिए कहते हैं, तो हम उससे एक साधारण स्कोर देने को कहते हैं, जैसे कि "1 से 5 स्टार"।
- दोष: यदि दो उत्तर दोनों "अच्छे" हैं लेकिन एक थोड़ा बेहतर है, तो जज अक्सर दोनों को "4" दे देता है। यह एक टाई (Tie) पैदा करता है। सिस्टम अंतर नहीं कर पाता, इसलिए वह रैंडमली (यादृच्छिक रूप से) चुन लेता है।
- पेपर का समाधान: AI को केवल एक संख्या चुनने के लिए मजबूर करने के बजाय, नया तरीका AI को हर संभावित स्कोर की संभावना (probability) देखने के लिए कहता है। यह एक जज से पूछने जैसा है कि "क्या यह अच्छा है?" कहने के बजाय कि "इसकी 4, 4.1, 4.2, या 4.9 होने की कितनी संभावना है?" इन सभी सूक्ष्म संभावनाओं का औसत निकालकर, सिस्टम एक निरंतर स्कोर (continuous score) (जैसे 4.87) प्राप्त करता है (न कि एक मोटा पूर्णांक जैसे 5)। यह 'टाई' को समाप्त करता है और सूक्ष्म अंतरों को पहचान लेता है।
2. गुणवत्ता बढ़ाने के लिए तीन "नॉब्स" (Knobs)
पेपर दिखाता है कि आप इस "सुपर-जज" को तीन विशिष्ट "नॉब्स" (स्केलिंग एक्सिस) को बढ़ाकर और भी बेहतर बना सकते हैं:
- नॉब 1: ग्रैनुलैरिटी (Granularity - सूक्ष्मता/रूलर): केवल इंच के निशानों वाले रूलर के बजाय, मिलीमीटर के निशानों वाला रूलर उपयोग करें। स्कोरिंग स्केल जितना विस्तृत होगा (20 स्तरों तक), जज उतना ही बेहतर तरीके से एक "अच्छे" उत्तर को "शानदार" उत्तर से अलग कर पाएगा।
- नॉब 2: रिपिटिशन (Repetition - पैनल): केवल एक जज से निर्णय लेने के लिए कहने के बजाय, उसी जज से काम को 16 बार देखने और उनके विचारों का औसत निकालने के लिए कहें। यह जज के किसी भी रैंडम बुरे दिन या क्षणिक भ्रम को दूर कर देता है।
- नॉब 3: डिकम्पोजिशन (Decomposition - चेकलिस्ट): यह पूछने के बजाय कि "क्या यह पूरा प्रोजेक्ट परफेक्ट है?", इसे तोड़ दें। तीन अलग-अलग प्रश्न पूछें: "क्या इसने आवश्यकताओं को पूरा किया?", "क्या फॉर्मेट सही है?", और "क्या कोई त्रुटियां हैं?" फिर उत्तरों को मिलाएं। यह जज को एक बड़ी समस्या से विचलित होने और छोटी बारीकियों को मिस करने से रोकता है।
3. विजेता चुनने के लिए "टूर्नामेंट"
यदि आपके पास एक समस्या के 100 अलग-अलग समाधान हैं, तो प्रत्येक एक को दूसरे के विरुद्ध जांचने में बहुत समय लगेगा (और बहुत पैसा खर्च होगा)।
- पेपर का समाधान: उन्होंने एक स्मार्ट टूर्नामेंट बनाया जिसे प्रोबेबिलिस्टिक पिवट टूर्नामेंट (Probabilistic Pivot Tournament) कहा जाता है।
- कल्पना करें कि धावकों का एक घेरा है। पहले, वे एक त्वरित लैप दौड़ते हैं जहाँ हर कोई अपने पड़ोसी के खिलाफ एक बार दौड़ता है। यह जल्दी से शीर्ष कुछ धावकों की पहचान करता है।
- फिर, सिस्टम अपनी ऊर्जा केवल शीर्ष धावकों पर केंद्रित करता है, उन्हें एक-दूसरे के खिलाफ दौड़ने देता है ताकि पूर्ण चैंपियन को खोजा जा सके।
- यह उच्च सटीकता के साथ सबसे अच्छा समाधान खोजने के लिए समय और पैसा बचाता है।
4. वास्तविक दुनिया के परिणाम
लेखकों ने इस "सुपर-जज" का परीक्षण तीन बहुत अलग दुनियाओं में किया, और यह सभी में मौजूदा सर्वोत्तम तरीकों को हरा देता है:
- कोडिंग: इसने जटिल कंप्यूटर कार्यों (Terminal-Bench V2) के लिए सर्वोत्तम कोड समाधान चुनने में मदद की, जिससे 86.5% सफलता दर प्राप्त हुई।
- रोबोटिक्स: इसने रोबोट के चलने के वीडियो देखे और सही ढंग से पहचाना कि कौन सा रोबोट बेहतर प्रगति कर रहा है (RoboRewardBench), जिसने उन मॉडलों को भी पीछे छोड़ दिया जिन्हें रोबोट डेटा पर वर्षों तक प्रशिक्षित किया गया था।
- चिकित्सा: इसने सर्वोत्तम चिकित्सा सलाह योजनाओं (MedAgentBench) को चुनने में मदद की, जिससे 73.3% सफलता दर प्राप्त हुई।
5. बोनस फीचर्स: एक "प्रोग्रेस बार" और एक "कोच"
पेपर इस सिस्टम की दो अतिरिक्त महाशक्तियों पर प्रकाश डालता है:
- प्रोग्रेस बार (Progress Bar): क्योंकि जज इतने विस्तृत स्कोर देता है, यह आपको बता सकता है कि एक एजेंट किसी कार्य में कितना आगे है। यदि कोई AI कोड लिख रहा है, तो स्कोर लगातार बढ़ता जाता है। यदि वह फंस जाता है या गलती करता है, तो स्कोर स्थिर हो जाता है या गिर जाता है। यह जटिल AI कार्यों के लिए एक लाइव "प्रोग्रेस बार" के रूप में कार्य करता है, जिससे मनुष्यों को पता चल जाता है कि क्या कोई AI घंटों बर्बाद करने से पहले फंस गया है।
- सीखने के लिए कोच (Coach for Learning): यह सिस्टम अन्य AI को प्रशिक्षित करने के लिए "डेंस रिवॉर्ड" (dense reward) के रूप में कार्य कर सकता है। केवल कार्य के अंत में "आप विफल रहे" कहने के बजाय, यह प्रगति के हर छोटे कदम के लिए छोटे, निरंतर अंक देता है। यह रोबोट और गणित हल करने वाले AI को बहुत तेज़ी से सीखने में मदद करता है (रोबोट के लिए लगभग 1.8 गुना तेज़) क्योंकि उन्हें अधिक बार फीडबैक मिलता है।
सारांश
LLM-as-a-Verifier अन्य AI के काम की जांच करने के लिए AI का उपयोग करने का एक नया तरीका है। केवल अंतिम उत्तर के बजाय उनके सोचने की विस्तार (संभावनाओं) को देखकर, और कार्यों को छोटे हिस्सों में तोड़ने और टूर्नामेंट चलाने जैसी स्मार्ट रणनीतियों का उपयोग करके, यह पहले से कहीं अधिक तेज़ी और सटीकता से सर्वोत्तम समाधान खोजता है। यह बिना किसी विशेष कार्य के लिए पुन: प्रशिक्षित (retrain) हुए काम करता है, जो इसे कोडिंग, रोबोटिक्स और चिकित्सा के लिए एक सार्वभौमिक उपकरण बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।