Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
यह शोध पत्र Duel-Evolve को प्रस्तुत करता है, जो एक रिवॉर्ड-फ्री टेस्ट-टाइम स्केलिंग विधि है जो एक बेयसियन इवोल्यूशनरी फ्रेमवर्क के भीतर एक LLM की अपनी पेयरवाइज सेल्फ-प्रेफरेंसेस (pairwise self-preferences) का लाभ उठाकर गणित और कोडिंग बेंचमार्क पर मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है, जिसमें किसी बाहरी रिवॉर्ड मॉडल या ग्राउंड-ट्रुथ लेबल की आवश्यकता नहीं होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, धुंध भरी भूलभुलैया में छिपे हुए खजाने तक पहुँचने का सबसे अच्छा रास्ता खोजने की कोशिश कर रहे हैं। आपके पास एक मार्गदर्शक (लार्ज लैंग्वेज मॉडल, या LLM) है जो आपको रास्ते सुझा सकता है, लेकिन आपके पास कोई नक्शा, जीपीएस या दिशा-सूचक यंत्र (कम्पास) नहीं है। वास्तव में, आपको तब तक पता नहीं चलता कि खजाना कहाँ है जब तक कि आप अचानक उस पर ठोकर नहीं खा जाते।
यह वही समस्या है जिसका सामना शोधकर्ताओं ने गणित की समस्याओं या कोडिंग जैसे जटिल कार्यों के लिए एआई (AI) के उत्तरों में सुधार करने के दौरान किया था। आमतौर पर, आपको एक "स्कोरकार्ड" की आवश्यकता होती है जो एआई को बता सके, "यह उत्तर 10 में से 8 है, इसे 9 तक ले जाने का प्रयास करें।" लेकिन कई कठिन कार्यों के लिए, एक आदर्श स्कोरकार्ड बनाना असंभव है, बहुत महंगा है, या उसका अस्तित्व ही नहीं है।
पेश है DUEL-EVOLVE। इसे एक धुंध भरी भूलभुलैया में बिना किसी स्कोरकार्ड के नेविगेट करने के एक क्रांतिकारी तरीके के रूप में सोचें।
पुराना तरीका: अकेला आलोचक (The Lonely Critic)
पहले, विधियाँ एआई से यह पूछने की कोशिश करती थीं, "1 से 10 के पैमाने पर आपका उत्तर कितना अच्छा है?"
- समस्या: एआई निरंतर संख्याएँ देने में बुरा है। यह आज एक उत्तर को "8" कह सकता है और कल उसी उत्तर को "6" कह सकता है। यह एक दोस्त से किसी फिल्म को 1 से 10 के पैमाने पर रेट करने के बारे में पूछने जैसा है; वे असंगत हो सकते हैं, या उन्हें नियम पता भी नहीं हो सकते।
नया तरीका: टूर्नामेंट (DUEL-EVOLVE)
एक संख्या माँगने के बजाय, DUEL-EVOLVE एक बहुत ही सरल प्रश्न पूछता है: "उत्तर A और उत्तर B के बीच, कौन सा बेहतर है?"
यह एक बॉक्सिंग मैच या टेनिस टूर्नामेंट की तरह है। यह कहना बहुत आसान है कि "खिलाड़ी A ने खिलाड़ी B की तुलना में गेंद को बेहतर तरीके से मारा" बजाय इसके कि यह कहना कि "खिलाड़ी A ने ठीक 85% शक्ति के साथ गेंद को मारा।"
यहाँ बताया गया है कि DUEL-EVOLVE चरण-दर-चरण कैसे काम करता है, एक रचनात्मक उपमा का उपयोग करते हुए:
1. अखाड़ा (The Population)
एक विशाल अखाड़े की कल्पना करें जो सैकड़ों अलग-अलग "प्रतियोगियों" (उम्मीदवार उत्तरों) से भरा है जिन्हें एआई द्वारा बनाया गया है। कुछ बहुत खराब हैं, कुछ ठीक-ठाक हैं, और कुछ शानदार हैं।
2. रेफरी (The Self-Judge)
एआई स्वयं अपना रेफरी बनता है। इसे किसी बाहरी जज की आवश्यकता नहीं है। यह दो प्रतियोगियों को देखता है, मान लीजिए "उम्मीदवार A" और "उम्मीदवार B," और एक विजेता घोषित करता है।
- नोट: रेफरी पूर्ण नहीं है। कभी-कभी वह गलत हो जाता है (शोर/नॉइज़)। लेकिन यदि आप पर्याप्त मैच देखते हैं, तो सत्य उभरने लगता है।
3. स्कोरबोर्ड (The Bayesian Model)
यही जादू वाला हिस्सा है। सिस्टम हर मैच का हिसाब रखता है। यह सभी बिखरे हुए "A ने B को हराया" और "B ने C को हराया" जैसे परिणामों को एक वैश्विक रैंकिंग में बदलने के लिए एक विशेष गणितीय ट्रिक (जिसे ब्रैडली-टेरी मॉडल कहा जाता है) का उपयोग करता है।
- यह एक स्पोर्ट्स लीग टेबल की तरह है। भले ही टीम A ने टीम B के साथ मैच न खेला हो, फिर भी टेबल यह अनुमान लगा सकता है कि टीम A किसके मुकाबले बेहतर होने की संभावना रखती है, इस आधार पर कि उन्होंने किससे जीत हासिल की और किससे हार।
- महत्वपूर्ण रूप से, सिस्टम अनिश्चितता (uncertainty) को भी ट्रैक करता है। यदि इसने दो उम्मीदवारों के बीच पर्याप्त मैच नहीं देखे हैं, तो यह जानता है कि वह अभी तक यह तय करने में अनिश्चित है कि कौन बेहतर है।
4. रणनीति (Double Thompson Sampling)
सिस्टम के पास "मैच" देखने के लिए एक सीमित बजट होता है इससे पहले कि समय समाप्त हो जाए। इसे यह तय करने में स्मार्ट होना चाहिए कि किन लोगों को आपस में लड़ाया जाए।
- स्मार्ट मूव: यह सबसे खराब प्रतियोगियों को आपस में लड़ने में समय बर्बाद नहीं करता है। इसके बजाय, यह "अनिश्चितता" के डेटा का उपयोग उन सबसे आशाजनक मैचों को चुनने के लिए करता है। यह पूछता है, "वे शीर्ष दावेदार कौन हैं जिनके बारे में हम अभी 100% सुनिश्चित नहीं हैं?"
- यह सबसे अच्छे "माता-पिता" (वर्तमान विजेता) को भी चुनता है ताकि अगले दौर के लिए बेहतर और उन्नत प्रतियोगी तैयार किए जा सकें।
5. विकास (The Loop)
प्रक्रिया दोहराई जाती है:
- लड़ाई (Fight): एआई उम्मीदवारों को एक-दूसरे के विरुद्ध खड़ा करता है।
- रैंकिंग (Rank): सिस्टम लीग टेबल को अपडेट करता है।
- प्रजनन (Breed): एआई टेबल के सबसे अच्छे उम्मीदवारों को लेता है और पूछता है, "जिस वजह से ये विजेता बने, उसके आधार पर, क्या आप इससे भी बेहतर कुछ बना सकते हैं?"
- दोहराव (Repeat): नए, बेहतर उम्मीदवार अखाड़े में प्रवेश करते हैं।
यह एक बड़ी बात क्यों है?
इस पेपर ने दो बहुत कठिन चुनौतियों पर इसका परीक्षण किया:
- MathBench: जटिल गणितीय शब्द समस्याओं को हल करना।
- LiveCodeBench: ऐसे कोड लिखना जो छिपे हुए टेस्ट को पास कर सकें।
परिणाम:
- गणित (Math): DUEL-EVOLVE ने 94% सटीकता प्राप्त की, जो अगले सबसे अच्छे तरीके को एक बड़े अंतर (20 अंक!) से पीछे छोड़ देता है।
- कोडिंग (Coding): इसने अन्य उन्नत विधियों की तुलना में सटीकता में 12% से अधिक सुधार किया।
मुख्य निष्कर्ष (The Takeaway)
सबसे आश्चर्यजनक बात यह है कि DUEL-EVOLVE को किसी शिक्षक की आवश्यकता नहीं थी।
- इसे उत्तरों को ग्रेड करने के लिए किसी इंसान की आवश्यकता नहीं थी।
- इसे गणित या कोड के लिए किसी पूर्व-निर्धारित "स्कोरकार्ड" की आवश्यकता नहीं थी।
- इसे खोज के दौरान सही उत्तर जानने की भी आवश्यकता नहीं थी।
इसे बस अपने विचारों की आपस में तुलना करने की आवश्यकता थी। एआई को टूर्नामेंट आयोजक, रेफरी और कोच तीनों में बदलकर, इसने उन समस्याओं को हल करने के लिए अपनी बुद्धिमत्ता को विकसित करने में सफलता प्राप्त की जिन्हें वह पहली बार में हल नहीं कर सका था।
संक्षेप में: एआई से यह पूछने के बजाय कि "यह कितना अच्छा है?", DUEL-EVOLVE पूछता है "कौन बेहतर है?" और उसे पूर्ण उत्तर तक लड़ने का मौका देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।