← नवीनतम पेपर
💬 NLP

SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning

SERPO ओपन-एंडेड टेस्ट-टाइम रीइन्फोर्समेंट लर्निंग के लिए एक स्व-विकसित (self-evolving) फ्रेमवर्क पेश करता है जो उत्तर मतदान (answer voting) को रिस्पॉन्स आर्काइव्स, क्वेरी-विशिष्ट रूब्रिक्स और पॉलिसी पैरामीटर्स के सह-अनुकूलन (co-optimization) वाले एक क्लोज्ड-लूप सिस्टम से बदल देता है ताकि विश्वसनीय रिवॉर्ड सिग्नल उत्पन्न किए जा सकें और इन-डोमेन एवं आउट-ऑफ-डिस्ट्रीब्यूशन बेंचमार्क में महत्वपूर्ण प्रदर्शन लाभ प्राप्त किए जा सकें।

मूल लेखक: Jianze Wang, Kunwang Zheng, Ying Liu, Yu Cao, Qilong Zhang, Jinlong Chen, Hua Yang, Qianglong Chen

प्रकाशित 2026-07-30
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianze Wang, Kunwang Zheng, Ying Liu, Yu Cao, Qilong Zhang, Jinlong Chen, Hua Yang, Qianglong Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बेहतरीन कहानी लिखना सिखा रहे हैं, लेकिन आपके पास एक अजीब नियम है: आप उसे कभी भी "सही" अंत नहीं दिखा सकते, और आप उसके काम को ग्रेड करने के लिए किसी मानव शिक्षक को भी नहीं रख सकते। यह टेस्ट-टाइम रिइन्फोर्समेंट लर्निंग (TTRL) की चुनौती है। आमतौर पर, जब कंप्यूटर सीखते हैं, तो उन्हें एक स्पष्ट "सही" उत्तर दिया जाता है, जैसे कि गणित की समस्या जिसका एक ही समाधान होता है। लेकिन खुले और रचनात्मक लेखन की उलझी हुई दुनिया में—जैसे चिकित्सा सलाह देना या जटिल विज्ञान को समझाना—कोई एक "सही" उत्तर नहीं होता। दो बेहतरीन कहानियाँ पूरी तरह से अलग दिख सकती हैं।

इस समस्या को हल करने के लिए, वैज्ञानिकों ने वोटिंग (मतदान) नामक एक तरकीकिब आजमाई है। वे रोबोट को एक कहानी के दस अलग-अलग संस्करण लिखने के लिए कहते हैं, और फिर उस संस्करण को चुनते हैं जिससे बाकी अन्य संस्करण सबसे अधिक सहमत होते हैं। यह एक पहेली का उत्तर गेस करने के लिए भीड़ से पूछने जैसा है; यदि अधिकांश लोग "सेब" कहते हैं, तो रोबोट मान लेता है कि "सेब" सही है। लेकिन यह तरीका तब विफल हो जाता है जब उत्तर रचनात्मक या सूक्ष्म होते हैं। यदि दस लोग चिकित्सा सलाह के दस अलग-अलग लेकिन समान रूप से अच्छे संस्करण देते हैं, तो रोबोट भ्रमित हो सकता है, या इससे भी बुरा, वह एक ऐसा "लोकप्रिय" उत्तर चुन सकता है जिसमें वास्तव में एक महत्वपूर्ण सुरक्षा चेतावनी गायब है क्योंकि सभी ने उसे बताना भूल गए थे। यह विधि बताती है कि केवल वोटों की गिनती करने के बजाय, हमें गुणवत्ता को आंकने का एक स्मार्ट तरीका चाहिए।


समस्या: जब "सबसे लोकप्रिय" "सर्वश्रेष्ठ" नहीं होता

कल्पना कीजिए कि आप एक टैलेंट शो में जज हैं जहाँ प्रतियोगी एक बीमार व्यक्ति को सबसे अच्छी सलाह देने की कोशिश कर रहे हैं। पुराने तरीके में (यानी "वोटिंग" विधि), जज सभी सलाहों को देखेगा, देखेगा कि किस सलाह को सबसे अधिक प्रतियोगियों ने दिया, और कहेगा, "ठीक है, यह विजेता है!"

लेकिन यहाँ एक पेंच है: क्या होगा अगर सबसे लोकप्रिय सलाह यह थी, "पानी पिएं और आराम करें"? यह अच्छी सलाह है, लेकिन क्या होगा अगर मरीज की स्थिति गंभीर है जिसके लिए तुरंत डॉक्टर की आवश्यकता है? यदि प्रत्येक प्रतियोगी डॉक्टर का जिक्र करना भूल गया, तो "वोटिंग" प्रणाली अभी भी "पानी पिएं" को विजेता के रूप में चुनेगी क्योंकि यह सबसे आम उत्तर था। रोबोट लोकप्रियता के लिए सीखता है, न कि सुरक्षा या सटीकता के लिए। यह एक ऐसे छात्र की तरह है जो परीक्षा के सबसे सामान्य उत्तर रट लेता है लेकिन अंतर्निहित तर्क को समझने में विफल रहता है, जिससे वास्तविक जीवन में खतरनाक गलतियाँ होती हैं।

समाधान: SERPO, स्व-विकसित रूब्रिक (स्व-परिवर्तित नियम पुस्तिका)

यहाँ SERPO (सेल्फ-इवॉल्विंग रूब्रिक पॉलिसी ऑप्टिमाइजेशन) आता है। SERPO को केवल वोटों की गिनती करने वाले जज के रूप में नहीं, बल्कि एक डायनेमिक नियम पुस्तिका के रूप में सोचें जो खेल खेले जाने के दौरान खुद को लिखती है।

यह पूछने के बजाय कि, "किस उत्तर पर अधिकांश लोग सहमत हैं?", SERPO पूछता है, "कौन से विशिष्ट नियम एक उत्तर को दूसरे से बेहतर बनाते हैं?" यह तीन चीजों का एक क्लोज्ड लूप बनाकर ऐसा करता है जो लगातार एक-दूसरे को अपग्रेड करते हैं:

  1. एविडेंस आर्काइव (अच्छा, सामान्य और बुरा):
    हर बार जब रोबोट किसी प्रश्न का उत्तर देने की कोशिश करता है, तो SERPO तीन विशिष्ट उदाहरणों को सहेजता है: एक जो अच्छा (Good) साबित हुआ, एक जो सामान्य (Normal) था, और एक जो बुरा (Bad) था। यह केवल "सर्वश्रेष्ठ" को नहीं बचाता; यह पूरे स्पेक्ट्रम को बचाता है। यह एक कोच द्वारा खिलाड़ी के सर्वश्रेष्ठ गोल, एक औसत पास और एक भयानक गलती के वीडियो रील को अगल-बगल रखने जैसा है।

  2. रूब्रिक (नियम पुस्तिका):
    SERPO अच्छे, सामान्य और बुरे उदाहरणों के बीच के अंतर को देखता है और पूछता है, "किस बात ने अच्छे वाले को बेहतर बनाया?" शायद अच्छे वाले ने एक विशिष्ट चेतावनी का उल्लेख किया जिसे बुरे वाले ने छोड़ दिया था। SERPO उस अंतर को पकड़ने के लिए एक नया नियम (एक "मानदंड") लिखता है। यह एक शिक्षक की तरह है जिसे एहसास होता है कि छात्र अपने स्रोतों का उल्लेख करना भूल रहे हैं, इसलिए वह अपनी ग्रेडिंग शीट में एक नया नियम जोड़ देता है: "कम से कम एक स्रोत शामिल करना अनिवार्य है।"
    महत्वपूर्ण बात यह है कि यह नियम पुस्तिका स्थिर नहीं है। जैसे-जैसे रोबोट बेहतर होता है, पुराने नियम बहुत आसान हो सकते हैं। SERPO कमजोर नियमों को हटा देता है और नए, कठिन नियम बनाता है ताकि रोबोट को चुनौती मिलती रहे।

  3. पॉलिसी (रोबोट का मस्तिष्क):
    रोबोट अपने भविष्य के प्रयासों को ग्रेड करने के लिए इन नए नियमों का उपयोग करता है। यदि वह नए "स्रोत उद्धरण" नियम का पालन करता है, तो उसे उच्च स्कोर मिलता है। यदि वह इसे भूल जाता है, तो उसे कम स्कोर मिलता है। फिर वह अपने मस्तिष्क को अगली बार और बेहतर प्रयास करने के लिए अपडेट करता है।

यह कैसे काम करता है: "अच्छा-सामान्य-बुरा" का नृत्य

जादू एक लूप में होता है।

  • चरण 1: रोबोट कई उत्तर उत्पन्न करता है।
  • चरण 2: SERPO उन्हें "अच्छा", "सामान्य" और "बुरा" ढेर में वर्गीकृत करता है।
  • चरण 3: सिस्टम "अच्छे" ढेर और "बुरे" ढेर को देखता है और पूछता है, "सटीक अंतर क्या है?"
  • चरण 4: यह उस अंतर को पहचानने के लिए एक विशिष्ट नियम बनाता है। उदाहरण के लिए, यदि "अच्छी" चिकित्सा सलाह में रक्तचाप (ब्लड प्रेशर) की जाँच का उल्लेख था और "बुरी" वाली में नहीं था, तो नया नियम होगा: "गर्भावस्था के सिरदर्द के लिए ब्लड प्रेशर की जाँच का उल्लेख करना अनिवार्य है।"
  • चरण 5: रोबोट को इस नए नियम का पालन करने के लिए पुरस्कृत किया जाता है।
  • चरण 6: रोबोट फिर से प्रयास करता है, और चक्र दोहराया जाता है।

यह वोटिंग से अलग है क्योंकि इसे इस बात से फर्क नहीं पड़ता कि क्या सभी सहमत हैं। इसे इस बात से फर्क पड़ता है कि उत्तर सुरक्षित और पूर्ण है या नहीं। भले ही दस में से केवल एक रोबोट ने ब्लड प्रेशर चेक करने की बात समझी हो, SERPO उस अंतर को देखता है, उसके लिए एक नियम बनाता है, और पूरे समूह को इसे करने के लिए सिखाता है।

परिणाम: स्मार्ट, सुरक्षित और अधिक अनुकूलनीय

शोधकर्ताओं ने इस विचार का परीक्षण दो अलग-अलग प्रकार के प्रश्नों पर किया: चिकित्सा सलाह (HealthBench) और वैज्ञानिक अनुसंधान प्रश्न (ResearchQA)। उन्होंने दो अलग-अलग आकार के रोबोट दिमागों (4 बिलियन और 9 बिलियन पैरामीटर्स) का उपयोग किया।

परिणाम काफी प्रभावशाली थे। जब रोबोट ने SERPO का उपयोग करके सीखा:

  • चिकित्सा प्रश्नों पर, इसने शुरुआती रोबोट की तुलना में 20.63 अंक तक सुधार किया।
  • वैज्ञानिक प्रश्नों पर, इसमें 20.31 अंक तक सुधार हुआ।
  • उनके द्वारा चलाए गए छह परीक्षणों में से, औसत स्कोर 8.06 अंक बढ़ गया।

लेकिन सबसे शानदार बात केवल स्कोर नहीं थी; वह ट्रांसफर (स्थानांतरण) था। जब उन्होंने रोबोट को चिकित्सा प्रश्नों पर प्रशिक्षित किया और फिर उससे विज्ञान के बारे में प्रश्न पूछे (जो उसने पहले कभी नहीं देखे थे), तो भी इसने पुराने "वोटिंग" तरीके से प्रशिक्षित रोबतों की तुलना में बेहतर प्रदर्शन किया। यह सुझाव देता है कि SERPO ने रोबोट को केवल लोकप्रिय उत्तरों को रटने के बजाय, गुणवत्ता के बारे में सोचना सिखाया।

पेपर ने यह भी दिखाया कि यह विधि बिना किसी मानव शिक्षक या बाहरी "सुपर-जज" की मदद के काम करती है। रोबोट अपने स्वयं के "अच्छे" और "बुरे" प्रयासों की तुलना करके खुद को सिखाता है।

यह क्यों महत्वपूर्ण है

यह दृष्टिकोण AI के जटिल, खुले कार्यों को संभालने के तरीके को बदल देता है। यह उम्मीद करने के बजाय कि "सबसे लोकप्रिय" उत्तर सही होगा, SERPO एक ऐसा सिस्टम बनाता है जो "अच्छे" की अपनी परिभाषा को लगातार परिष्कृत करता है। यह एक ऐसे छात्र की तरह है जो केवल उत्तर कुंजी को रटता नहीं है, बल्कि अपना खुद का ग्रेडिंग रूब्रिक लिखना सीखता है, जिससे यह सुनिश्चित होता है कि वह हर अंक के पीछे के "क्यों" को समझता है।

लेखकों का सुझाव है कि यह विधि AI सिस्टम को स्वास्थ्य सेवा जैसे क्षेत्रों में सुरक्षित और अधिक विश्वसनीय बनाने में मदद कर सकती है, जहाँ एक छोटी सी जानकारी छूट जाना भी गंभीर परिणाम दे सकता है। अपने स्वयं के नियम विकसित करके, AI नई स्थितियों के अनुकूल हो सकता है और उन सूक्ष्म त्रुटियों को पकड़ सकता है जिन्हें एक साधारण वोटिंग सिस्टम मिस कर सकता है। यह एक ऐसे AI की ओर कदम है जो केवल भीड़ का अनुसरण नहीं करता, बल्कि वास्तव में यह समझता है कि एक अच्छा उत्तर क्या बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →