← नवीनतम पेपर
💬 NLP

ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning

यह शोध पत्र ARES को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो कच्चे दस्तावेज़ों से बड़े पैमाने पर, इंस्टेंस-विशिष्ट रूब्रिक-आधारित प्रशिक्षण डेटा को स्वचालित रूप से संश्लेषित करता है ताकि बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में सुदृढीकरण अधिगम (रीइन्फोर्समेंट लर्निंग) के प्रदर्शन को, विशेष रूप से जटिल, बहु-आयामी मुक्त-अंत वाले कार्यों के लिए, महत्वपूर्ण रूप से बढ़ाया जा सके।

मूल लेखक: Xiaoyuan Li, Keqin Bao, Moxin Li, Yubo Ma, Yichang Zhang, Wenjie Wang, Fuli Feng, Dayiheng Liu

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoyuan Li, Keqin Bao, Moxin Li, Yubo Ma, Yichang Zhang, Wenjie Wang, Fuli Feng, Dayiheng Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ARES पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

बड़ी समस्या: "सही या गलत" का जाल

कल्पना कीजिए कि आप एक रोबोट को लिखना सिखा रहे हैं। वर्तमान में, रोबोट को स्मार्ट बनाने का सबसे अच्छा तरीका उन्हें गणित के सवाल या कोडिंग की पहेलियाँ देना है। क्यों? क्योंकि इनके स्पष्ट उत्तर होते हैं। यदि रोबोट 2+2=42+2=4 हल करता है, तो उसे एक गोल्ड स्टार मिलता है। यदि वह $5$ कहता है, तो उसे लाल 'X' मिलता है। इसे स्वचालित रूप से जांचना आसान है।

लेकिन क्या होगा यदि आप चाहते हैं कि रोबोट एक कविता लिखे, चिकित्सा सलाह दे, या जटिल निर्देशों का पालन करे? यहाँ कोई एक "सही" उत्तर नहीं होता। एक कविता कई तरह से सुंदर हो सकती है। एक चिकित्सा उत्तर सुरक्षित, सटीक और सहानुभूतिपूर्ण होना चाहिए।

मौजूदा तरीके इस समस्या को ठीक करने के लिए किसी इंसान (या दूसरे AI) से एक साधारण "अच्छा" या "बुरा" रेटिंग देने के लिए कहते हैं। लेकिन यह एक ऐसे शिक्षक की तरह है जो यह बताए बिना कि छात्र ने क्या अच्छा किया या वह क्या भूल गया, केवल "अच्छा काम किया" कह देता है। रोबोट को प्रभावी ढंग से सीखने में मदद करने के लिए यह बहुत अस्पष्ट है।

समाधान: ARES (स्वचालित रूब्रिक मेकर)

लेखकों ने ARES (Automated Rubric synthEsis for Scalable RL) का प्रस्ताव दिया है। ARES को एक अत्यधिक कुशल, अथक शिक्षण सहायक (teaching assistant) के रूप में सोचें जो केवल पेपरों को ग्रेड नहीं देता; बल्कि वह ग्रेडिंग के नियम (rubrics) और टेस्ट के प्रश्न दोनों को एक साथ लिखता है।

यह कैसे काम करता है, इसके चरण यहाँ दिए गए हैं:

1. कच्चा माल (लाइब्रेरी)

एक विशाल पुस्तकालय की कल्पना करें जिसमें किताबें और लेख (pretraining documents) हैं जिन्हें रोबोट पहले ही पढ़ चुका है लेकिन अभी तक उन पर उसका परीक्षण नहीं किया गया है।

  • पुराना तरीका: आप कुछ किताबें चुन सकते हैं, विशेषज्ञों को प्रश्न लिखने के लिए रख सकते हैं, और फिर प्रत्येक प्रश्न के लिए विस्तृत ग्रेडिंग गाइड (rubrics) लिखने के लिए विशेषज्ञों को नियुक्त कर सकते हैं। यह धीमा, महंगा और स्केल करने में कठिन है।
  • ARES का तरीका: ARES इन कच्ची किताबों को स्वचालित रूप से एक टेस्ट में बदल देता है।

2. जादुई ट्रिक (को-जेनरेशन/Co-Generation)

ARES टेक्स्ट के एक पन्ने को देखता है और तुरंत एक ही बार में तीन चीजें करता है:

  1. प्रश्न लिखता है: यह उस टेक्स्ट के आधार पर एक प्रश्न बनाता है (जैसे, "इस दवा के दुष्प्रभाव क्या हैं?")।
  2. उत्तर लिखता है: वह टेक्स्ट के आधार पर सही उत्तर जानता है।
  3. ग्रेडिंग रूब्रिक लिखता है: यही असली सीक्रेट सॉस है। केवल "सही/गलत" के बजाय, ARES विशिष्ट वेटेज (weights) के साथ एक चेकलिस्ट बनाता है।
    • उदाहरण: "क्या आपने दुष्प्रभाव का उल्लेख किया? (+10 अंक)।" "क्या आपने एलर्जी के बारे में चेतावनी दी? (+8 अंक)।" "क्या आपने कोई फर्जी दुष्प्रभाव बताया? (-10 अंक)।"

3. "पर्सोना" का ट्विस्ट

प्रशिक्षण को विविध बनाने के लिए, ARES केवल एक रोबोट की तरह प्रश्न नहीं पूछता। यह प्रश्न को एक पर्सोना (व्यक्तित्व) सौंप देता है।

  • कल्पना कीजिए कि वही मेडिकल आर्टिकल है।
  • पर्सोना A (डॉक्टर): प्रश्न तकनीकी विवरण मांगता है।
  • पर्सोना B (छात्र): प्रश्न एक सरल व्याख्या मांगता है।
  • पर्सोना C (देखभाल करने वाला/Caregiver): प्रश्न दैनिक देखभाल युक्तियों के बारे में पूछता है।
    यह सुनिश्चित करता है कि रोबोट केवल एक शैली में नहीं, बल्कि विभिन्न प्रकार के लोगों से बात करना सीखे।

4. गुणवत्ता नियंत्रण (द फिल्टर)

रोबोट को डेटा दिखाने से पहले, ARES एक सख्त गुणवत्ता जांच चलाता है:

  • क्या प्रश्न मूल पुस्तक को देखे बिना उत्तर देने योग्य है? (Self-contained)।
  • क्या उत्तर वास्तव में पुस्तक में मौजूद है? (Faithful)।
  • क्या ग्रेडिंग चेकलिस्ट तार्किक है?
    यदि कोई प्रश्न बहुत अस्पष्ट है या चेकलिस्ट खराब है, तो ARES उसे हटा देता है।

यह क्यों महत्वपूर्ण है (परिणाम)

लेखकों ने 10 विभिन्न क्षेत्रों (जैसे स्वास्थ्य सेवा, यात्रा, कोडिंग और सामाजिक विज्ञान) में 1,00,000 जनरेट किए गए उदाहरणों पर इस नए तरीके का परीक्षण किया।

उन्होंने ARES के साथ प्रशिक्षित अपने रोबोट की तुलना अन्य तरीकों से की:

  • मानक पठन (Standard Reading): केवल अधिक किताबें पढ़ना (Continual Pretraining)।
  • इमिटेशन लर्निंग (Imitation Learning): उत्तरों की हुबहू नकल करना (Supervised Fine-Tuning)।
  • बाइनरी RL (Binary RL): केवल "अच्छा/बुरा" स्कोर प्राप्त करना (Binary-reward RL)।

परिणाम:
ARES के साथ प्रशिक्षित रोबोट काफी बेहतर हुआ, विशेष रूप से ओपन-एंडेड कार्यों में।

  • स्वास्थ्य सेवा (Healthcare): इसमें 6.4 अंक का सुधार हुआ। इसने सुरक्षित और अधिक पूर्ण सलाह देना सीखा क्योंकि रूब्रिक ने सुरक्षा चेतावनियों को छोड़ने पर अंक काटे।
  • निर्देश पालन (Instruction Following): इसमें 15.5 अंक का सुधार हुआ। इसने जटिल नियमों का पालन करना सीखा (जैसे "शेक्सपियर की शैली में एक कविता लिखें लेकिन 'e' अक्षर का उपयोग न करें") क्योंकि रूब्रिक ने इन नियमों को विशिष्ट, जांचने योग्य मदों में तोड़ दिया था।

मुख्य निष्कर्ष (The Takeaway)

पिछले तरीकों को एक ऐसे शिक्षक के रूप में सोचें जो केवल अंतिम ग्रेड "पास" या "फेल" देता है।
ARES एक ऐसे शिक्षक की तरह है जो आपको प्रत्येक असाइनमेंट के लिए एक विस्तृत रिपोर्ट कार्ड देता है, जो आपको बताता है कि आपने वास्तव में कौन से अंक अर्जित किए और आपने कहाँ अंक खो दिए, और फिर उस रिपोर्ट का उपयोग आपको विशेष रूप से आपके कमजोर क्षेत्रों पर अभ्यास करने में मदद करने के लिए करता है।

कच्चे टेक्स्ट से इन विस्तृत रिपोर्ट कार्डों (रूब्रिक्स) को स्वचालित करके, ARES AI को जटिल, मानव-समान कौशल (जैसे लेखन, सलाह देना और तर्क करना) सिखाने की अनुमति देता है, जो पहले असंभव स्तर पर था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →