← नवीनतम पेपर
🤖 machine learning

EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

EvoRubrics एक सह-विकासवादी सुदृढीकरण अधिगम (co-evolutionary reinforcement learning) ढांचे को पेश करता है जहाँ एक नीति मॉडल (policy model) और एक रूब्रिक जनरेटर वास्तविक समय में एक-दूसरे के अनुकूल प्रतिकूल रूप से (adversarially) अनुकूलित होते हैं, जो गतिशील, विभेदक पुरस्कार प्रदान करने के लिए स्थिर मानदंडों की सीमाओं को पार करते हैं जो स्व-पर्यवेक्षित शिक्षण और स्वचालित पाठ्यक्रम निर्माण को सक्षम करते हैं।

मूल लेखक: Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Zheng Li, Jinyang Zhang, Zhijing Wu, Junfeng Zhao, Yasha Wang

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Zheng Li, Jinyang Zhang, Zhijing Wu, Junfeng Zhao, Yasha Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट शेफ को बेहतरीन भोजन बनाना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका: स्थिर रेसिपी बुक (The Static Recipe Book)

अतीत में, शोधकर्ता रोबोट के खाना बनाने का आकलन करने के लिए उसे एक निश्चित रेसिपी बुक (जिसे "स्टैटिक रूब्रिक" कहा जाता है) देते थे।

  • समस्या: शुरुआत में, रोबोट एक बहुत बुरा कुक होता है। रेसिपी बुक इतनी सख्त होती है कि वह रोबोट को हर चीज़ के लिए "0" देती है, भले ही वह पहले से थोड़ा बेहतर क्यों न हुआ हो। इससे रोबोट हतोत्साहित हो जाता है और सीखना बंद कर देता है।
  • बाद में: जैसे-जैसे रोबोट बेहतर होता है, वह ठीक-ठाक भोजन बनाना शुरू कर देता है। लेकिन क्योंकि रेसिपी बुक कभी नहीं बदलती, रोबोट अंततः पुराने नियमों के अनुसार हर व्यंजन को पूरी तरह से बनाने लगता है। जज अब एक "अच्छे" भोजन और एक "शानदार" भोजन के बीच अंतर नहीं कर पाता। रोबोट एक सीमा (ceiling) पर पहुँच जाता है और सुधार करना बंद कर देता है, या इससे भी बुरा, वह केवल टेस्ट पास करने के लिए पर्याप्त काम करके "सिस्टम को चकमा देने" (gaming the system) की कला सीख जाता है।

नया तरीका: "इवो-रूब्रिक्स" (EvoRubrics) का नृत्य

यह पेपर EvoRubrics पेश करता है, जो एक कुकिंग इंस्ट्रक्टर को नियुक्त करने जैसा है जो रोबोट शेफ के साथ-साथ विकसित होता है।

एक स्थिर किताब के बजाय, यहाँ दो AI पात्र एक ट्रेनिंग लूप में एक साथ नृत्य कर रहे हैं:

  1. शेफ (पॉलिसी LLM): बेहतर भोजन बनाने की कोशिश करता है।
  2. क्रिटिक (रूब्रिक जनरेटर): भोजन को परखने के नियम लिखता है।

वे सह-विकसित (co-evolve) कैसे होते हैं:

  • राउंड 1: शेफ एक भोजन बनाता है। क्रिटिक भोजन को परखने के लिए नियमों का एक सेट लिखता है।
  • ट्विस्ट: जैसे-जैसे शेफ बेहतर होता है, क्रिटिक स्वचालित रूप से नियमों को अधिक कठिन और विशिष्ट बना देता है। यदि शेफ एक परफेक्ट ऑमलेट बनाना सीख जाता है, तो क्रिटिक तुरंत सही बनावट (texture), सही सीजनिंग और प्लेटिंग स्टाइल की तलाश करने लगता है।
  • परिणाम: क्रिटिक चुनौती देना कभी बंद नहीं करता। शेफ क्रिटिक को प्रभावित करने की कोशिश करना कभी बंद नहीं करता। वे एक-दूसरे को बेहतर बनाने के लिए प्रेरित करते हैं, जिससे एक प्राकृतिक "करिकुलम" बनता है जो छात्र के सीखने के साथ-साथ कठिन होता जाता है।

असली सीक्रेट सॉस: एडवर्सरियल को-इवोल्यूशन (Adversarial Co-Evolution)

पेपर इसे "एडवर्सरियल को-इवोल्यूशन" कहता है। इसे एक वीडियो गेम की तरह समझें जहाँ प्लेयर और गेम की कठिनाई दोनों को दो अलग-अलग AI एजेंटों द्वारा नियंत्रित किया जाता है जो एक साथ सीख रहे हैं।

  • यदि प्लेयर बहुत अच्छा हो जाता है, तो गेम स्वचालित रूप से अधिक दुश्मन और कठिन स्तर जोड़ देता है।
  • यदि गेम बहुत कठिन हो जाता है, तो प्लेयर जीतने के लिए नई रणनीतियाँ सीखता है।
  • क्योंकि वे एक साथ प्रशिक्षित किए जाते हैं, वे पूरी तरह से मेल खाते रहते हैं। गेम कभी उबाऊ (बहुत आसान) या असंभव (बहुत कठिन) नहीं होता।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

शोधकर्ताओं ने इसका परीक्षण मेडिकल क्षेत्र (स्वास्थ्य संबंधी प्रश्नों के उत्तर देने) में किया।

  • बेहतर परिणाम: उनके "डांसिंग डुओ" (EvoRubrics) ने उन सिस्टम्स को पछाड़ दिया जो निश्चित नियमों या केवल एक बार प्रतिदिन अपडेट होने वाले नियमों का उपयोग करते थे।
  • बाहरी मदद की आवश्यकता नहीं: आश्चर्यजनक रूप से, उन्होंने पाया कि भले ही आप सभी मानव-लिखित "गोल्ड स्टैंडर्ड" नियम हटा दें और इन दोनों AI को बस एक-दूसरे से लड़ने और एक-दूसरे से सीखने दें, फिर भी सिस्टम काफी बेहतर हो जाता है। "एक अच्छा उत्तर देने" और "उत्तर में दोष खोजने" के बीच का तनाव ही सिस्टम को सिखाने के लिए पर्याप्त है।
  • क्रिटिक एक टूल बन जाता है: प्रशिक्षित होने के बाद, "क्रिटिक" AI नियम लिखने में इतना कुशल हो जाता है कि इसका उपयोग अन्य उत्तरों को ग्रेड करने या नए AI मॉडल्स को गाइड करने के लिए एक स्टैंडअलोन टूल के रूप में किया जा सकता है, भले ही वह उन विषयों पर हो जिन पर उसे स्पष्ट रूप से प्रशिक्षित नहीं किया गया था।

कमी (सीमाएँ)

पेपर अपनी सीमाओं के बारे में ईमानदार है:

  • यह ज्यादातर मेडिकल है: उन्होंने स्वास्थ्य संबंधी प्रश्नों पर इसका गहन परीक्षण किया है। उन्हें अभी तक यकीन नहीं है कि क्या यह बिना अधिक परीक्षण के रचनात्मक लेखन या कानूनी सलाह के लिए भी पूरी तरह से काम करेगा।
  • यह महंगा है: दो AI को चलाने के लिए, जो लगातार एक-दूसरे की आलोचना करते हैं, एक अकेले AI की तुलना में अधिक कंप्यूटर पावर की आवश्यकता होती है।
  • "इको चैंबर" का जोखिम: यदि शेफ और क्रिटिक बहुत समान हैं, तो वे खराब आदतों पर सहमत होने लग सकते हैं। पेपर नोट करता है कि सावधानीपूर्वक निगरानी के बिना, वे अजीब, संकीर्ण नियमों की ओर बढ़ सकते हैं जो मानवीय वास्तविकता से मेल नहीं खाते।

संक्षेप में

EvoRubrics एक ऐसी विधि है जहाँ एक AI जो उत्तर लिखता है और एक AI जो ग्रेडिंग के नियम लिखता है, एक साथ सीखते हैं। जैसे-जैसे उत्तर देने वाला स्मार्ट होता जाता है, ग्रेडिंग करने वाला और अधिक सख्त होता जाता है, यह सुनिश्चित करता है कि सीखना कभी समाप्त न हो। यह एक व्यक्तिगत ट्रेनर की तरह है जो आपके मजबूत होते ही आपकी वर्कआउट योजना को तुरंत बदल देता है, ताकि आप कभी भी एक ही स्तर पर न रुकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →