← नवीनतम पेपर
💻 computer science

EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

यह शोध पत्र EvoLM को प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित (self-supervised) पोस्ट-ट्रेनिंग विधि है जो भाषा मॉडलों को विशिष्ट उदाहरणों के लिए विभेदक रूब्रिक्स (discriminative rubrics) उत्पन्न करने और उन रूब्रिक्स को रिवॉर्ड के रूप में उपयोग करके पॉलिसी प्रदर्शन को अनुकूलित करने के बीच बारी-बारी से कार्य करते हुए पुनरावृत्ति के माध्यम से सुधार करने में सक्षम बनाती है, जिससे बाहरी मानव या मॉडल पर्यवेक्षण पर निर्भर किए बिना बेहतर परिणाम प्राप्त होते हैं।

मूल लेखक: Shuyue Stella Li, Rui Xin, Teng Xiao, Yike Wang, Rulin Shao, Zoey Hao, Melanie Sclar, Sewoong Oh, Faeze Brahman, Pang Wei Koh, Yulia Tsvetkov

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuyue Stella Li, Rui Xin, Teng Xiao, Yike Wang, Rulin Shao, Zoey Hao, Melanie Sclar, Sewoong Oh, Faeze Brahman, Pang Wei Koh, Yulia Tsvetkov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र (पॉलिसी मॉडल) को एक आदर्श निबंध लिखना सिखाने की कोशिश कर रहे हैं। पुराने तरीके में, आपको एक सख्त शिक्षक (एक मानव या एक अति-बुद्धिमान AI) की आवश्यकता होती जो हर निबंध को पढ़ता, उसे ग्रेड देता और बताता कि उसने क्या गलत किया। यह महंगा, धीमा और उस शिक्षक की बुद्धिमत्ता तक सीमित है।

EVOLM एक नई विधि है जो छात्र को अपना स्वयं का शिक्षक बनने देती है, लेकिन इसमें एक चतुर मोड़ है। केवल यह अनुमान लगाने के बजाय कि एक "अच्छा" निबंध कैसा दिखता है, छात्र अपने द्वारा लिखे गए प्रत्येक निबंध के लिए एक विशिष्ट चेकलिस्ट (जिसे रूब्रिक कहा जाता है) बनाना सीखता है।

यह प्रक्रिया कैसे काम करती है, इसे सरल चरणों में यहाँ दिया गया है:

1. दो भूमिकाएँ: लेखक और चेकलिस्ट-बनाने वाला

इस प्रणाली में, एक ही AI मॉडल एक साथ दो भूमिकाएँ निभाता है:

  • लेखक (पॉलिसी): यह भाग प्रश्नों के उत्तर उत्पन्न करता है।
  • चेकलिस्ट-बनाने वाला (रूब्रिक जनरेटर): यह प्रश्न को देखता है और उत्तर को परखने के लिए नियमों का एक विशिष्ट सेट (एक रूब्रिक) लिखता है।

इसे एक ऐसे शेफ की तरह समझें जो न केवल भोजन बनाता है बल्कि खाना बनाने के बाद रेसिपी कार्ड भी लिखता है, यह समझाते हुए कि वह व्यंजन अच्छा या बुरा क्यों है।

2. "टाइम-ट्रैवल" फीडबैक लूप

सिस्टम को कैसे पता चलता है कि चेकलिस्ट अच्छी है? इसे यह जानने के लिए किसी मानव की आवश्यकता नहीं है कि "अच्छा काम किया!" इसके बजाय, यह टाइम ट्रैवल (समय यात्रा) का उपयोग करता है।

  • चरण A: AI आज एक उत्तर लिखता है।
  • चरण B: यह कुछ दिन पहले लिखे गए एक उत्तर (अपने "पिछले संस्करण") को देखता है।
  • चरण C: यह मान लेता है कि नया उत्तर बेहतर है क्योंकि AI सीख रहा है।
  • चरण D: चेकलिस्ट-बनाने वाला दोनों उत्तरों को परखने के लिए एक रूबिक बनाता है।

लक्ष्य सरल है: रूब्रिक को "नए, बेहतर" उत्तर और "पुराने, खराब" उत्तर के बीच स्पष्ट अंतर बताने में सक्षम होना चाहिए। यदि रूब्रिक अस्पष्ट है, तो यह अंतर नहीं पहचान पाएगा। यदि रूब्रिक तीक्ष्ण और विशिष्ट है, तो यह नए उत्तर को उच्च स्कोर और पुराने उत्तर को कम स्कोर देगा।

3. सह-विकास का नृत्य (Co-Evolution Dance)

यहीं पर जादू होता है। दोनों भूमिकाएँ एक लूप में एक-दूसरे को सुधारने के लिए बारी-बारी से काम करती हैं:

  1. लेखक बेहतर होता है: चेकलिस्ट का उपयोग करके, लेखक उच्च स्कोर प्राप्त करने के लिए बेहतर उत्तर देने के लिए सीखता है।
  2. चेकलिस्ट-बनाने वाला अधिक सटीक होता है: जैसे-जैसे लेखक बेहतर होता है, पुराने उत्तर तुलना में और भी खराब दिखने लगते हैं। "अच्छे" और "महान" के बीच अंतर बनाए रखने के लिए, चेकलिस्ट-बनाने वाले को अधिक विशिष्ट और अधिक विस्तृत नियम लिखने होते हैं। वह केवल "अच्छी व्याकरण" नहीं कह सकता; उसे कहना होगा कि "परिचयात्मक वाक्यांश के बाद अल्पविराम (comma) का उपयोग किया जाना चाहिए।"

समय के साथ, चेकलिस्टات अस्पष्ट लेबल जैसे "इसे दिलचस्प बनाएं" से विकसित होकर ठोस, सत्यापन योग्य निर्देशों जैसे "उत्तर में 48 के परिधि से प्राप्त 144 की संख्या होनी चाहिए" में बदल जाती हैं।

4. "स्मॉल जज" (छोटा न्यायाधीश) ट्रिक

आमतौर पर, जटिल निबंधों को ग्रेड देने के लिए आपको एक विशाल, अति-बुद्धिमान AI की आवश्यकता होती है। लेकिन EVOLM एक छोटे, फ्रीज्ड (स्थिर) AI (एक छोटा जज) का उपयोग करता है जो वास्तविक स्कोरिंग करता है।

क्योंकि चेकलिस्ट-बनाने वाला इतना विशिष्ट, ठोस नियम (जैसे, "'इनोवेशन' शब्द दो बार दिखाई देता है या नहीं, इसकी जाँच करें") लिखना सीख गया है, इसलिए एक छोटा, सरल AI भी उन निर्देशों का पूरी तरह से पालन कर सकता है। यह एक छोटे बच्चे को एक बहुत ही विशिष्ट खजाने का नक्शा देने जैसा है: उन्हें जासूस होने की आवश्यकता नहीं है; उन्हें बस नक्शे का पालन करने की आवश्यकता है।

यह एक बड़ी बात क्यों है?

  • बाहरी शिक्षकों की आवश्यकता नहीं: इस प्रणाली को हजारों निबंधों को ग्रेड देने के लिए मनुष्यों या महंगे AI API का उपयोग करने की आवश्यकता नहीं है। यह अपने स्वयं के पिछले प्रदर्शन से अपना स्वयं का प्रशिक्षण संकेत (training signal) बनाता है।
  • यह सीमा को तोड़ता है: यदि आप एक मानव शिक्षक पर निर्भर हैं, तो AI उस मानव से बेहतर नहीं हो सकता। यदि आप एक विशिष्ट AI शिक्षक पर निर्भर हैं, तो AI उस शिक्षक के स्तर पर ही अटक जाता है। EVOLM के साथ, AI का "शिक्षक" (रूब्रिक) AI के साथ ही विकसित होता है, जिससे सीमा लगातार ऊपर बढ़ती रहती है।
  • यह काम करता है: पेपर दिखाता है कि इस स्व-शिक्षित AI (एक छोटे 8B पैरामीटर मॉडल का उपयोग करके) ने वास्तव में उन सिस्टमों को पछाड़ दिया जिन्होंने नियमों को उत्पन्न करने के लिए GPT-4 (एक बहुत बड़ा, अधिक महंगा मॉडल) का उपयोग किया था।

संक्षेप में: EVOLM एक स्व-सुधार लूप है जहाँ एक AI अपने स्वयं के विस्तृत ग्रेडिंग रूब्रिक्स लिखना सीखता है। अपने पिछले स्वयं के साथ लगातार तुलना करके, यह खुद को अधिक सटीक नियम लिखने के लिए मजबूर करता है, जो बदले में इसे बेहतर उत्तर लिखना सीखने में मदद करता है, और यह सब बिना किसी मानव के हस्तक्षेप के होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →