← नवीनतम पेपर
🤖 machine learning

IRIS: Interpolative Rényi Iterative Self-play for Large Language Model Fine-Tuning

यह शोध पत्र IRIS का प्रस्ताव करता है, जो एक एकीकृत सेल्फ-प्ले फाइन-ट्यूनिंग फ्रेमवर्क है जो प्रशिक्षण चरणों के दौरान महत्व भारण (इम्पॉर्टेंस वेटिंग) को गतिशील रूप से अनुकूलित करने के लिए निरंतर समायोज्य रेनी डायवर्जेंस पैरामीटर का लाभ उठाता है, जिससे यह मौजूदा विधियों से बेहतर प्रदर्शन करता है और काफी कम एनोटेटेड नमूनों के साथ उत्कृष्ट परिणाम प्राप्त करता है।

मूल लेखक: Wenjie Liao, Like Wu, Liangjie Zhao, Shihui Xu, Shigeru Fujimura

प्रकाशित 2026-04-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenjie Liao, Like Wu, Liangjie Zhao, Shihui Xu, Shigeru Fujimura

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र (AI) को एक आदर्श निबंध लिखना सिखा रहे हैं।

पुराना तरीका: सख्त शिक्षक

परंपरागत रूप से, AI को बेहतर बनाने के लिए, आपको एक मानव शिक्षक की आवश्यकता होती है जो हजारों निबंधों को ग्रेड दे सके। शिक्षक कहता है, "यह वाक्य अच्छा है, यह वाला बुरा है।" इसे सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) कहा जाता है।

  • समस्या: मानव शिक्षकों को काम पर रखना महंगा और धीमा होता है। एक बार जब AI उपलब्ध निबंधों से सीख लेता है, तो वह एक "सीमा" (ceiling) पर पहुँच जाता है। वह इससे बेहतर नहीं हो सकता क्योंकि उसके पास मानव फीडबैक खत्म हो चुका है।

"सेल्फ-प्ले" का विचार: छात्र बनाम छात्र

इस सीमा को तोड़ने के लिए, शोधकर्ताओं ने सेल्फ-प्ले (Self-Play) का आविष्कार किया। कल्पना कीजिए कि AI एक शतरंज खिलाड़ी है। मानव के खिलाफ खेलने के बजाय, यह अपने ही एक थोड़े पुराने संस्करण के खिलाफ खेलता है।

  1. प्रतिद्वंद्वी: AI एक "नकली" निबंध बनाता है (जैसे कोई छात्र नकल करने की कोशिश कर रहा हो)।
  2. मुख्य खिलाड़ी: वर्तमान AI यह पहचानने की कोशिश करता है कि वास्तविक मानव निबंध और उसके अपने "नकली" निबंध के बीच क्या अंतर है।
  3. लक्ष्य: यदि AI उनके बीच अंतर कर सकता है, तो वह सीख जाता है कि मानव निबंध को क्या खास बनाता है और वह अधिक मानव जैसा लिखने की कोशिश करता है।

यह अच्छी तरह से काम करता है, लेकिन इसमें एक दोष है। इसे "हॉट एंड कोल्ड" (Hot and Cold) के खेल की तरह समझें।

  • प्रशिक्षण के शुरुआती चरण में: AI लिखने में बहुत खराब होता है। इसके नकली निबंध और वास्तविक निबंध के बीच का अंतर बहुत बड़ा होता है (बहुत "ठंडा")। AI तेजी से सीखता है।
  • प्रशिक्षण के अंतिम चरण में: AI बहुत अच्छा हो जाता है। नकली निबंध वास्तविक निबंधों के लगभग समान दिखने लगते हैं। "तापमान" शून्य तक गिर जाता है। AI भ्रमित हो जाता है क्योंकि संकेत (signal) इतना कमजोर होता है कि यह बताना मुश्किल हो जाता है कि कौन सा क्या है। यह सीखना बंद कर देता है या गलतियाँ करने लगता है।

वर्तमान समाधानों के साथ समस्या

वैज्ञानिकों ने खेल के नियम बदलकर इसे ठीक करने की कोशिश की, लेकिन उनके पास पूरे खेल के लिए केवल एक ही नियम था:

  • नियम A (कोमल नियम): शुरुआत के लिए अच्छा है जब AI भ्रमित होता है, लेकिन जब AI को सटीक होने की आवश्यकता होती है तो यह बहुत नरम है।
  • नियम B (सख्त नियम): अंत के लिए बहुत अच्छा है जब AI लगभग पूर्ण हो जाता है, लेकिन शुरुआत में बहुत कठोर और भ्रमित करने वाला है।

वे एक "एक ही आकार के सभी के लिए" (one-size-fits-all) नियम का उपयोग करने में फंसे हुए थे, जिसका अर्थ था कि AI या तो बहुत धीरे सीख रहा था या निराश हो रहा था।

समाधान: IRIS (स्मार्ट कोच)

यह पेपर IRIS (इंटरपोलेटिव रेनी इटरेटिव सेल्फ-प्ले) पेश करता है। IRIS को एक स्मार्ट कोच के रूप में सोचें जिसके पास एक ही नियम पुस्तिका नहीं है। इसके बजाय, कोच के पास एक डायल (dial) है जो वास्तविक समय में खेल की कठिनाई को समायोजित करता है।

"डायल" का उदाहरण

कल्पना कीजिए कि AI पेंटिंग करना सीख रहा है।

  • शुरुआती चरण (डायल "ब्रॉड स्ट्रोक्स" पर सेट है): AI बिखरा हुआ है। कोच कहता है, "बारीकियों की चिंता मत करो! बस यह सुनिश्चित करो कि तुम्हारी पेंटिंग कुछ हद तक एक वास्तविक परिदृश्य जैसी दिखे।" AI को विभिन्न शैलियों को खोजने और आज़माने के लिए प्रोत्साहित किया जाता है। यह एक व्यापक, उदार नियम का उपयोग करने जैसा है।
  • अंतिम चरण (डायल "फाइन डिटेल" पर सेट है): अब AI एक मास्टर पेंटर है। कोच कहता है, "ठीक है, अब सूक्ष्म ब्रशस्ट्रोक को देखो। यदि तुम्हारी पेंटिंग पूरी तरह से मानव जैसी नहीं है, तो हमें इसे तुरंत ठीक करने की आवश्यकता है।" AI छोटे अंतरों पर तीव्रता से ध्यान केंद्रित करता है। यह एक सख्त, सटीक नियम का उपयोग करने जैसा है।

IRIS स्वचालित रूप से इस डायल को घुमाता है।

  • जब AI पूर्ण होने से दूर होता है, तो यह "व्यापक" सेटिंग का उपयोग करता है ताकि तेजी से सीखा जा सके।
  • जैसे-जैसे AI पूर्णता के करीब पहुंचता है, यह अंतिम विवरणों को निखारने के लिए सहजता से "फाइन-ट्यूनिंग" सेटिंग पर स्विच हो जाता है।

यह एक बड़ी बात क्यों है

  1. यह लचीला है: अन्य तरीकों के विपरीत जो एक ही "नियम" (जैसे केवल सख्त या केवल कोमल होना) में फंसे हुए हैं, IRIS जैसे-जैसे AI सीखता है, अपना निर्णय बदलता रहता है।
  2. यह कुशल है: पेपर दिखाता है कि IRIS एक मॉडल को कम मानव डेटा (26,000 निबंध) पर प्रशिक्षित करके, पुराने तरीकों का उपयोग करके भारी मात्रा में डेटा (200,000 निबंध) पर प्रशिक्षित मॉडलों से बेहतर प्रदर्शन करने के लिए ले जा सकता है। यह एक ऐसे छात्र की तरह है जो एक पूरी विश्वकोश पढ़ने वाले छात्र की तुलना में एक छोटी, अच्छी तरह से चुनी गई लाइब्रेरी से अधिक सीखता है जो यह नहीं जानता कि ध्यान कैसे केंद्रित करना है।
  3. यह स्थिर है: यह AI को प्रशिक्षण के अंतिम चरणों में "भ्रमित" होने से रोकता है, यह सुनिश्चित करता है कि वह अंत तक बेहतर होता रहे।

संक्षेप में

IRIS AI के लिए एक नया प्रशिक्षण तरीका है जो एक स्मार्ट कोच की तरह कार्य करता है। एक ही, कठोर नियमों के सेट का उपयोग करने के बजाय, यह लगातार अपनी शिक्षण शैली को बदलता रहता है—व्यापक प्रोत्साहन के साथ शुरू होता है और सटीक सुधार के साथ समाप्त होता है। यह AI को तेजी से सीखने, कम मानव डेटा का उपयोग करने और पहले से कहीं अधिक बुद्धिमत्ता के स्तर तक पहुँचने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →