← नवीनतम पेपर
💬 NLP

Actor-Curator: Co-adaptive Curriculum Learning via Policy-Improvement Bandits for RL Post-Training

यह शोध पत्र ACTOR-CURATOR प्रस्तुत करता है, जो एक स्केलेबल और स्वचालित करिकुलम लर्निंग फ्रेमवर्क है जो LLMs के RL पोस्ट-ट्रेनिंग के लिए प्रशिक्षण समस्याओं को गतिशील रूप से चुनने हेतु पॉलिसी-इम्प्रूवमेंट बैंडिट्स के माध्यम से प्रशिक्षित एक न्यूरल क्यूरेटर का उपयोग करता है, जिससे मौजूदा बेसलाइन्स की तुलना में रीजनिंग बेंचमार्क्स, प्रशिक्षण स्थिरता और दक्षता में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Zhengyao Gu, Jonathan Light, Raul Astudillo, Ziyu Ye, Langzhou He, Henry Peng Zou, Wei Cheng, Santiago Paternain, Philip S. Yu, Yisong Yue

प्रकाशित 2026-02-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhengyao Gu, Jonathan Light, Raul Astudillo, Ziyu Ye, Langzhou He, Henry Peng Zou, Wei Cheng, Santiago Paternain, Philip S. Yu, Yisong Yue

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यंत प्रतिभाशाली लेकिन अनुभवहीन छात्र (अभिनेता/Actor) को जटिल गणित और तर्क संबंधी पहेलियाँ हल करने के लिए प्रशिक्षित कर रहे हैं। आपके पास लाखों समस्याओं की एक विशाल लाइब्रेरी है, जो "2+2 क्या है?" से लेकर "इस अनसुलझे प्रमेय (theorem) को हल करें" तक फैली हुई है।

पारंपरिक सुदृढीकरण शिक्षण (Reinforcement Learning - RL) में, आप शायद लाइब्रेरी से यादृच्छिक (randomly) रूप से समस्याएँ चुनते हैं। कभी-कभी छात्र आसान समस्याओं से ऊब जाता है; अन्य समय में, वह बहुत कठिन समस्याओं पर संघर्ष करते हुए हार मान लेता है। यह अक्षम और धीमा है।

ACTOR-CURATOR एक नया सिस्टम है जो इस समस्या को हल करने के लिए कहानी में एक दूसरा पात्र जोड़कर इसे सुलझाता है: एक क्यूरेटर (शिक्षक/Curator)।

यह इस प्रकार काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "रैंडम लाइब्रेरी" दृष्टिकोण

आमतौर पर, AI को प्रशिक्षित करते समय, हम यादृच्छिक रूप से समस्याएँ चुनते हैं।

  • दोष: यदि आप एक नौसिखिए को पीएचडी स्तर का शोध प्रबंध (thesis) दे देते हैं, तो वह कुछ भी नहीं सीख पाता। यदि आप उसे किंडरगार्टन की कलरिंग बुक देते हैं, तो भी वह कुछ नया नहीं सीख पाता।
  • लक्षत: आप चाहते हैं कि छात्र उन समस्याओं पर काम करे जो बिल्कुल सही हों—इतनी चुनौतीपूर्ण कि वे विकसित हो सकें, लेकिन इतनी कठिन भी नहीं कि वे हार मान लें।

2. समाधान: "स्मार्ट टीचर" (क्यूरेटर)

ACTOR-CURATOR एक न्यूरल नेटवर्क (क्यूरेटर) पेश करता है, जिसका एकमात्र काम छात्र के वर्तमान कौशल स्तर को देखना और विशाल लाइब्रेरी से एकदम सही समस्याओं का समूह चुनना है।

  • यह कैसे सीखता है: क्यूरेटर को यह बताने के लिए किसी इंसान की ज़रूरत नहीं है कि कौन सी समस्या "कठिन" है या "आसान"। यह छात्र को देखकर सीखता है।
  • फीडबैक लूप:
    1. क्यूरेटर समस्याओं का एक बैच चुनता है।
    2. छात्र (अभिनेता) उन्हें हल करने का प्रयास करता है और अपडेट होता है।
    3. सिस्टम पूछता है: "क्या छात्र ने इन विशिष्ट समस्याओं के कारण सुधार किया?"
    4. यदि छात्र में बहुत सुधार हुआ, तो क्यूरेटर को उन समस्याओं को चुनने के लिए एक "उच्च स्कोर" (पुरस्कार/reward) मिलता है। यदि छात्र में सुधार नहीं हुआ, तो क्यूरेटर अगली बार उन समस्याओं से बचने के बारे में सीखता है।

3. गुप्त मंत्र: "द बैंडिट गेम"

यह पेपर एक अवधारणा का उपयोग करता है जिसे मल्टी-आर्म्ड बैंडिट (Multi-Armed Bandit) कहा जाता है। कल्पना कीजिए कि स्लॉट मशीनों (arms) की एक पंक्ति है। आप नहीं जानते कि कौन सी मशीन सबसे अधिक पैसा देती है। आपको लीवर खींचने होंगे ताकि सबसे अच्छे वाले का पता चल सके, लेकिन आप उन मशीनों को भी खेलते रहना चाहते हैं जो अच्छा भुगतान करती दिख रही हैं।

  • चुनौती: जैसे-जैसे छात्र स्मार्ट होता जाता है, "सबसे अच्छी" समस्या बदल जाती है। कल जो समस्या बहुत कठिन थी, वह आज बिल्कुल सही हो सकती है।
  • नवाचार: पिछले अधिकांश तरीकों ने स्थिर लेबल (जैसे "लेवल 1," "लेवल 2") का उपयोग करके समस्या की कठिनाई का अनुमान लगाने की कोशिश की। ACTOR-CURATOR समस्या चयन को एक जीवंत खेल (live game) के रूप में देखता है। यह लगातार प्रयोग करता है (नई, अज्ञात समस्याओं को आज़माना) और लाभ उठाता है (उन समस्याओं का उपयोग करना जो मदद करने के लिए जानी जाती हैं), और जैसे-जैसे छात्र विकसित होता है, यह वास्तविक समय में अपनी रणनीति को समायोजित करता है।

4. "दो-चरण" वाली तकनीक

लाइब्रेरी में 10,000+ समस्याएँ हैं। यह असंभव है कि क्यूरेटर हर एक सेकंड में उन सभी को देख सके।

  • चरण 1 (द स्काउट): सिस्टम पहले लाइब्रेरी से 2,000 समस्याओं का एक छोटा, यादृच्छिक नमूना लेता है।
  • चरण 2 (द सेलेक्टर): क्यूरेटर केवल इन 2,000 में से सर्वश्रेष्ठ 256 चुनता है जिन्हें छात्र वास्तव में हल करेगा।
    यह सिस्टम को बहुत बड़े डेटासेट के साथ भी तेज़ और स्केलेबल बनाता है।

5. परिणाम: यह क्यों मायने रखता है

पेपर ने कुछ सबसे कठिन तर्क बेंचमार्क (जैसे AIME गणित प्रतियोगिता और तर्क पहेलियाँ) पर इसका परीक्षण किया।

  • गति: छात्र ने रैंडम चयन की तुलना में 80% तक तेज़ी से सीखा।
  • प्रदर्शन: सबसे कठिन गणितीय समस्याओं पर, छात्र का प्रदर्शन मौजूदा सर्वोत्तम तरीकों की तुलना में लगभग 30% बढ़ गया।
  • स्थिरता: प्रशिक्षण अधिक सुचारू रहा। छात्र उन "पठार" (plateaus) पर नहीं पहुँचा जहाँ वे सीखना बंद कर देते हैं; वे बढ़ते रहे।

बड़ी तस्वीर का रूपक (Analogy)

AI को प्रशिक्षित करने को एक बगीचा उगाने जैसा समझें।

  • पुराना तरीका: आप ज़मीन पर यादृच्छिक रूप से बीज फेंकते हैं। कुछ को पानी मिलता है, कुछ को धूप मिलती है, कुछ कुचल दिए जाते हैं। आप उम्मीद करते हैं कि कुछ उगेंगे।
  • ACTOR-CURATOR: आपके पास एक स्मार्ट माली है। हर सुबह, माली मिट्टी और पौधों की जाँच करता है। वे खरपतवार (खराब समस्याएँ) निकालते हैं, प्याले पौधों को पानी देते हैं (वे समस्याएँ जिनके लिए छात्र तैयार है), और नए बीज बिल्कुल सही जगहों पर लगाते हैं। माली फसल से सीखता है: "आह, टमाटर सबसे अच्छे से उगे जब मैंने उन्हें दोपहर के बजाय शाम 6 बजे पानी दिया था।"

संक्षेप में: ACTOR-CURATOR "करिकुलम लर्निंग" की कला को स्वचालित करता है। यह यह अनुमान लगाना बंद कर देता है कि AI को क्या सिखाना है और इसके बजाय सीखने के मार्ग को गणितीय रूप से अनुकूलित (optimize) करना शुरू करता है, जिसके परिणामस्वरूप कम समय में प्रशिक्षित अधिक स्मार्ट मॉडल प्राप्त होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →