Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs
ASTOR एक यूटिलिटी-ड्रिवन मल्टी-टास्क रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो कोड LLMs के लिए है, जो टास्क लर्निंग को गतिशील रूप से समन्वित करने के लिए पदानुक्रमित डेटा शेड्यूलिंग और एडेप्टिव पॉलिसी ऑप्टिमाइज़ेशन का उपयोग करता है, जो टास्क-विशिष्ट विशेषज्ञों और मौजूदा मल्टी-टास्क बेसलाइन्स दोनों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल कुकिंग स्कूल चला रहे हैं। आपका लक्ष्य एक अकेला "सुपर शेफ" तैयार करना है जो सब कुछ कर सके: केक बना सके, सब्जियां काट सके, स्टेक ग्रिल कर सके और रेस्टोरेंट की समीक्षा लिख सके।
अतीत में, यदि आप ऐसा शेफ चाहते थे जो इन सभी चीजों में कुशल हो, तो आपके पास दो बुरे विकल्प थे:
- चार अलग-अलग विशेषज्ञों को काम पर रखना: एक बेकर, एक कसाई, एक ग्रिल मास्टर और एक आलोचक। यह महंगा है और बहुत अधिक जगह घेरता है (कंप्यूटरों को बहुत अधिक मेमोरी की आवश्यकता होती है)।
- एक ही शेफ को एक साथ सब कुछ रैंडम तरीके से सिखाना: आप सभी रेसिपी को एक बड़े बर्तन में डाल देते हैं और कहते हैं, "जो मन में आए वही पकाओ।" समस्या यह है कि शेफ भ्रमित हो जाता है। वह केक काटने के लिए स्टेक नाइफ का उपयोग करने की कोशिश कर सकता है, या वह ग्रिल करने में इतना खो सकता है कि समीक्षा लिखना ही भूल जाए।
यह पेपर एक नई प्रणाली पेश करता है जिसे ASTOR (एक "स्मार्ट हेड शेफ" के रूप में सोचें) कहा जाता है, जो इसे यूटिलिटी (Utility) की अवधारणा का उपयोग करके हल करता है। सरल शब्दों में, "यूटिलिटी" एक स्कोर है जो सिस्टम को बताता है: "इस विशिष्ट कार्य से यह शेफ अभी कितना सीख सकता है, और क्या इस अभ्यास से उसे अन्य कार्यों में भी बेहतर होने में मदद मिलेगी?"
ASTOR दो मुख्य तरीकों से काम करता है, जैसे कि एक कोच प्रशिक्षण कार्यक्रम का प्रबंधन कर रहा हो:
1. "स्मार्ट शेड्यूल" (क्या सीखना है)
कल्पना कीजिए कि शेफ चार अलग-अलग कौशल का अभ्यास कर रहा है। एक सामान्य कोच कह सकता है, "प्रत्येक पर 25 मिनट अभ्यास करें।" लेकिन ASTOR अधिक स्मार्ट है। यह शेफ के प्रदर्शन को देखता है और पूछता है:
- क्या शेफ फंस गया है? यदि शेफ ग्रिलिंग में बुरी तरह विफल हो रहा है लेकिन बेकिंग में तेजी से सुधार कर रहा है, तो ASTOR कहता है, "आइए ग्रिलिंग पर अधिक समय बिताएं क्योंकि वहीं विकास की गुफा है।"
- क्या कौशल एक-दूसरे की मदद करते हैं? यदि "सब्जियां काटने" का अभ्यास करने से वास्तव में शेफ "प्लेटिंग करने" में बेहतर हो जाता है (क्योंकि दोनों के लिए स्थिर हाथों की आवश्यकता होती है), तो ASTOR इस संबंध को पहचान लेता है और उन्हें एक साथ शेड्यूल करता है।
ASTOR केवल रैंडम रेसिपी नहीं चुनता। यह सबसे सहायक रेसिपी चुनता है जो सही समय पर हों। यह एक ट्यूटर की तरह है जो जानता है कि अगले स्तर को अनलॉक करने के लिए आपको अगली कौन सी गणित की समस्या हल करने की आवश्यकता है, बजाय इसके कि वह आपसे बार-बार वही आसान समस्याएं करवाता रहे।
2. "लचीला कोच" (कैसे सीखना है)
एक बार जब शेफ अभ्यास शुरू कर देता है, तो ASTOR कार्य के आधार पर नियमों को कितना सख्त रखना है, यह बदल देता है।
- कठोर कार्यों के लिए (जैसे ग्रिलिंग): यदि शेफ स्टेक को गलत तरीके से काटता है, तो यह एक आपदा है। ASTOR शेफ को बताता है, "बहुत सावधान रहें! अपनी तकनीक में बहुत अधिक बदलाव न करें। बुनियादी बातों पर टिके रहें।" यह गलतियों को रोकने के लिए सीखने पर एक "कड़ी लगाम" (tight leash) लगाता है।
- रचनात्मक कार्यों के लिए (जैसे समीक्षा लिखना): यदि शेफ एक समीक्षा लिख रहा है, तो उसे रचनात्मक होने और नए शब्दों का प्रयोग करने की आवश्यकता है। ASTOR कहता है, "बेधड़क होकर काम करें! विभिन्न शैलियों को आजमाएं। छोटे बदलाव करने से न डरें।" यह अन्वेषण को प्रोत्साहित करने के लिए एक "ढीली लगाम" (loose leash) लगाता है।
परिणाम
शोधकर्ताओं ने इस "स्मार्ट शेफ" (ASTOR) का परीक्षण निम्नलिखित के विरुद्ध किया:
- विशेषज्ञ: चार अलग-अलग शेफ (प्रत्येक कार्य के लिए एक)।
- अन्य ग्रुप ट्रेनर्स: वे कोच जिन्होंने एक ही शेफ को सब कुछ सिखाने की कोशिश की लेकिन "एक ही आकार सबके लिए उपयुक्त" (one-size-fits-all) वाला दृष्टिकोण अपनाया।
परिणाम:
ASTOR द्वारा प्रशिक्षित एकल "सुपर शेफ" ने न केवल ठीक प्रदर्शन किया; बल्कि वह लगभग हर श्रेणी में सर्वश्रेष्ठ व्यक्तिगत विशेषज्ञ से भी बेहतर साबित हुआ। इसने अन्य ग्रुप ट्रेनर्स को भी भारी अंतर से पीछे छोड़ दिया।
संक्षेप में: ASTOR एक ऐसी प्रणाली है जो एक एकल AI मॉडल को कोडिंग विशेषज्ञ (कोड लिखना, उसका परीक्षण करना, बग ठीक करना और रिपोर्ट लिखना) बनने के लिए सिखाती है, जो लगातार यह पूछती है, "हमें आगे क्या अभ्यास करना चाहिए, और हमें नियमों का कितनी सख्ती से पालन करना चाहिए?" यह पैसा बचाता है और एक अधिक स्मार्ट, अधिक बहुमुखी AI बनाता है, बजाय इसके कि हर एक काम के लिए अलग-अलग विशेषज्ञ बनाए जाएं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।