Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
यह शोध पत्र Skywork-Reward-V2 को प्रस्तुत करता है, जो 40-मिलियन-जोड़ी वाले SynPref-40M डेटासेट पर प्रशिक्षित अत्याधुनिक रिवॉर्ड मॉडल्स का एक समूह है, जिसे मौजूदा प्रेफरेंस डेटा की सीमाओं को दूर करने और कई बेंचमार्क में बेहतर प्रदर्शन प्राप्त करने के लिए एक मानव-AI सहयोगात्मक पाइपलाइन का उपयोग करके बनाया गया था।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन कभी-कभी जिद्दी रोबोट को कहानी लिखना, गणित की समस्या हल करना या बस लोगों से अच्छी तरह से बात करना सिखा रहे हैं। आप रोबोट को सिर्फ यह नहीं कह सकते, "अच्छे बनो।" आपको उसे उदाहरणों के माध्यम से दिखाना होगा कि "अच्छा" क्या है और "बुरा" क्या है।
AI की दुनिया में, इस प्रक्रिया को रिनफोर्समेंट लर्निंग फ्रॉम ह्यूमन फीडबैक (RLHF) कहा जाता है। रोबोट को एक रिवॉर्ड मॉडल (RM) की आवश्यकता होती है—इसे रोबोट का "स्वाद शिक्षक" (Taste Teacher) समझें। यह शिक्षक दो अलग-अलग उत्तरों को देखता है और कहता है, "मुझे यह वाला ज्यादा पसंद आया क्योंकि यह अधिक सहायक है," या "मुझे यह पसंद नहीं आया क्योंकि यह बदतमीजी भरा है।"
लंबे समय तक, ये "स्वाद शिक्षक" संघर्ष कर रहे थे। वे नाजुक थे, आसानी से भ्रमित हो जाते थे, और उस जटिल तरीके को नहीं संभाल पाते थे जिस तरह से मनुष्य वास्तव में सोचते हैं। वे एक ऐसे फूड क्रिटिक की तरह थे जो केवल पिज्जा का स्वाद पहचानता है लेकिन सुशी परोसने पर उलझ जाता है।
Skywork-Reward-V2 एक नया, सुपर-पावर्ड "स्वाद शिक्षक" है जो इन समस्याओं को ठीक करता है। उन्होंने इसे कैसे किया, इसे सरल भाषा में यहाँ समझाया गया है:
1. समस्या: बहुत सारा कचरा, बहुत कम सोना
शोधकर्ताओं ने महसूस किया कि समस्या रोबोट के दिमाग में नहीं थी; बल्कि ट्रेनिंग डेटा में थी।
- पुराना तरीका: उन्होंने शिक्षक को लाखों उदाहरण खिलाने की कोशिश की, लेकिन उनमें से कई अन्य रोबोट्स (AI) द्वारा लेबल किए गए थे या केवल इंटरनेट के रैंडम कमेंट्स थे। यह एक शेफ को सिखाने जैसा था जिसमें मिशेलिन-स्टार रेसिपी और गैस स्टेशन के जले हुए टोस्ट का मिश्रण दिया गया हो। इससे शिक्षक भ्रमित हो गया।
- नई अंतर्दृष्टि: उन्होंने परिकल्पना की कि यदि वे कचरे में से "सोना" खोज सकें, तो वे एक बहुत बेहतर शिक्षक बना सकते हैं।
2. समाधान: "ह्यूमन-AI सिनर्जी" पाइपलाइन
केवल हजारों इंसानों को काम पर रखने (जो धीमा और महंगा है) या केवल रोबोट्स को सब कुछ लेबल करने देने (जो सटीक नहीं है) के बजाय, उन्होंने एक दो-चरणीय असेंबली लाइन बनाई जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ती है।
चरण 1: "गोल्ड स्टैंडर्ड" वर्कशॉप (मानव के नेतृत्व में)
एक विशेषज्ञ मानव संपादकों की एक छोटी, विशिष्ट टीम की कल्पना करें।
- वे डेटा के एक छोटे ढेर को अत्यधिक सावधानी के साथ लेबल करते हैं।
- सीक्रेट सॉस: ये इंसान केवल अनुमान नहीं लगा रहे हैं। उन्हें अपने उत्तरों को लेबल करने से पहले फैक्ट-चेक करने के लिए सर्च इंजन, गणित के टूल्स और यहाँ तक कि अन्य सुपर-स्मार्ट AI का उपयोग करने की अनुमति है।
- उपमा: यह एक कुकिंग कॉम्पिटिशन के जज की तरह है जो केवल भोजन का स्वाद नहीं चखता, बल्कि स्कोर देने से पहले रेसिपी, ओवन का तापमान और सामग्री की ताजगी भी चेक करता है।
- परिणाम: "गोल्ड डेटा" का एक छोटा ढेर जो 100% भरोसेमंद है।
चरण 2: "मास प्रोडक्शन" फैक्ट्री (AI के नेतृत्व में)
अब, हमारे पास चरण 1 से "गोल्ड स्टैंडर्ड" है। इसका उपयोग एक "गोल्ड टीचर" (रिवॉर्ड मॉडल) को प्रशिक्षित करने के लिए किया जाता है।
- वे इंटरनेट से "वाइल्ड" डेटा का एक विशाल पहाड़ लेते हैं (4 करोड़ जोड़े!)।
- "गोल्ड टीचर" इस पहाड़ को देखता है और कहता है, "यह गोल्ड स्टैंडर्ड जैसा दिखता है, इसे रखें।" या "यह गलत लग रहा है, इसे पलट दें।" या "यह भ्रमित करने वाला है, आइए गोल्ड स्टैंडर्ड को गाइड के रूप में उपयोग करके एक रोबोट से दोबारा चेक करवाएं।"
- उपमा: गोल्ड टीचर को एक निर्माण स्थल के फोरमैन के रूप में सोचें। वह खुद हर ईंट नहीं रखता। इसके बजाय, वह ईंटें रखने वाले रोबोटों के एक बेड़े को प्रशिक्षित करता है, लेकिन वह अपने स्वयं के ब्लूप्रिंट के विरुद्ध लगातार उनके काम की जांच करता है। यदि कोई रोबोट गलती करता है, तो फोरमैन उसे सुधारता है।
- परिणाम: उन्होंने उस बिखरे हुए 4 करोड़ जोड़ों के पहाड़ को 2.6 करोड़ उच्च-गुणवत्ता वाले उदाहरणों के साफ और क्यूरेटेड ढेर में बदल दिया।
3. परिणाम: Skywork-Reward-V2 सीरीज़
इस सुपर-क्लीन डेटा का उपयोग करके, उन्होंने 8 नए "स्वाद शिक्षकों" (रिवॉर्ड मॉडल्स) के एक परिवार को प्रशिक्षित किया।
- आकार: वे बहुत छोटे (0.6 बिलियन पैरामीटर्स) से लेकर मध्यम आकार (8 बिलियन पैरामीटर्स) तक हैं।
- प्रदर्शन: यहाँ तक कि छोटे वाले भी अन्य कंपनियों के विशाल 70-बिलियन पैरामीटर वाले शिक्षकों से अधिक स्मार्ट हैं।
- क्यों? क्योंकि गुणवत्ता > मात्रा। एक शिक्षक जिसे 2.6 करोड़ परफेक्ट उदाहरणों पर प्रशिक्षित किया गया है, वह उस शिक्षक से बेहतर है जिसे 10 करोड़ भ्रमित करने वाले उदाहरणों पर प्रशिक्षित किया गया है।
4. यह क्यों मायने रखता है (इसका महत्व क्या है?)
- बेहतर रोबोट: ये नए शिक्षक अब AI को अधिक सहायक, सुरक्षित और ईमानदार बनने के लिए मार्गदर्शन कर सकते हैं। वे फैंसी दिखने वाले लेकिन गलत उत्तरों (स्टाइल बायस के प्रति प्रतिरोध) से धोखा नहीं खाते।
- लागत प्रभावी: आपको सब कुछ लेबल करने के लिए लाखों डॉलर खर्च करके इंसानों को काम पर रखने की आवश्यकता नहीं है। आपको केवल विशेषज्ञों की एक छोटी टीम चाहिए जो नियम तय करे, और फिर AI भारी काम कर सकता है।
- "बेस्ट-ऑफ-एन" (Best-of-N) सुपरपावर: यदि आप एक AI को 10 अलग-अलग उत्तर जेनरेट करने और उनमें से सबसे अच्छा चुनने के लिए कहते हैं, तो ये नए शिक्षक विजेता को पहचानने में अविश्वसनीय रूप से अच्छे हैं, भले ही अंतर बहुत सूक्ष्म हो।
मुख्य निष्कर्ष
यह पेपर साबित करता है कि हमें बेहतर AI बनाने के लिए बड़े, अधिक महंगे कंप्यूटरों का इंतजार करने की आवश्यकता नहीं है। इसके बजाय, हमें बेहतर डेटा क्यूरेशन की आवश्यकता है।
मानव विशेषज्ञता (मानक स्थापित करने के लिए) को AI स्केल (डेटा को प्रोसेस करने के लिए) के साथ जोड़कर, Skywork ने एक ऐसी प्रणाली बनाई है जो मौजूदा डेटा की छिपी हुई क्षमता को अनलॉक करती है। यह यह महसूस करने जैसा है कि पूरा समुद्र मछलियों से भरा है, लेकिन आपको बस अच्छी मछलियों को पकड़ने के लिए एक बेहतर जाल की आवश्यकता थी।
संक्षेप में: उन्होंने एक बेहतर "स्वाद शिक्षक" बनाया है, यह सिखाकर कि सर्वश्रेष्ठ मानव विशेषज्ञों से कैसे सीखा जाए, और फिर इसे लाखों अन्य रोबोटों को अच्छा बनने के लिए सिखाने दिया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।