Vintix II: Decision Pre-Trained Transformer is a Scalable In-Context Reinforcement Learner
यह शोध पत्र विंटिक्स II (Vintix II) प्रस्तुत करता है, जो डिसीजन प्री-ट्रेन्ड ट्रांसफॉर्मर (DPT) का एक स्केलेबल विस्तार है जो सैकड़ों विविध कार्यों में एक जनरलइस्ट एजेंट को प्रशिक्षित करने के लिए फ्लो मैचिंग (Flow Matching) का उपयोग करता है, जो अनदेखे कार्यों के प्रति बेहतर सामान्यीकरण प्राप्त करता है और ऑनलाइन एवं ऑफलाइन इन्फरेंस दोनों में पूर्ववर्ती एल्गोरिदम डिस्टिलेशन स्केलिंग से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को सब कुछ करना सिखाने की कोशिश कर रहे हैं: चलना, खाना बनाना, कार चलाना और एक लीक होते पाइप को ठीक करना।
पुराने समय के AI में, आपको प्रत्येक काम के लिए एक अलग "शिक्षक" नियुक्त करना पड़ता था। आप एक रोबोट को चलने के लिए प्रशिक्षित करते, फिर उसकी मेमोरी मिटा देते और फिर एक बिल्कुल नए रोबोट को चलाने के लिए प्रशिक्षित करते। यह धीमा और महंगा है, और जैसे ही रोबोट कार चलाना सीखना शुरू करता है, वह चलना भूल जाता है।
Vintix II एक नए प्रकार का AI एजेंट है जो खेल बदल देता है। एक समय में एक चीज़ सीखने के बजाय, यह अनुभवों के एक विशाल पुस्तकालय से सीखना कैसे है यह सीखता है, ताकि यह कुछ उदाहरणों को देखकर तुरंत किसी भी नए कार्य को पकड़ सके।
यहाँ इसका सरल विवरण दिया गया है कि यह कैसे काम करता है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: "भुलक्कड़" रोबोट
आज के अधिकांश रोबोट उन छात्रों की तरह हैं जो एक ही पाठ्यपुस्तक को रट लेते हैं। यदि आप उनसे किसी दूसरे किताब से सवाल पूछते हैं, तो वे खो जाते हैं। उन्हें हर नए वातावरण के लिए शून्य से फिर से प्रशिक्षित करने की आवश्यकता होती है।
2. समाधान: "सुपर-इंटर्न"
सोचिए कि Vintix II एक सुपर-इंटर्न है जिसने लाखों अलग-अलग मैनुअल (खाना पकाने की रेसिपी से लेकर कार मरम्मत गाइड तक) पढ़े हैं।
- जादुई ट्रिक: जब आप इस इंटर्न को एक नए किचन में रखते हैं, तो आपको उन्हें फिर से प्रशिक्षित करने की आवश्यकता नहीं होती है। आपको बस उन्हें कुछ उदाहरण दिखाने होंगे कि आप अंडे कैसे स्कैम्बल (scramble) करना चाहते हैं (इसे "इन-कॉन्टेक्स्ट लर्निंग" कहा जाता है)।
- परिणाम: इंटर्न तुरंत पैटर्न को समझ जाता है और पूरी तरह से खाना बनाना शुरू कर देता है, भले ही उसने उस विशिष्ट किचन को पहले कभी न देखा हो।
3. सीक्रेट सॉस: "फ्लो मैचिंग" (स्मूदी ब्लेंडर)
यह पेपर एक नई तकनीकी ट्रिक पेश करता है जिसे Flow Matching कहा जाता है। यहाँ इसकी उपमा दी गई है:
- पुराना तरीका (Gaussian Heads): कल्पना कीजिए कि आप एक जटिल आकार, जैसे कि एक बादल, को एक साधारण वृत्त (circle) बनाकर समझाने की कोशिश कर रहे हैं। यह एक गेंद के लिए ठीक है, लेकिन बादल के लिए बहुत खराब है। पुराने AI मॉडल यही करते थे; उन्होंने सरल, गोल अनुमानों का उपयोग करके कार्यों का अनुमान लगाने की कोशिश की।
- Vintix II का तरीका (Flow Matching): कल्पना कीजिए कि आपके पास एक स्मूदी ब्लेंडर है। आप सादे पानी (रैंडम नॉइज़) से शुरू करते हैं और ब्लेंड करते समय धीरे-धीरे सामग्रियां (विशिष्ट कार्य विवरण) जोड़ते हैं। पानी बहता (flow) है और सुचारू रूप से एक आदर्श स्मूदी में बदल जाता है।
- यह क्यों मायने रखता है: वास्तविक जीवन अव्यवस्थित है। कभी आपको तेज़ गाड़ी चलानी होती है, कभी धीरे। कभी आपको कप को धीरे से पकड़ना होता है, कभी मजबूती से। यह "ब्लेंडर" इस AI को पुराने "वृत्त बनाने वाले" तरीकों की तुलना में इन अव्यवस्थित, बहुआयामी स्थितियों को बहुत बेहतर तरीके से संभालने की अनुमति देता है।
4. प्रशिक्षण डेटा: "यूनिवर्सल लाइब्रेरी"
इस इंटर्न को इतना स्मार्ट बनाने के लिए, शोधकर्ताओं ने इसे केवल एक किताब नहीं दी। उन्होंने 700 मिलियन से अधिक विभिन्न अनुभवों वाला एक विशाल पुस्तकालय बनाया।
- इसमें रोबोट का चलना, हाथों द्वारा वस्तुओं को उठाना, कारों का चलना, और यहाँ तक कि इमारतों में हीटिंग और कूलिंग को नियंत्रित करने वाली प्रणालियाँ शामिल हैं।
- इन सभी अलग-अलग चीजों पर एक साथ प्रशिक्षण देकर, AI ने गति और निर्णय लेने के "यूनिवर्सल ग्रामर" को सीखा। उसने सीखा कि "दीवार से बचना" रोबोटिक हाथ या सेल्फ-ड्राइविंग कार के लिए समान है।
5. परिणाम: "जैक ऑफ ऑल ट्रेड्स"
जब उन्होंने Vintix II का परीक्षण उन कार्यों पर किया जिन्हें उसने पहले कभी नहीं देखा था:
- यह जम नहीं गया (freeze नहीं हुआ)। इसने कुछ उदाहरण देखे और इसे समझ लिया।
- यह विशेषज्ञों से भी बेहतर रहा। कई मामलों में, केवल कुछ उदाहरण देखने के बाद, इसने उस कार्य के लिए विशेष रूप से प्रशिक्षित रोबोटों के बराबर (या उससे बेहतर) प्रदर्शन किया।
- यह दो मोड में काम करता है:
- ऑफलाइन: आप शुरू करने से पहले उसे उदाहरणों की एक "चीट शीट" देते हैं।
- ऑनलाइन: यह चलते समय सीखता है, वास्तविक समय में अपनी गलतियों को सुधारता है, जैसे कि कोई इंसान साइकिल चलाना सीखते समय डगमगाकर और तालमेल बिठाकर सीखता है।
बड़ी तस्वीर
यह पेपर जनरलिस्ट AI (Generalist AI) की ओर एक बड़ा कदम है। हर काम के लिए एक अलग रोबोट बनाने के बजाय, हम एक ऐसा "यूनिवर्सल एजेंट" बना रहे हैं जो किसी भी स्थिति में जा सकता है, देख सकता है कि क्या हो रहा है, और तय कर सकता है कि क्या करना है।
यह हर समस्या के लिए एक विशेषज्ञ को काम पर रखने बनाम एक प्रतिभाशाली, अनुकूलन योग्य समस्या-समाधानकर्ता को काम पर रखने के बीच का अंतर है, जो किसी भी चीज़ को संभालने में सक्षम है। Vintix II वही समस्या-समाधानकर्ता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।