Tmax: A simple recipe for terminal agents
यह शोध पत्र Tmax को पेश करता है, जो टर्मिनल एजेंटों को प्रशिक्षित करने के लिए एक सरल लेकिन शक्तिशाली ओपन-सोर्स रेसिपी है, जो एक बड़े पैमाने के डेटासेट को बनाने के लिए एक नवीन डेटा जनरेशन टैक्सोनॉमी का लाभ उठाता है, जिससे केवल आउटकम-आधारित सुदृढीकरण लर्निंग (reinforcement learning) का उपयोग करके एक 9B-पैरामीटर मॉडल को Terminal-Bench 2.0 पर अत्याधुनिक प्रदर्शन प्राप्त करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
बड़ी तस्वीर: एक रोबोट को कंप्यूटर चलाना सिखाना
कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल) है जो कोड लिख सकता है और सवालों के जवाब दे सकता है। लेकिन अभी, यह एक ऐसे प्रतिभाशाली छात्र की तरह है जिसे कभी कीबोर्ड छूने या कंप्यूटर टर्मिनल का उपयोग करने की अनुमति नहीं दी गई है। वह कंप्यूटरों के बारे में जानता है, लेकिन वह काम पूरा करने के लिए वास्तव में उनका उपयोग कैसे किया जाए, यह नहीं जानता।
TMAX प्रोजेक्ट एक सरल, प्रभावी "ट्रेनिंग कैंप" है जिसे इन रोबोट्स को यह सिखाने के लिए डिज़ाइन किया गया है कि जटिल, वास्तविक दुनिया की समस्याओं को हल करने के लिए कंप्यूटर टर्मिनल (वह काली स्क्रीन जहाँ आप कमांड टाइप करते हैं) का उपयोग कैसे किया जाए।
समस्या: "जिम" बहुत आसान था
इस पेपर से पहले, शोधकर्ताओं ने मौजूदा डेटासेट्स का उपयोग करके इन रोबोट्स को प्रशिक्षित करने की कोशिश की थी। लेखकों ने इन पुराने डेटासेट्स की तुलना हल्के डंबल वाले जिम से की।
- समस्या: कार्य बहुत सरल थे (जैसे "फाइलें सूचीबद्ध करना" या "फाइल को मूव करना")। आधुनिक रोबोट इन्हें तुरंत हल कर सकते थे, इसलिए उन्होंने कुछ भी नया नहीं सीखा।
- कमी: वास्तविक दुनिया के कार्य कठिन होते हैं। उनमें सर्वर सेटअप करना, जटिल कोड को डीबग करना और कमांड के लंबे क्रम चलाना शामिल है। पिछले प्रशिक्षण डेटा में यह "भारी काम" (heavy lifting) कवर नहीं था।
समाधान: एक कस्टम "ऑब्स्टेकल कोर्स" बनाना (TMAX-15K)
इसे ठीक करने के लिए, लेखकों ने TMAX-15K नामक एक विशाल नया डेटासेट बनाया। इसे इन रोबोट्स के लिए एक कस्टम, हाई-टेक बाधा दौड़ (obstacle course) डिजाइन करने के रूप में समझें।
हर कार्य को हाथ से लिखने के बजाय (जिसमें बहुत समय लगता), उन्होंने एक रेसिपी जनरेटर बनाया:
- मिक्स एंड मैच: उन्होंने विभिन्न "सामग्रियों" को बेतरतीब ढंग से मिलाने के लिए एक सिस्टम बनाया:
- डोमेन (क्षेत्र): क्या यह सुरक्षा के बारे में है? डेटा साइंस? फाइल मैनेजमेंट?
- पर्सोना (व्यक्तित्व): क्या रोबोट एक हैकर, एक सिस्टम एडमिन, या एक डेटा एनालिस्ट की भूमिका निभा रहा है?
- कठिनाई: क्या यह 3-स्टेप वाला कार्य है या 30-स्टेप वाली मैराथन?
- टूल्स (उपकरण): क्या रोबोट को ऑडियो फाइलों, इमेज, या जटिल कोड को संभालना होगा?
- "शिक्षक": उन्होंने इन कार्यों के लिए वास्तविक निर्देश और "उत्तर कुंजी" (answer key) उत्पन्न करने के लिए एक सुपर-स्मार्ट AI (Gemini-3-Pro) का उपयोग किया।
- परिणाम: उन्होंने 14,600 अद्वितीय कार्य बनाए। महत्वपूर्ण बात यह है कि उन्होंने सुनिश्चित किया कि कठिनाई बिल्कुल सही हो—न बहुत आसान, न असंभव। यह एक वीडियो गेम की तरह है जो खिलाड़ी को हमेशा चुनौती देने के लिए कठिनाई को स्केल करता है ताकि वह फँसा न रहे।
प्रशिक्षण विधि: करके सीखना (रीइन्फोर्समेंट लर्निंग)
एक बार जब उनके पास बाधा दौड़ तैयार हो गई, तो उन्हें रोबोट्स को प्रशिक्षित करने के लिए एक तरीके की आवश्यकता थी। उन्होंने रीइन्फोर्समेंट लर्निंग (RL) नामक एक विधि का उपयोग किया।
- उपमा: कल्पना कीजिए कि एक कुत्ता गेंद लाना (fetch) सीख रहा है। आप उसे गेंद फेंकने के भौतिक विज्ञान (physics) के बारे में नहीं समझाते। आप बस गेंद फेंकते हैं, और यदि कुत्ता उसे वापस लाता है, तो आप उसे एक ट्रीट (इनाम) देते हैं। यदि वह विफल होता है, तो कोई ट्रीट नहीं।
- TMAX रेसिपी:
- रोबोट टर्मिनल में किसी कार्य को हल करने का प्रयास करता है।
- यदि वह सफल होता है, तो उसे एक "रिवॉर्ड" (इनाम) मिलता है।
- यदि वह विफल होता है, तो उसे कुछ नहीं मिलता।
- रोबोट बार-बार प्रयास करता है, धीरे-धीरे यह समझने के लिए कि रिवॉर्ड पाने के लिए कमांड टाइप करने का सबसे अच्छा तरीका क्या है।
प्रमुख नवाचार: लेखकों ने पाया कि मानक प्रशिक्षण विधियाँ अस्थिर थीं (रोबोट जो सीखा था उसे "भूल" जाता था या क्रैश हो जाता था)। उन्होंने गणनाओं को सटीक रखने और प्रशिक्षण को स्थिर रखने के लिए गणित में बदलाव किया (उन्होंने DPPO नामक विधि का उपयोग किया), जो एक ऊबड़-खाबड़ सवारी में शॉक एब्जॉर्बर जोड़ने जैसा है।
परिणाम: छोटे मॉडल, बड़ी जीत
इस पेपर का सबसे आश्चर्यजनक हिस्सा उस रोबोट का आकार है जिसे उन्होंने प्रशिक्षित किया।
- अंडरडॉग: उन्होंने केवल 9 बिलियन पैरामीटर्स वाला एक मॉडल प्रशिक्षित किया (जिसे AI की दुनिया में "छोटा" माना जाता है)।
- विजय: इस छोटे मॉडल, जिसका नाम TMAX-9B है, ने लगभग हर अन्य "ओपन" (सार्वजनिक रूपथा उपलब्ध) मॉडल को हरा दिया, जिसमें 3 से 4 गुना बड़े मॉडल भी शामिल थे।
- तुलना: इसने बड़ी टेक कंपनियों द्वारा उपयोग किए जाने वाले टॉप-टियर, गुप्त मॉडलों (जैसे Claude Haiku) के लगभग बराबर प्रदर्शन किया।
यह एक बड़ी बात क्यों है?
आमतौर पर, किसी कठिन कार्य में बेहतर होने के लिए, आपको एक बड़े, अधिक महंगे दिमाग की आवश्यकता होती है। TMAX ने दिखाया कि सही प्रशिक्षण डेटा और एक अच्छी रेसिपी के साथ, एक छोटा, सस्ता दिमाग बहुत बड़े दिमागों को भी पछाड़ सकता है।
क्या प्रशिक्षण टिकता है? (जनरलाइजेशन)
लेखकों ने पूछा: "क्या रोबोट ने केवल हमारे विशिष्ट टेस्ट के उत्तर रट लिए, या उसने वास्तव में एक कौशल सीखा?"
- परीक्षण: उन्होंने प्रशिक्षित रोबोट को अलग-अलग वातावरण (अलग "जिम सेटअप") में रखा और उसे अलग-अलग प्रकार की समस्याएं दीं (जैसे सॉफ्टवेयर बग को ठीक करना या गणितीय पहेलियां हल करना)।
- परिणाम: रोबोट हर चीज़ में बेहतर हो गया। उसने केवल उनके विशिष्ट टेस्ट को पास करना नहीं सीखा; उसने यह सीखा कि कैसे सोचना है और टूल्स का अधिक प्रभावी ढंग से उपयोग करना है। यह एक छात्र को पढ़ने का तरीका सिखाने जैसा था; एक बार जब उन्होंने तरीका सीख लिया, तो वे केवल उसी परीक्षा को पास नहीं कर सकते थे जिस पर उन्होंने अभ्यास किया था, बल्कि वे किसी भी परीक्षा को पास कर सकते थे।
सारांश
TMAX पेपर AI एजेंट्स को कंप्यूटर चलाने के लिए सिखाने का एक "हाउ-टू" गाइड है।
- उन्होंने एक स्मार्ट जनरेटर का उपयोग करके एक विशाल, विविध और कठिन डेटासेट (TMAX-15K) बनाया।
- उन्होंने छोटे मॉडल्स को इस डेटासेट में नेविगेट करना सिखाने के लिए एक स्थिर प्रशिक्षण विधि का उपयोग किया।
- परिणाम: एक छोटा, ओपन-सोर्स मॉडल जो अब कंप्यूटर टर्मिनल का उपयोग करने में अपने प्रकार का सर्वश्रेष्ठ है, जो यह साबित करता है कि मॉडल को केवल बड़ा बनाने से ज्यादा बेहतर प्रशिक्षण डेटा मायने रखता है।
लेखकों ने अपना सारा कोड, डेटा और मॉडल मुफ्त में जारी कर दिया है, इस उम्मीद में कि यह भविष्य के शोधकर्ताओं के लिए और भी स्मार्ट टर्मिनल एजेंट बनाने के लिए एक मानक "रेसिपी" बनेगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।