← नवीनतम पेपर
🤖 AI

Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

Palmyra x6 एक एंटरप्राइज-उन्मुख एजेंटिक लैंग्वेज मॉडल है जो एक कॉम्पैक्ट, वेरीफाइड डेटासेट पर एंकोर्ड सुपरवाइज्ड फाइन-ट्यूनिंग का उपयोग करने वाले एक कंजर्वेटिव, कंट्रोल्ड पोस्ट-ट्रेनिंग दृष्टिकोण के माध्यम से टूल-यूज़ बेंचमार्क्स पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करता है।

मूल लेखक: Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

प्रकाशित 2026-08-18
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस के तेजी से विकसित होते परिदृश्य में, एक निरंतर चुनौती यह रही है कि बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) को उनके मौजूदा कौशल को खोए बिना विश्वसनीय सहायक के रूप में कैसे प्रशिक्षित किया जाए। पारंपरिक रूप से, किसी विशिष्ट कार्य के लिए उच्च-प्रदर्शन वाला मॉडल बनाने के लिए पूरे सिस्टम को शुरू से फिर से बनाने की आवश्यकता होती थी, जो कि हर अलग वाहन के लिए एक नया इंजन बनाने जैसी प्रक्रिया थी। हाल ही में, शोधकर्ताओं ने पाया है कि यदि प्रशिक्षण डेटा असाधारण गुणवत्ता का हो और सीखने की विधि सटीक हो, तो एक मौजूदा, शक्तिशाली मॉडल को लेकर उसके व्यवहार को किसी विशिष्ट उद्देश्य के लिए सावधानीपूर्वक परिष्कृत करना अक्सर पर्याप्त होता है। यह दृष्टिकोण "एजेंटिक" (agentic) कार्यों पर केंद्रित है, जहाँ मॉडल को न केवल प्रश्नों के उत्तर देने होते हैं, बल्कि सक्रिय रूप से चरणों की योजना बनानी होती है, वेब सर्च या कोड निष्पादन जैसे डिजिटल उपकरणों का उपयोग करना होता है, और समस्याओं को हल करने के लिए जटिल, बहु-चरणीय वर्कफ्लो को संचालित करना होता है। लक्ष्य एक ऐसा AI बनाना है जो केवल टेक्स्ट जेनरेट करने के बजाय, वास्तविक दुनिया के डिजिटल वातावरण में प्रभावी ढंग से कार्य कर सके, और लंबी अवधि की योजना बनाने तथा विभिन्न सॉफ्टवेयर सिस्टम के साथ बातचीत करने वाले कार्यों को संभाल सके।

Writer, Inc. के शोधकर्ताओं की एक टीम ने Palmyra x6 के विकास के साथ इस चुनौती का समाधान किया है, जिसे विशेष रूप से इन एजेंटिक कार्यों में उत्कृष्टता प्राप्त करने के लिए डिज़ाइन किया गया है। एक विशाल नया मॉडल शून्य से प्रशिक्षित करने के बजाय, उन्होंने एक परिष्कृत मौजूदा फाउंडेशन के रूप में GLM-5.2 से शुरुआत की, जो सैकड़ों अरबों पैरामीटर्स वाला एक मॉडल है। इस फाउंडेशन में, उन्होंने 'एंकोर्ड सुपरवाइज्ड फाइन-ट्यूनिंग' (Anchored Supervisedized Fine-Tuning) नामक एक अत्यधिक विशिष्ट प्रशिक्षण पद्धति लागू की। यह तकनीक मॉडल को नए कौशल सिखाने के लिए डिज़ाइन की गई है—विशेष रूप से, उपकरणों का उपयोग करने और जटिल कार्यों की योजना बनाने के लिए—जबकि यह सख्ती से इसे अपने पहले से मौजूद सामान्य ज्ञान और तर्क क्षमताओं को भूलने या कम होने से रोकती है। परिणाम एक ऐसी प्रणाली है जो जटिल डिजिटल वातावरण, जैसे कि वेब सर्च, कोड निष्पादन और दस्तावेज़ पुनर्प्राप्ति (document retrieval) वाले परिवेश में, पिछले संस्करणों की तुलना में काफी बेहतर प्रदर्शन करते हुए और उपलब्ध सबसे उन्नत मॉडलों को टक्कर देते हुए सक्षम है।

इस उपलब्धि का मूल भाग प्रशिक्षण के लिए उपयोग किए गए डेटा की गुणवत्ता और प्रकृति में निहित है। मॉडल को इंटरनेट के विशाल टेक्स्ट खिलाने के बजाय, शोधकर्ताओं ने केवल 626 उदाहरणों वाला एक संक्षिप्त, अत्यधिक क्यूरेटेड (curated) डेटासेट तैयार किया। प्रत्येक उदाहरण एक कार्य को हल करने के लिए AI एजेंट द्वारा पूरा किया गया एक पूर्ण, सत्यापित प्रक्षेपवक्र (trajectory) है। ये सिंथेटिक कहानियाँ हैं जहाँ AI चरणों की एक श्रृंखला की योजना बनाता है, जानकारी एकत्र करने या क्रियाएं करने के लिए विभिन्न उपकरणों को कॉल करता है, और एक सही समाधान तक पहुँचता है। यह सुनिश्चित करने के लिए कि ये उदाहरण पूर्ण हों, शोधकर्ताओं ने एक कठोर प्रक्रिया का उपयोग किया जहाँ एक "शिक्षक" मॉडल ने पहले एक सफल पथ का प्रदर्शन किया, और फिर एक "छात्र" मॉडल को स्वतंत्र रूप से उसी समस्या को हल करने के लिए कहा गया, जिसमें शिक्षक की योजना का उपयोग केवल एक उच्च-स्तरीय मार्गदर्शक के रूप में किया गया। यदि छात्र मॉडल ने उत्तर की नकल करके प्रक्रिया को बायपास करने का प्रयास किया या उपकरणों का सही ढंग से उपयोग करने में विफल रहा, तो उस प्रयास को हटा दिया गया। केवल सबसे सफल और ईमानदार प्रयासों को रखा गया, जिससे उदाहरणों का एक छोटा लेकिन अविश्वसनीय रूप से उच्च-गुणवत्ता वाला पुस्तकालय बना, जिसने मॉडल को एक सक्षम एजेंट की तरह सोचना और कार्य करना सिखाया।

इस छोटे डेटासेट से सीखने के लिए और अपनी मूल क्षमताओं को खोए बिना, शोधकर्ताओं ने एक ऐसी विधि का उपयोग किया जो एक सुरक्षा एंकर (safety anchor) के रूप में कार्य करती है। प्रशिक्षण प्रक्रिया के दौरान, मॉडल को लगातार उसके मूल, अप्रशिक्षित स्वरूप की याद दिलाई जाती है। यह "एंकर" यह सुनिश्चित करता है कि जबकि मॉडल उपकरणों का उपयोग करना और कार्यों की योजना बनाना सीख रहा है, वह अपनी सामान्य बुद्धिमत्ता और सुरक्षा व्यवहारों से दूर न जाए। यह महत्वपूर्ण है क्योंकि एक बहुत छोटे डेटासेट पर प्रशिक्षण देने से मॉडल अत्यधिक विशिष्ट हो सकता है या सामान्य बातचीत संभालने की अपनी क्षमता खो सकता है। मॉडल को उसके मूल अवस्था से बांधकर रखने के कारण, शोधकर्ता इसके आधार को क्षीण किए बिना इसमें नई एजेंटिक क्षमताएं डालने में सक्षम रहे। उन्होंने एक विशेष गणितीय ऑप्टिमाइज़र (optimizer) का भी उपयोग किया, जो एक ऐसा उपकरण है जो मॉडल को उसके आंतरिक कनेक्शनों को केवल संख्याओं के बजाय ज्यामितिक आकृतियों के रूप में मानकर अधिक कुशलता से सीखने में मदद करता है, जिससे यह उपलब्ध सीमित डेटा का बेहतर उपयोग कर पाता है।

इनके परिणाम तत्काल और पर्याप्त थे। जब टूल्स का उपयोग करने, दीर्घकालिक कार्यों की योजना बनाने और जटिल निर्देशों का पालन करने की AI की क्षमता को मापने के लिए डिज़ाइन किए गए व्यापक बेंचमार्क के विरुद्ध परीक्षण किया गया, तो Palmyra x6 ने Writer के एजेंट द्वारा उपयोग किए जाने वाले पिछले डिफॉल्ट मॉडल की तुलना में भारी सुधार दिखाया। इसने विशेष रूप से वित्तीय अनुसंधान में मजबूत बढ़त दिखाई, जहाँ इसे वेब खोजने और डेटा का विश्लेषण करने की आवश्यकता थी, और सामान्य टूल-यूज़ परिदृश्यों में भी। मॉडल ने अन्य अग्रणी फ्रंटियर मॉडलों के मुकाबले प्रतिस्पर्धी प्रदर्शन किया, और अक्सर कई अलग-अलग परीक्षणों में औसत स्कोर के मामले में शीर्ष समूह में रहा। सबसे महत्वपूर्ण बात यह है कि मॉडल ने सुरक्षा और तटस्थता का उच्च स्तर बनाए रखा। राजनीतिक पूर्वाग्रह और इनकार व्यवहार (refusal behavior) को मापने के लिए डिज़ाइन किए गए परीक्षणों में, Palmyra x6 ने एक संतुलित दृष्टिकोण दिखाया, विवादास्पद मुद्दों के कई पक्ष प्रस्तुत किए और हानिकारक अनुरोधों को उसी दर पर अस्वीकार किया जो इसके बेस मॉडल के अनुरूप था, जिससे यह सिद्ध हुआ कि नए कौशल सुरक्षा या विश्वसनीयता की कीमत पर नहीं आए।

शोधकर्ताओं ने सावधानीपूर्वक उल्लेख किया है कि यह मॉडल एक विशिष्ट उपकरण है, न कि सभी AI कार्यों के लिए एक सार्वभौमिक प्रतिस्थापन। इसकी ताकत विशेष रूप से उन एजेंटिक वर्कफ्लो में है जहाँ यह टूल्स को कॉल कर सकता है और योजनाओं को निष्पादित कर सकता है, जबकि अन्य प्रकार के कार्यों पर इसका प्रदर्शन इसके निर्माण में उपयोग किए गए बेस मॉडल की क्षमताओं द्वारा नियंत्रित होता है। प्रशिक्षण डेटा, संख्या में छोटा होने के बावजूद, टूल उपयोग के विशिष्ट व्यवहार को सिखाने के लिए पर्याप्त था क्योंकि सीखने की विधि रूढ़िवादी और सटीक होने के लिए डिज़ाइन की गई थी। यह मॉडल अब व्यावसायिक उपयोग के लिए उपलब्ध है, जो एक ऐसा संस्करण प्रदान करता है जिसे मानक हार्डवेयर पर कुशलतापूर्वक चलाया जा सकता है। यह कार्य प्रदर्शित करता है कि सही संयोजन के साथ—उच्च गुणवत्ता वाला डेटा, एक सावधानीपूर्वक प्रशिक्षण उद्देश्य और एक स्थिर फाउंडेशन—बिना शून्य से विशाल, संसाधन-गहन पुन: प्रशिक्षण के, अत्यधिक सक्षम AI एजेंट बनाना संभव है। Palmyra x6 की सफलता यह सुझाव देती है कि एक भविष्य जहाँ AI सहायकों को लाखों अपूर्ण उदाहरणों के बजाय कुछ सौ पूर्ण उदाहरणों के आधार पर, सटीकता और सुरक्षा के साथ जटिल, वास्तविक दुनिया के कार्यों के लिए अनुकूलित किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →