← नवीनतम पेपर
💬 NLP

Typhoon-S: Minimal Open Post-Training for Sovereign Large Language Models

यह शोध पत्र टाइफून S (Typhoon S) को प्रस्तुत करता है, जो एक न्यूनतम और ओपन पोस्ट-ट्रेनिंग रेसिपी है जो सुपरवाइज्ड फाइन-ट्यूनिंग, ऑन-पॉलिसी डिस्टिलेशन, और InK-GRPO के साथ लघु-स्तरीय RFT को संयोजित करती है ताकि यह प्रदर्शित किया जा सके कि विशाल इंस्ट्रक्शन कॉर्पोरा या जटिल सुदृढीकरण शिक्षण (reinforcement learning) पाइपलाइनों पर निर्भर हुए बिना, अकादमिक-स्तर के संसाधनों के तहत थाई कानूनी तर्क जैसे क्षेत्र-विशिष्ट कार्यों में सक्षम उच्च-गुणवत्ता वाले, संप्रभु लार्ज लैंग्वेज मॉडल्स विकसित किए जा सकते हैं।

मूल लेखक: Kunat Pipatanakul, Pittawat Taveekitworachai

प्रकाशित 2026-01-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kunat Pipatanakul, Pittawat Taveekitworachai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, विश्व-स्तरीय छात्र (एक लार्ज लैंग्वेज मॉडल) है जो उत्तम अंग्रेजी और चीनी बोलता है, लेकिन वह एक विशिष्ट देश की स्थानीय बोली, संस्कृति और कानूनों को समझने में संघर्ष करता है। आमतौर पर, इस समस्या को ठीक करने के लिए, बड़ी टेक कंपनियाँ भारी मात्रा में पैसा, सुपरकंप्यूटर और अंतहीन डेटा झोंक देती हैं। लेकिन क्या होगा यदि एक छोटा दल, जैसे कि कोई विश्वविद्यालय या राष्ट्रीय सरकार, अपना स्वयं का "संप्रभु" (sovereign) AI बनाना चाहती है जो बिना अरबों डॉलर के बजट के उनके स्थानीय संदर्भ को समझ सके?

यह शोध पत्र Typhoon-S को पेश करता है, जो इन AI मॉडलों को एक सहायक सामान्य असिस्टेंट और स्थानीय, उच्च-जोखिम वाले कार्यों (जैसे थाई कानून) में विशेषज्ञ बनाने के लिए एक "न्यूनतम रेसिपी" (minimalist recipe) है, जो बहुत सीमित संसाधनों का उपयोग करती है।

उन्होंने इसे कैसे किया, इसे दो मुख्य भागों में विभाजित किया गया है:

भाग 1: AI को "अपोचेबल" (Adoptable) बनाना (सामान्य सहायक)

लक्ष्य: एक कच्चे, स्मार्ट बेस मॉडल को एक विनम्र, सहायक असिस्टेंट में बदलना जो निर्देशों का पालन कर सके, कोड लिख सके और स्थानीय भाषा में स्वाभाविक रूप से चैट कर सके।

समस्या: यदि आप केवल एक मॉडल को नए निर्देश सिखाते हैं (सुपरवाइज्ड फाइन-ट्यूनिंग या SFT), तो वह अक्सर "भंगुर" (brittle) हो जाता है। यह एक ऐसे छात्र की तरह है जिसने पाठ्यपुस्तक के उत्तर रट लिए हैं, लेकिन जब शिक्षक थोड़ा अलग सवाल पूछता है या भाषा मिला देता है, तो वह घबरा जाता है।

समाधान: "शैडोइंग" तकनीक (ऑन-पॉलिसी डिस्टिलेशन - On-Policy Distillation)
लेखकों ने दो-चरणीय प्रक्रिया का उपयोग किया:

  1. पाठ (SFT): पहले उन्होंने मॉडल को अंग्रेजी और थाई निर्देशों का एक छोटा, उच्च-गुणवत्ता वाला मिश्रण दिया। यह एक क्रैश कोर्स देने जैसा था।
  2. शैडोइंग (OPD): केवल उत्तरों को याद करने के बजाय, मॉडल को अपने स्वयं के उत्तर उत्पन्न करने के लिए कहा गया, और एक "शिक्षक" मॉडल (एक बहुत अधिक स्मार्ट AI) वास्तविक समय में उसे देखता और सुधार करता था।
    • उपमा: कल्पना कीजिए कि एक संगीत छात्र एक गीत बजा रहा है। पुराने तरीके में, वे बस एक रिकॉर्डिंग सुनते हैं और उसकी नकल करने की कोशिश करते हैं। इस नए तरीके में, छात्र संगीत बजाता है, और एक मास्टर संगीतकार उनके बगल में बैठता है, और छात्र के बजाते समय ही सुधारों को फुसफुसाता है। इससे छात्र अपनी गलतियों से उबरना सीखता है, जिससे वह बहुत अधिक मजबूत और लचीला बनता है।

परिणाम: उन्होंने यह केवल कुछ दिनों के प्रशिक्षण और GPU के एक छोटे क्लस्टर (लग लगभग एक विश्वविद्यालय लैब के आकार का) के साथ हासिल किया। परिणामी मॉडल, Typhoon-S-8B, एक मजबूत सामान्य सहायक बन गया जो चैट कर सकता है, कोड लिख सकता है और अंग्रेजी और थाई के बीच सहजता से स्विच कर सकता है, जो बड़े मॉडलों को टक्कर देता है।

भाग 2: AI को "संप्रभु क्षमता" (Sovereign Capability) देना (स्थानीय विशेषज्ञ)

लक्ष्य: AI को जटिल, उच्च-जोखिम वाले स्थानीय कार्यों को संभालने के लिए सिखाना, विशेष रूप से थाई कानूनी तर्क (Thai legal reasoning), जहाँ उसे स्थानीय कानूनों को समझने और उत्तर खोजने के लिए टूल्स का उपयोग करने की आवश्यकता होती है।

समस्या: मानक AI प्रशिक्षण अक्सर केवल वही सुदृढ़ करता है जो मॉडल पहले से जानता है। यदि मॉडल को किसी विशिष्ट थाई कानून के बारे में नहीं पता है, तो मानक प्रशिक्षण उसे जादुई रूप से वह नया तथ्य नहीं सिखाएगा। इसके अलावा, मानक प्रशिक्षण AI को टूल्स (जैसे सर्च इंजन) का उपयोग करके जानकारी खोजने के लिए नहीं सिखाता है।

समाधान: "दोहरे मस्तिष्क" का प्रशिक्षण (InK-GRPO)
लेखकों ने इंजेक्टेड नॉलेज GRPO (InK-GRPO) नामक एक नई प्रशिक्षण विधि का आविष्कार किया।

  • ब्रेन गेम: कल्पना कीजिए कि AI एक खेल खेल रहा है जहाँ उसे एक कानूनी पहेली को हल करना है।
    • मस्तिष्क A (खिलाड़ी): यह एक रिवॉर्ड सिस्टम (जैसे वीडियो गेम स्कोर) का उपयोग करके पहेली को हल करने की कोशिश करता है ताकि तर्क करने में बेहतर हो सके।
    • मस्तिष्क B (पाठक): जबकि मस्तिष्क A खेल रहा होता है, मस्तिष्क B चुपचाप थाई कानूनी दस्तावेजों के ढेर को पढ़ रहा होता है।
    • जादू: सिस्टम इन दोनों मोड के बीच बेतरतीब ढंग से स्विच करता है। कभी-कभी AI खेल खेलता है; कभी-कभी वह दस्तावेजों को पढ़ता है। यह AI को नए तथ्य (कानूनों) को सीखने के साथ-साथ उन्हें समस्याओं को हल करने के लिए उपयोग करने का तरीका भी सीखने की अनुमति देता है।

टूल यूजर (एजेंटिक RFT):
उन्होंने AI को टूल्स का उपयोग करना भी सिखाया।

  • उपमा: दुनिया के हर कानून को याद करने की कोशिश करने के बजाय, AI को यह सिखाया जाता है कि वह कहे, "मुझे वह विशिष्ट कानून नहीं पता, मुझे डेटाबेस खोजने दें," दस्तावेज़ को पढ़े, और फिर उत्तर दे।
  • उन्होंने AI को इस लूप में प्रशिक्षित किया: सोचें -> खोजें -> पढ़ें -> सोचें -> उत्तर दें।

परिणाम: Typhoon-S-4B लीगल एजेंट थाई कानूनी तर्क में अविश्वसनीय रूप से अच्छा हो गया। आश्चर्यजनक रूप से, इस छोटे 4-बिलियन-पैरामीटर वाले मॉडल ने, जिसे इस विशिष्ट विधि के साथ प्रशिक्षित किया गया था, एक बहुत बड़े, प्रसिद्ध मॉडल (GPT-5) को पीछे छोड़ दिया, जब दोनों को उत्तर खोजने के लिए समान टूल्स दिए गए थे।

मुख्य निष्कर्ष (The Big Picture)

यह शोध पत्र सिद्ध करता है कि एक शक्तिशाली, संप्रभु AI बनाने के लिए आपको विशाल सुपरकंप्यूटर की आवश्यकता नहीं है।

  • सामान्य उपयोग के लिए: "पाठ" और "शैडोइंग" (SFT + OPD) का एक सरल मिश्रण मॉडल को स्मार्ट और सहायक बनाने के लिए पर्याप्त है।
  • स्थानीय विशेषज्ञता के लिए: "खेल खेलने" और "पाठ्यपुस्तकों को पढ़ने" (InK-GRPO) का एक चतुर मिश्रण एक छोटे मॉडल को नए स्थानीय तथ्यों को सीखने और टूल्स का प्रभावी ढंग से उपयोग करने की अनुमति देता है।

लागत: उन्होंने यह सब उन संसाधनों के साथ किया जो एक विशिष्ट विश्वविद्यालय लैब के पास उपलब्ध होते हैं (4 से 8 उच्च-स्तरीय GPU पर कुछ दिनों का प्रशिक्षण), जो यह साबित करता है कि संप्रप्त, स्थानीयकृत AI बनाने के लिए स्मार्ट डिज़ाइन, ब्रूट फोर्स स्केल (शक्तिशाली पैमाने) से अधिक महत्वपूर्ण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →