The Llama 4 Herd: Architecture, Training, Evaluation, and Deployment Notes
यह शोध पत्र मेटा के लामा 4 (Llama 4) मॉडल परिवार पर एक व्यापक तकनीकी संदर्भ प्रदान करता है, जो इसके जारी किए गए वेरिएंट्स, अर्ली-फ्यूजन मल्टीमोडैलिटी और iRoPE जैसी उन्नत आर्किटेक्चरल विशेषताओं, प्रशिक्षण पद्धतियों, बेंचमार्क प्रदर्शन, परिनियोजन बाधाओं और लाइसेंसिंग दायित्वों के विवरण को समेकित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
इस दस्तावेज़ को एक नीरस पाठ्यपुस्तक के रूप में नहीं, बल्कि "लामा 4" (Llama 4) नामक एआई रोबोटों के एक नए, बहुत विशेष परिवार के लिए एक विस्तृत ओनर मैनुअल और फील्ड गाइड के रूप में देखें।
यहाँ यह पेपर क्या कवर करता है, इसे सरल कहानियों और उपमाओं में विभाजित किया गया है:
1. पारिवारिक पुनर्मिलन (वेरिएंट्स)
एक बड़े पारिवारिक मिलन की कल्पना करें। यह पेपर मुख्य पात्रों का परिचय देता है:
- स्काउट (Scout): वह फुर्तीला, तेज़ सीखने वाला जो अभी जाने के लिए तैयार है।
- मैवरिक (Maverick): वह साहसी भाई/बहन जिसके पास थोड़ा अलग कौशल सेट है।
- बेहेमोथ (Behemoth): वह विशाल, बुद्धिमान "शिक्षक" जो वर्तमान में केवल बाड़ के ऊपर से झाँक रहा है (पूर्वावलोकन) ताकि छोटों को दिखा सके कि यह कैसे किया जाता है।
यह पेपर बताता है कि ये विभिन्न "झुंड के सदस्य" एक साथ कैसे फिट होते हैं।
2. उनके दिमाग कैसे जुड़े हैं (आर्किटेक्चर)
एक विशाल मस्तिष्क होने के बजाय जो एक साथ सब कुछ करने की कोशिश करता है, ये मॉडल एक विशेषज्ञ टीम दृष्टिकोण का उपयोग करते हैं:
- MoE (मिक्सचर ऑफ एक्सपर्ट्स): इसे कई विशेषज्ञों वाले एक अस्पताल के रूप में सोचें। जब कोई प्रश्न आता है, तो एआई हर डॉक्टर से नहीं पूछता; बल्कि वह प्रश्न को उस विशिष्ट विशेषज्ञ के पास भेज देता है जिसकी उस कार्य के लिए आवश्यकता है। कुछ विशेषज्ञ सभी के लिए साझा होते हैं, जबकि अन्य निजी विशेषज्ञ होते हैं।
- अर्ली-फ्यूजन मल्टीमॉडलिटी (Early-Fusion Multimodality): कल्पना करें कि एक व्यक्ति जो केवल एक किताब पढ़ता और एक तस्वीर देखता नहीं है, बल्कि शब्दों और छवियों को एक ही क्षण से एक एकल, मिश्रित कहानी के रूप में देखता है जब वे पहली बार सीखते हैं। इस तरह यह एआई टेक्स्ट और चित्रों को एक साथ प्रोसेस करता है।
- लॉन्ग-कॉन्टेक्स्ट डिज़ाइन (iRoPE): यह एआई को एक स्टिकी नोट के बजाय कागज के एक बहुत लंबे स्क्रॉल देने जैसा है। यह एआई को एक पूरा उपन्यास या लंबी बातचीत को समझने की अनुमति देता है बिना अंत तक पहुँचते-पहुँचते शुरुआत को भूले।
3. उन्हें कैसे सिखाया गया (ट्रेनिंग)
यह पेपर एआई की शिक्षा को तीन चरणों में वर्णित करता है:
- प्री-ट्रेनिंग (Pre-training): "प्रारंभिक विद्यालय" का चरण जहाँ एआई बुनियादी तथ्यों और भाषा को सीखने के लिए किताबों के एक विशाल पुस्तकालय को पढ़ता है।
- मिड-ट्रेनिंग (Mid-training): एक "विशेष शिविर" जहाँ एआई विशेष रूप से उन लंबे स्क्रॉल (लॉन्ग कॉन्टेक्स्ट) पर अभ्यास करता है ताकि वह लंबी कहानियों में खो न जाए।
- पोस्ट-ट्रेनिंग (Post-training): "फिनिशिंग स्कूल" जहाँ एआई मददगार और विनम्र बनना सीखता है। पेपर नोट करता है कि उन्होंने यहाँ एक "लाइटवेट" दृष्टिकोण का उपयोग किया—जैसे कि एक त्वरित, केंद्रित कोचिंग सत्र (SFT) और कुछ मैत्रीपूर्ण प्रतिस्पर्धा (RL और DPO) के माध्यम से अपने उत्तरों को परिष्कृत करना, न कि एक भारी, वर्षों लंबे ओवरहाल के रूप में।
4. रिपोर्ट कार्ड (बेंचमार्क्स)
पेपर कच्चे, बिना पॉलिश किए गए मॉडल और निर्देशों का पालन करने के लिए सिखाए गए मॉडलों दोनों के लिए टेस्ट स्कोर शामिल करता है। यह डेवलपर्स को बताता है कि मानक परीक्षणों पर अन्य मॉडलों की तुलना में ये मॉडल कैसा प्रदर्शन करते हैं, जैसा कि रचनाकारों द्वारा सार्वजनिक रूप से साझा किया गया है।
5. कार चलाना (डिप्लॉयमेंट)
यह खंड मैकेनिक की गाइड है। यह समझाता है:
- सड़क के नियम: क्या होता है यदि आप इस एआई को विभिन्न कंप्यूटरों या क्लाउड सेवाओं पर चलाने की कोशिश करते हैं?
- आकार की सीमाएँ: एआई कितना "मेमोरी" (कॉन्टेक्स्ट) विभिन्न सेटिंग्स में संभाल सकता है।
- पैकेजिंग: एआई को छोटा करने (क्वांटाइजेशन) का तरीका ताकि यह बिना टूटे छोटे स्थानों में फिट हो सके।
6. बारीक विवरण (लाइसेंसिंग और सुरक्षा)
अंत में, पेपर एक कानूनी और सुरक्षा चेकलिस्ट के रूप में कार्य करता है:
- नियम: यदि आप इस एआई को साझा करना चाहते हैं या अपना स्वयं का संस्करण बनाना चाहते हैं, तो यहाँ विशिष्ट नियम दिए गए हैं जिनका आपको पालन करना चाहिए (लाइसेंसिंग)।
- सुरक्षा जाल: यह उन गार्डरेल्स (guardrails) की समीक्षा करता है जो एआई को हानिकारक बातें कहने से रोकने के लिए लगाए गए थे और यह भी कि रचनाकारों ने यह सुनिश्चित करने के लिए कैसे परीक्षण किया कि वे गार्डरेल्स काम करते हैं।
संक्षेप में: यह दस्तावेज़ एक "सत्य का स्रोत" (source of truth) है जो किसी भी ऐसे व्यक्ति के लिए है जो जानना चाहता है कि लामा 4 वास्तव में क्या है, इसे कैसे बनाया गया है, यह कितना स्मार्ट है, और जब आप इसका उपयोग करते हैं तो कौन से नियम लागू होते हैं, बिना भविष्य की संभावनाओं का अनुमान लगाए या मनगढ़ंत बातें किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।