Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models
यह शोध पत्र Jagle को प्रस्तुत करता है, जो अब तक का सबसे बड़ा जापानी मल्टीमॉडल पोस्ट-ट्रेनिंग डेटासेट है जिसमें विविध स्रोतों से उत्पन्न 9.2 मिलियन इंस्टेंस शामिल हैं, जो जापानी विजन-लैंग्वेज मॉडल्स की क्षमताओं को बढ़ाते हुए उनकी अंग्रेजी क्षमताओं को बनाए रखता है या उनमें सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। आप उसे आँखें (एक कैमरा) और एक दिमाग (एक लैंग्वेज मॉडल) देते हैं। इस रोबोट को स्मार्ट बनाने के लिए, आपको उसे लाखों तस्वीरें दिखानी होंगी और उनमें क्या है, इसके बारे में कहानियाँ बतानी होंगी। इसी तरह "विज़न-लैंग्वेज मॉडल्स" (VLMs) को प्रशिक्षित किया जाता है।
लंबे समय से, वैज्ञानिकों के पास इन चित्र-कहानियों का एक विशाल पुस्तकालय अंग्रेजी में उपलब्ध था। वे एक सुपर-स्मार्ट अंग्रेजी रोबोट बनाने के लिए मौजूदा हजारों किताबों को आपस में मिला और जोड़ सकते थे।
लेकिन जापानी के लिए, यह पुस्तकालय लगभग खाली था। वहाँ पर्याप्त किताबें नहीं थीं, और जो मौजूद थीं वे बहुत छोटी थीं या केवल सरल विषयों को कवर करती थीं। आप अंग्रेजी की किताबों का अनुवाद सीधे नहीं कर सकते थे क्योंकि उनमें अंग्रेजी टेक्स्ट (जैसे साइन या चार्ट) होते थे, जो एक जापानी रोबोट को भ्रमित कर सकते थे।
पेश है "Jagle"।
Jagle को उस खाली जापानी पुस्तकालय को भरने के लिए बनाई गई एक विशाल, कस्टम-निर्मित निर्माण परियोजना के रूप में समझें। यहाँ लेखक बताते हैं कि उन्होंने इसे कैसे बनाया, कुछ सरल उपमाओं का उपयोग करते हुए:
1. समस्या: "खाली शेल्फ"
अधिकांश शोधकर्ता मौजूदा "प्रश्न और उत्तर" वाली किताबें इकट्ठा करके डेटासेट बनाते हैं। अंग्रेजी में, ऐसी लाखों किताबें हैं। जापानी में, शेल्फ खाली हैं। इतने कम डेटा के साथ एक स्मार्ट जापानी रोबोट बनाने की कोशिश करना ऐसा ही है जैसे किसी बच्चे को केवल एक कॉमिक बुक का उपयोग करके पढ़ना सिखाना।
2. समाधान: शून्य से निर्माण
मौजूदा किताबें खोजने के बजाय, Jagle टीम ने किताबों को खुद बनाने का निर्णय लिया। उन्होंने हर जगह से कच्चा माल इकट्ठा किया:
- जापान में ली गई तस्वीरें: रोज़मर्रा की ज़िंदगी के एक डिजिटल फोटो एल्बम की तरह।
- PDF और दस्तावेज़: स्कैन किए गए सरकारी कागजात, पाठ्यपुस्तकें और रिपोर्ट।
। - वेब पेज: इंटरनेट से अरबों इमेज-टेक्स्ट जोड़े।
उन्होंने केवल कॉपी-पेस्ट नहीं किया; उन्होंने इन कच्चे माल को सीखने के अभ्यासों में बदलने के लिए एक "फैक्ट्री" दृष्टिकोण का उपयोग किया।
3. फैक्ट्री: प्रश्न बनाने के चार तरीके
टीम ने कच्चे डेटा को प्रशिक्षण प्रश्नों में बदलने के लिए चार अलग-अलग "मशीनों" का उपयोग किया:
- AI इंटरव्यूअर (VLM-आधारित जनरेशन): उन्होंने एक सुपर-स्मार्ट AI (Qwen3-VL) का उपयोग किया जो एक तस्वीर को देखता है और पूछता है, "यहाँ क्या हो रहा है?" और फिर उसका उत्तर देता है। यह एक रोबोट टूर गाइड की तरह है जो पुलिस स्टेशन की फोटो देखता है और कहता है, "यह गुन्मा प्रिफेक्चरल पुलिस मुख्यालय है।"
- अनुवादक (The Translator): उन्होंने मौजूदा अंग्रेजी चार्ट और ग्राफ लिए, इमेज के अंदर के टेक्स्ट और प्रश्नों को जापानी में अनुवादित किया, यह सुनिश्चित करते हुए कि चित्र और शब्द पूरी तरह से मेल खाते हों।
- प्रिंटर (टेक्स्ट रेंडरिंग): उन कार्यों के लिए जहाँ रोबोट को इमेज से टेक्स्ट पढ़ने की आवश्यकता होती है (जैसे साइन पढ़ना), उन्होंने टेक्स्ट लिया, उसे एक खाली इमेज पर प्रिंट किया, और रोबमा को उसे वापस पढ़ने के लिए कहा।
- स्कैनर (OCR): उन्होंने अव्यवस्थित दस्तावेजों से टेक्स्ट निकालने और उस टेक्स्ट के आधार पर प्रश्न बनाने के लिए विशेष उपकरणों का उपयोग किया।
4. परिणाम: एक विशाल पुस्तकालय
इसका परिणाम है Jagle, एक डेटासेट जिसमें 9.2 मिलियन उदाहरण हैं।
- यह 5 प्रकार की सोच को कवर करता है: सामान्य प्रश्न (इस फोटो में क्या है?), चार्ट पढ़ना, विवरण लिखना, इमेज से टेक्स्ट पढ़ना और सरल टेक्स्ट एक्सट्रैक्शन।
- यह अपने प्रकार का अब तक का सबसे बड़ा जापानी डेटासेट है।
5. परीक्षण: क्या यह काम करता है?
शोधकर्ताओं ने इस नए पुस्तकालय का उपयोग करके एक छोटे रोबोट मस्तिष्क (2.2 बिलियन पैरामीटर्स) को प्रशिक्षित किया।
- जापानी कौशल: रोबोट जापानी कार्यों में अविश्वसनीय रूप से स्मार्ट हो गया। उसने पिछले सर्वश्रेष्ठ जापानी रोबोट (InternVL3.5) को पछाड़ दिया और दुनिया के सर्वश्रेष्ठ बहुभाषी रोबोट (Qwen3-VL) के बहुत करीब पहुँच गया।
- अंग्रेजी कौशल: यहाँ जादू है। आमतौर पर, जब आप एक रोबोट को एक नई भाषा सिखाते हैं, तो वह अपनी पुरानी भाषा में कमजोर हो जाता है (जैसे एक छात्र जो फ्रेंच पर इतना ध्यान केंद्रित करता है कि वह अपनी अंग्रेजी भूल जाता है)। लेकिन Jagle के साथ, रोबोट अंग्रेजी में भी बेहतर हो गया!
- क्यों? लेखकों का मानना है कि विविध जापानी डेटा जोड़ने से, रोबोट अधिक लचीला और रचनात्मक बनना सीख गया, जिसने वास्तव में उसे अंग्रेजी समस्याओं को पहले की तुलना में बेहतर ढंग से हल करने में मदद की।
बड़ी तस्वीर
यह पेपर दिखाता है कि आपको किसी दूसरे के द्वारा आपकी भाषा के लिए पुस्तकालय बनाने का इंतज़ार करने की ज़रूरत नहीं है। यदि आपके पास सही उपकरण और एक रचनात्मक पाइपलाइन है, तो आप शून्य से एक विशाल, उच्च-गुणवत्ता वाला प्रशिक्षण डेटासेट बना सकते हैं।
Jagle एक जापानी छात्र को चित्रों और कहानियों का एक नया, 9-मिलियन-पेज का विश्वकोश देने जैसा है, जो अंततः उन्हें अपने अंग्रेजी बोलने वाले समकक्षों की तरह जीनियस बनने का समान अवसर दे रहा है। और सबसे अच्छी बात? उन्होंने पुस्तकालय, रोबोट और ब्लूप्रिंट सभी के उपयोग के लिए जारी कर दिए हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।