← नवीनतम पेपर
💻 computer science

Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models

यह शोध पत्र Jagle को प्रस्तुत करता है, जो अब तक का सबसे बड़ा जापानी मल्टीमॉडल पोस्ट-ट्रेनिंग डेटासेट है जिसमें विविध स्रोतों से उत्पन्न 9.2 मिलियन इंस्टेंस शामिल हैं, जो जापानी विजन-लैंग्वेज मॉडल्स की क्षमताओं को बढ़ाते हुए उनकी अंग्रेजी क्षमताओं को बनाए रखता है या उनमें सुधार करता है।

मूल लेखक: Issa Sugiura, Keito Sasagawa, Keisuke Nakao, Koki Maeda, Ziqi Yin, Zhishen Yang, Shuhei Kurita, Yusuke Oda, Ryoko Tokuhisa, Daisuke Kawahara, Naoaki Okazaki

प्रकाशित 2026-04-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Issa Sugiura, Keito Sasagawa, Keisuke Nakao, Koki Maeda, Ziqi Yin, Zhishen Yang, Shuhei Kurita, Yusuke Oda, Ryoko Tokuhisa, Daisuke Kawahara, Naoaki Okazaki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। आप उसे आँखें (एक कैमरा) और एक दिमाग (एक लैंग्वेज मॉडल) देते हैं। इस रोबोट को स्मार्ट बनाने के लिए, आपको उसे लाखों तस्वीरें दिखानी होंगी और उनमें क्या है, इसके बारे में कहानियाँ बतानी होंगी। इसी तरह "विज़न-लैंग्वेज मॉडल्स" (VLMs) को प्रशिक्षित किया जाता है।

लंबे समय से, वैज्ञानिकों के पास इन चित्र-कहानियों का एक विशाल पुस्तकालय अंग्रेजी में उपलब्ध था। वे एक सुपर-स्मार्ट अंग्रेजी रोबोट बनाने के लिए मौजूदा हजारों किताबों को आपस में मिला और जोड़ सकते थे।

लेकिन जापानी के लिए, यह पुस्तकालय लगभग खाली था। वहाँ पर्याप्त किताबें नहीं थीं, और जो मौजूद थीं वे बहुत छोटी थीं या केवल सरल विषयों को कवर करती थीं। आप अंग्रेजी की किताबों का अनुवाद सीधे नहीं कर सकते थे क्योंकि उनमें अंग्रेजी टेक्स्ट (जैसे साइन या चार्ट) होते थे, जो एक जापानी रोबोट को भ्रमित कर सकते थे।

पेश है "Jagle"।

Jagle को उस खाली जापानी पुस्तकालय को भरने के लिए बनाई गई एक विशाल, कस्टम-निर्मित निर्माण परियोजना के रूप में समझें। यहाँ लेखक बताते हैं कि उन्होंने इसे कैसे बनाया, कुछ सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "खाली शेल्फ"

अधिकांश शोधकर्ता मौजूदा "प्रश्न और उत्तर" वाली किताबें इकट्ठा करके डेटासेट बनाते हैं। अंग्रेजी में, ऐसी लाखों किताबें हैं। जापानी में, शेल्फ खाली हैं। इतने कम डेटा के साथ एक स्मार्ट जापानी रोबोट बनाने की कोशिश करना ऐसा ही है जैसे किसी बच्चे को केवल एक कॉमिक बुक का उपयोग करके पढ़ना सिखाना।

2. समाधान: शून्य से निर्माण

मौजूदा किताबें खोजने के बजाय, Jagle टीम ने किताबों को खुद बनाने का निर्णय लिया। उन्होंने हर जगह से कच्चा माल इकट्ठा किया:

  • जापान में ली गई तस्वीरें: रोज़मर्रा की ज़िंदगी के एक डिजिटल फोटो एल्बम की तरह।
  • PDF और दस्तावेज़: स्कैन किए गए सरकारी कागजात, पाठ्यपुस्तकें और रिपोर्ट।
  • वेब पेज: इंटरनेट से अरबों इमेज-टेक्स्ट जोड़े।

उन्होंने केवल कॉपी-पेस्ट नहीं किया; उन्होंने इन कच्चे माल को सीखने के अभ्यासों में बदलने के लिए एक "फैक्ट्री" दृष्टिकोण का उपयोग किया।

3. फैक्ट्री: प्रश्न बनाने के चार तरीके

टीम ने कच्चे डेटा को प्रशिक्षण प्रश्नों में बदलने के लिए चार अलग-अलग "मशीनों" का उपयोग किया:

  • AI इंटरव्यूअर (VLM-आधारित जनरेशन): उन्होंने एक सुपर-स्मार्ट AI (Qwen3-VL) का उपयोग किया जो एक तस्वीर को देखता है और पूछता है, "यहाँ क्या हो रहा है?" और फिर उसका उत्तर देता है। यह एक रोबोट टूर गाइड की तरह है जो पुलिस स्टेशन की फोटो देखता है और कहता है, "यह गुन्मा प्रिफेक्चरल पुलिस मुख्यालय है।"
  • अनुवादक (The Translator): उन्होंने मौजूदा अंग्रेजी चार्ट और ग्राफ लिए, इमेज के अंदर के टेक्स्ट और प्रश्नों को जापानी में अनुवादित किया, यह सुनिश्चित करते हुए कि चित्र और शब्द पूरी तरह से मेल खाते हों।
  • प्रिंटर (टेक्स्ट रेंडरिंग): उन कार्यों के लिए जहाँ रोबोट को इमेज से टेक्स्ट पढ़ने की आवश्यकता होती है (जैसे साइन पढ़ना), उन्होंने टेक्स्ट लिया, उसे एक खाली इमेज पर प्रिंट किया, और रोबमा को उसे वापस पढ़ने के लिए कहा।
  • स्कैनर (OCR): उन्होंने अव्यवस्थित दस्तावेजों से टेक्स्ट निकालने और उस टेक्स्ट के आधार पर प्रश्न बनाने के लिए विशेष उपकरणों का उपयोग किया।

4. परिणाम: एक विशाल पुस्तकालय

इसका परिणाम है Jagle, एक डेटासेट जिसमें 9.2 मिलियन उदाहरण हैं।

  • यह 5 प्रकार की सोच को कवर करता है: सामान्य प्रश्न (इस फोटो में क्या है?), चार्ट पढ़ना, विवरण लिखना, इमेज से टेक्स्ट पढ़ना और सरल टेक्स्ट एक्सट्रैक्शन।
  • यह अपने प्रकार का अब तक का सबसे बड़ा जापानी डेटासेट है।

5. परीक्षण: क्या यह काम करता है?

शोधकर्ताओं ने इस नए पुस्तकालय का उपयोग करके एक छोटे रोबोट मस्तिष्क (2.2 बिलियन पैरामीटर्स) को प्रशिक्षित किया।

  • जापानी कौशल: रोबोट जापानी कार्यों में अविश्वसनीय रूप से स्मार्ट हो गया। उसने पिछले सर्वश्रेष्ठ जापानी रोबोट (InternVL3.5) को पछाड़ दिया और दुनिया के सर्वश्रेष्ठ बहुभाषी रोबोट (Qwen3-VL) के बहुत करीब पहुँच गया।
  • अंग्रेजी कौशल: यहाँ जादू है। आमतौर पर, जब आप एक रोबोट को एक नई भाषा सिखाते हैं, तो वह अपनी पुरानी भाषा में कमजोर हो जाता है (जैसे एक छात्र जो फ्रेंच पर इतना ध्यान केंद्रित करता है कि वह अपनी अंग्रेजी भूल जाता है)। लेकिन Jagle के साथ, रोबोट अंग्रेजी में भी बेहतर हो गया!
    • क्यों? लेखकों का मानना है कि विविध जापानी डेटा जोड़ने से, रोबोट अधिक लचीला और रचनात्मक बनना सीख गया, जिसने वास्तव में उसे अंग्रेजी समस्याओं को पहले की तुलना में बेहतर ढंग से हल करने में मदद की।

बड़ी तस्वीर

यह पेपर दिखाता है कि आपको किसी दूसरे के द्वारा आपकी भाषा के लिए पुस्तकालय बनाने का इंतज़ार करने की ज़रूरत नहीं है। यदि आपके पास सही उपकरण और एक रचनात्मक पाइपलाइन है, तो आप शून्य से एक विशाल, उच्च-गुणवत्ता वाला प्रशिक्षण डेटासेट बना सकते हैं।

Jagle एक जापानी छात्र को चित्रों और कहानियों का एक नया, 9-मिलियन-पेज का विश्वकोश देने जैसा है, जो अंततः उन्हें अपने अंग्रेजी बोलने वाले समकक्षों की तरह जीनियस बनने का समान अवसर दे रहा है। और सबसे अच्छी बात? उन्होंने पुस्तकालय, रोबोट और ब्लूप्रिंट सभी के उपयोग के लिए जारी कर दिए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →