WAON: Large-Scale Japanese Image-Text Pair Dataset for Improving Model Performance on Japanese Cultural Tasks
यह शोध पत्र WAON को प्रस्तुत करता है, जो लगभग 155 मिलियन उदाहरणों वाला एक बड़े पैमाने का जापानी इमेज-टेक्स्ट डेटासेट है, साथ ही एक क्यूरेटेड बेंचमार्क (WAON-Bench) भी है, जो उच्च गुणवत्ता वाले जापानी सांस्कृतिक डेटा की कमी को दूर करने के लिए है और यह प्रदर्शित करता है कि इस डेटासेट पर फाइन-ट्यूनिंग करने से जापानी सांस्कृतिक कार्यों पर विजन-लैंग्वेज मॉडल के प्रदर्शन में काफी सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बुद्धिमान, दुनिया घूमने वाले छात्र को जापानी संस्कृति समझना सिखाने की कोशिश कर रहे हैं। यह छात्र पहले से ही लाखों किताबें पढ़ चुका है और दुनिया भर की अरबों तस्वीरें देख चुका है (एक विशाल डेटासेट जिसे SigLIP कहा जाता है)। वह बुद्धिमान है, लेकिन वह अभी तक जापान की बारीकियों को पूरी तरह से "समझ" नहीं पाया है। वह जानता होगा कि "मंदिर" क्या होता है, लेकिन वह किसी विशिष्ट जापानी उत्सव को एक सामान्य पार्टी समझ सकता है, या किसी स्थानीय व्यंजन को एक साधारण सैंडविच समझ सकता है।
इसे ठीक करने के लिए, आपको उसे एक विशेष पाठ्यपुस्तक देनी होगी जो जापानी तस्वीरों और जापानी विवरणों से भरी हो।
यह शोध पत्र WAON पेश करता है, जो बिल्कुल वही पाठ्यपुस्तक है। यहाँ इसका सरल विवरण दिया गया है:
1. समस्या: "अनुवाद में खो जाने" का अंतर (The "Lost in Translation" Gap)
वर्तमान में, यदि आप AI को जापान के बारे में सिखाना चाहते हैं, तो आपके पास दो बुरे विकल्प हैं:
- विकल्प A: एक छोटी, पुरानी लाइब्रेरी (मौजूदा छोटे डेटासेट) का उपयोग करें। यह AI को ठीक से सिखाने के लिए पर्याप्त नहीं है।
- विकल्प B: अंग्रेजी चित्रों के एक विशाल पुस्तकालय को लें और उन पर जापानी कैप्शन लिखने के लिए एक रोबोट अनुवादक का उपयोग करें। समस्या यह है कि रोबोट अनुवादक अक्सर गलतियाँ करता है, और चित्र स्वयं अभी भी मुख्य रूप से पश्चिमी होते हैं। यह किसी को न्यूयॉर्क की तस्वीरें दिखाकर और उन पर जापानी लेबल चिपकाकर टोक्यो के बारे में सिखाने जैसा है।
2. समाधान: WAON (द "नेटिव स्पीकर" डेटासेट)
लेखकों ने WAON बनाया है (Web-scale image text Aligned Open Nihongo)।
- यह कहाँ से आया? उन्होंने कुछ भी अनुवाद नहीं किया। वे सीधे स्रोत पर गए: जापानी इंटरनेट (Common Crawl)।
- यह क्या है? यह 155 मिलियन छवियों और जापानी टेक्स्ट के जोड़ों का एक विशाल संग्रह है।
- उन्होंने इसे कैसे साफ किया? कल्पना कीजिए कि सोने को खोजने के लिए रेत के एक विशाल ढेर को छानना। उन्होंने एक बहु-चरणीय फ़िल्टर का उपयोग किया:
- उन्होंने टूटे हुए लिंक और खाली पेजों को हटा दिया।
- उन्होंने डुप्लिकेट फोटो को डिलीट कर दिया (जैसे कि 1,000 अलग-अलग वेबसाइटों पर एक ही लोगो का दिखाई देना)।
- उन्होंने यह जांचने के लिए एक "स्मार्ट आँख" (एक AI मॉडल) का उपयोग किया कि क्या चित्र वास्तव में जापानी टेक्स्ट से मेल खाता है। यदि टेक्स्ट "सुशी" कहता था लेकिन चित्र एक "कार" का था, तो उन्होंने उसे हटा दिया।
- उन्होंने खराब या असुरक्षित सामग्री को फ़िल्टर किया।
परिणाम एक "शुद्ध" डेटासेट है जहाँ चित्र और टेक्स्ट स्वाभाविक रूप से जापानी हैं, ठीक वैसे ही जैसे एक मूल वक्ता (native speaker) उन्हें बनाएगा।
3. परीक्षण: WAON-Bench (द "फाइनल एग्जाम")
आप सिर्फ यह नहीं कह सकते, "हमने एक बेहतरीन पाठ्यपुस्तक बनाई है!" आपको यह साबित करना होगा कि छात्र ने सीखा है।
- पुराखा परीक्षा: एक मौजूदा परीक्षण था जिसे "Recruit" कहा जाता था, लेकिन वह त्रुटिपूर्ण था। इसमें भोजन के बारे में बहुत अधिक प्रश्न थे और अन्य चीजों के बारे में बहुत कम। साथ ही, कुछ चित्र उत्तरों से मेल नहीं खाते थे (जैसे कि एक रैंडम महिला की तस्वीर जिसे "कियामिज़ु मंदिर" लेबल किया गया था)।
- नया एग्जाम (WAON-Bench): लेखकों ने एक बिल्कुल नया, निष्पक्ष परीक्षण बनाया।
- उन्होंने 374 श्रेणियां बनाईं (जानवरों से लेकर त्योहारों और इमारतों तक)।
- उन्होंने हर एक छवि को मैन्युअल रूप से चेक किया ताकि यह सुनिश्चित हो सके कि वह वास्तव में लेबल से मेल खाती है।
- यह एक अव्यवस्थित, पक्षपाती क्विज़ को एक पूरी तरह से क्यूरेटेड, व्यापक फाइनल एग्जाम से बदलने जैसा है।
4. परिणाम: "ग्रेजुएशन"
उन्होंने बुद्धिमान दुनिया घूमने वाले छात्र (बेस AI मॉडल) को लिया और उसे नए WAON पाठ्यपुस्तक का क्रैश कोर्स दिया।
- परिणाम: छात्र ने जापानी सांस्कृतिक परीक्षण में महारत हासिल कर ली। उसने मौजूदा जापानी डेटा पर प्रशिक्षित होने वाले किसी भी अन्य मॉडल की तुलना में उच्च स्कोर किया।
- आश्चर्य: भले ही उनका ध्यान जापान पर केंद्रित था, छात्र दुनिया के बाकी हिस्सों को नहीं भूला। वे वैश्विक चीजों को समझने में वास्तव में बेहतर हो गए, जिससे यह साबित हुआ कि किसी विशिष्ट संस्कृति को गहराई से सीखने से आप दुनिया को बेहतर ढंग से समझते हैं।
बड़ी तस्वीर का रूपक (The Big Picture Analogy)
AI को एक शेफ के रूप में सोचें।
- पुराना तरीका: शेफ को वैश्विक व्यंजन बनाना आता है लेकिन वह अंग्रेजी कुक बुक्स पढ़कर जापानी भोजन सीखने की कोशिश करता है जिनका अनुवाद खराब तरीके से किया गया है। व्यंजन अजीब आते हैं।
- WAON तरीका: शेफ को जापानी दादी-नानी द्वारा ली गई प्रामाणिक जापानी रेसिपी और फोटो का एक विशाल, वास्तविक पुस्तकालय दिया जाता है।
- WAON-Bench: जापानी खाद्य समीक्षकों का एक पैनल व्यंजनों का स्वाद लेता है ताकि वे देख सकें कि वे कितने प्रामाणिक हैं।
- परिणाम: शेफ दुनिया का सबसे अच्छा जापानी रसोइया बन जाता है, बिना अपनी इतालवी या फ्रांसीसी खाना बनाने की क्षमता खोए।
संक्षेप में: लेखकों ने AI के लिए सबसे बड़ा, सबसे स्वच्छ, सबसे प्रामाणिक "जापानी दृश्य शब्दकोश" बनाया है, और सिद्ध किया है कि इसका उपयोग करने से AI पिछले किसी भी तरीके की तुलना में जापानी संस्कृति के बारे में बहुत अधिक स्मार्ट हो जाता है। वे इस शब्दकोश, परीक्षण और कोड को सभी के उपयोग के लिए साझा कर रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।