Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages
यह शोध पत्र चित्रक्षर (Chitrakshara) को प्रस्तुत करता है, जो 11 भारतीय भाषाओं के लिए इंटरलीव्ड इमेज-टेक्स्ट डेटा और इमेज-कैप्शन पेयर्स से युक्त एक बड़े पैमाने का बहुभाषी बहुविध (multimodal) डेटासेट श्रृंखला है, जिसे विजन-लैंग्वेज मॉडल्स में प्रतिनिधित्व की कमी को दूर करने और अधिक सांस्कृतिक रूप से समावेशी एआई प्रणालियों के विकास को सक्षम करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। अभी, अधिकांश रोबोट उन छात्रों की तरह हैं जिन्होंने केवल अंग्रेजी में लिखी गई किताबें पढ़ी हैं और पश्चिमी पत्रिकाओं से तस्वीरें देखी हैं। वे बुद्धिमान तो हैं, लेकिन वे भारत के संस्कृति, बोलचाल की भाषा या दैनिक जीवन को वास्तव में नहीं समझते, जहाँ अरबों लोग दर्जनों अलग-अलग भाषाएँ बोलते हैं।
यह शोध पत्र चित्रक्षर (जिसका अर्थ संस्कृत में मोटे तौर पर "छवि-पाठ" है) पेश करता है, जो विशेष रूप से AI को भारत के बारे में सिखाने के लिए डिज़ाइन की गई एक विशाल नई "पाठ्यपुस्तक" है।
यहाँ उनकी कहानी है कि उन्होंने इसे कैसे बनाया, जिसे सरल भाषा में समझाया गया है:
1. समस्या: "केवल अंग्रेजी" वाला रोबोट
वर्तमान AI मॉडलों को उन शेफ की तरह समझें जो केवल एक विशिष्ट सुपरमार्केट से सामग्री बनाना जानते हैं। वे एक बेहतरीन अंग्रेजी-शैली का बर्गर बना सकते हैं, लेकिन यदि आप उनसे एक मसालेदार बिरयानी या एक मीठा Mysore Pak बनाने के लिए कहें, तो वे अनभिज्ञ होंगे क्योंकि उन्होंने पहले कभी उन सामग्रियों को नहीं देखा है।
अधिकांश AI प्रशिक्षण डेटा अंग्रेजी में है। यहाँ तक कि जब शोधकर्ता अन्य भाषाओं को जोड़ने का प्रयास करते हैं, तो वे अक्सर अंग्रेजी लेखों का अनुवाद ही करते हैं। यह एक रोबोट को बर्गर की रेसिपी देने जैसा है लेकिन उसे "बिरयानी" कहना। रोबोट शब्द तो सीख जाता है, लेकिन वह उसके स्वाद और संस्कृति को मिस कर देता है।
2. समाधान: एक विशाल डिजिटल लाइब्रेरी
Krutum AI की टीम ने जाकर चित्रक्षर नामक एक विशाल डिजिटल लाइब्रेरी बनाई। केवल टेक्स्ट के बजाय, यह लाइब्रेरी मल्टीमॉडल (multimodal) है, जिसका अर्थ है कि इसमें शब्द और चित्र दोनों आपस में मिले हुए हैं, ठीक वैसे ही जैसे एक वास्तविक समाचार पत्र या ब्लॉग पोस्ट होता है।
उन्होंने इस लाइब्रेरी से दो मुख्य "किताबें" बनाईं:
- चित्रक्षर-IL (कहानी की किताब): यह 50 मिलियन वेब पेजों का एक विशाल संग्रह है। कल्पना कीजिए कि आप एक पेज खोलते हैं और एक पैराग्राफ देखते हैं, फिर एक चित्र, फिर एक और पैराग्राफ, फिर एक चार्ट। इंसान वास्तव में इसी तरह पढ़ते हैं। यह 11 प्रमुख भारतीय भाषाओं (जैसे हिंदी, तमिल, बंगाली, आदि) को कवर करता है।
- चित्रक्षर-Cap (फ्लैशकार्ड्स): यह 44 मिलियन चित्र-और-विवरण के जोड़ों का एक सेट है। इसे फ्लैशकार्ड की तरह समझें जहाँ आप गाय का चित्र देखते हैं और टेक्स्ट कहता है "एक खेत में चरती हुई गाय।" यह AI को यह सीखने में मदद करता है कि वह जो देखता है उसका वर्णन कैसे करे।
3. रेसिपी: उन्होंने इसे कैसे बनाया
डेटा इकट्ठा करना केवल कॉपी और पेस्ट करने जितना सरल नहीं था। इंटरनेट अव्यवस्थित है, जैसे कि पुरानी चीजों, टूटे हुए खिलौनों और रैंडम कागजों से भरी एक विशाल अटारी। टीम को इसे साफ करना था।
- खोज अभियान (The Scavenger Hunt): वे "कॉमन क्रॉल" (पूरे इंटरनेट का एक विशाल संग्रह) में गए और 230 मिलियन वेब लिंक की तलाश की।
- फ़िल्टर (छलनी): उन्होंने कचरे से सोना अलग करने के लिए एक परिष्कृत छलनी बनाई।
- द "कचरा" फ़िल्टर: उन्होंने विज्ञापन, "हमारे न्यूज़लेटर को सब्सक्राइब करें" वाले पॉप-अप और टूटे हुए लिंक को हटा दिया।
- द "गुणवत्ता" फ़िल्टर: उन्होंने जाँच की कि क्या चित्र धुंधले थे या क्या टेक्स्ट केवल निरर्थक (gibberish) था।
- द "सुरक्षा" फ़िल्टर: उन्होंने सुनिश्चित किया कि वे किसी भी अनुपयुक्त या आपत्तिजनक चीज़ को हटा दें, जिससे यह सुनिश्चित हो सके कि AI सुरक्षित और उपयोगी सामग्री से सीख रहा है।
- असेंबली: एक बार साफ होने के बाद, उन्होंने टेक्स्ट और छवियों को उसी क्रम में वापस जोड़ दिया जिस क्रम में वे मूल वेबसाइटों पर दिखाई देते थे। यह महत्वपूर्ण है क्योंकि यह AI को सिखाता है कि एक मंदिर की तस्वीर आमतौर पर एक त्योहार की कहानी के साथ आती है, न कि केवल एक रैंडम कैप्शन के साथ।
4. यह क्यों महत्वपूर्ण है: AI को एक "सांस्कृतिक आत्मा" देना
इससे पहले, यदि आप किसी AI से हिंदी में किसी स्थानीय त्योहार को समझाने के लिए कहते, तो वह एक सामान्य, अनुवादित उत्तर दे सकता था। चित्रक्षर के साथ, AI ने लाखों वास्तविक भारतीय कहानियाँ "पढ़ी" हैं और लाखों वास्तविक भारतीय तस्वीरें देखी हैं।
- यह संदर्भ (Context) को समझता है: यह जानता है कि "दिवाली" के उत्सव की तस्वीर केवल "रोशनी" नहीं है; यह परिवार, मिठाइयों और विशिष्ट सांस्कृतिक माहौल के बारे में है।
- यह भाषा बोलता है: यह 11 अलग-अलग भाषाओं की बारीकियों को सीखता है, न कि केवल अंग्रेजी।
- यह समावेशी है: यह ऐसा AI बनाने में मदद करता है जो "अगली एक अरब" आबादी के लिए काम करता है, न कि केवल पश्चिम के तकनीकी-कुशल लोगों के लिए।
निचोड़
चित्रक्षर को एक पुल की तरह समझें। एक तरफ भारत का कच्चा, अराजक इंटरनेट है। दूसरी तरफ आर्टिफिशियल इंटेलिजेंस का भविष्य है। यह डेटासेट वह पुल है जो AI को अंततः पार करने, भारतीय संस्कृति को गहराई से समझने और वास्तविक समझ के साथ अपनी भाषाओं में लोगों से बात करने की अनुमति देता है, न कि केवल शब्दों का अनुवाद करने की।
यह एक ऐसे AI को बनाने की दिशा में एक बड़ी छलांग है जो एक विदेशी रोबोट के बजाय एक मददगार पड़ोसी की तरह महसूस होता है जो वास्तव में आपके समुदाय को जानता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।