← नवीनतम पेपर
💬 NLP

Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages

यह शोध पत्र चित्रक्षर (Chitrakshara) को प्रस्तुत करता है, जो 11 भारतीय भाषाओं के लिए इंटरलीव्ड इमेज-टेक्स्ट डेटा और इमेज-कैप्शन पेयर्स से युक्त एक बड़े पैमाने का बहुभाषी बहुविध (multimodal) डेटासेट श्रृंखला है, जिसे विजन-लैंग्वेज मॉडल्स में प्रतिनिधित्व की कमी को दूर करने और अधिक सांस्कृतिक रूप से समावेशी एआई प्रणालियों के विकास को सक्षम करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Shaharukh Khan, Ali Faraz, Abhinav Ravi, Mohd Nauman, Mohd Sarfraz, Akshat Patidar, Raja Kolla, Chandra Khatri, Shubham Agarwal

प्रकाशित 2026-03-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shaharukh Khan, Ali Faraz, Abhinav Ravi, Mohd Nauman, Mohd Sarfraz, Akshat Patidar, Raja Kolla, Chandra Khatri, Shubham Agarwal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। अभी, अधिकांश रोबोट उन छात्रों की तरह हैं जिन्होंने केवल अंग्रेजी में लिखी गई किताबें पढ़ी हैं और पश्चिमी पत्रिकाओं से तस्वीरें देखी हैं। वे बुद्धिमान तो हैं, लेकिन वे भारत के संस्कृति, बोलचाल की भाषा या दैनिक जीवन को वास्तव में नहीं समझते, जहाँ अरबों लोग दर्जनों अलग-अलग भाषाएँ बोलते हैं।

यह शोध पत्र चित्रक्षर (जिसका अर्थ संस्कृत में मोटे तौर पर "छवि-पाठ" है) पेश करता है, जो विशेष रूप से AI को भारत के बारे में सिखाने के लिए डिज़ाइन की गई एक विशाल नई "पाठ्यपुस्तक" है।

यहाँ उनकी कहानी है कि उन्होंने इसे कैसे बनाया, जिसे सरल भाषा में समझाया गया है:

1. समस्या: "केवल अंग्रेजी" वाला रोबोट

वर्तमान AI मॉडलों को उन शेफ की तरह समझें जो केवल एक विशिष्ट सुपरमार्केट से सामग्री बनाना जानते हैं। वे एक बेहतरीन अंग्रेजी-शैली का बर्गर बना सकते हैं, लेकिन यदि आप उनसे एक मसालेदार बिरयानी या एक मीठा Mysore Pak बनाने के लिए कहें, तो वे अनभिज्ञ होंगे क्योंकि उन्होंने पहले कभी उन सामग्रियों को नहीं देखा है।

अधिकांश AI प्रशिक्षण डेटा अंग्रेजी में है। यहाँ तक कि जब शोधकर्ता अन्य भाषाओं को जोड़ने का प्रयास करते हैं, तो वे अक्सर अंग्रेजी लेखों का अनुवाद ही करते हैं। यह एक रोबोट को बर्गर की रेसिपी देने जैसा है लेकिन उसे "बिरयानी" कहना। रोबोट शब्द तो सीख जाता है, लेकिन वह उसके स्वाद और संस्कृति को मिस कर देता है।

2. समाधान: एक विशाल डिजिटल लाइब्रेरी

Krutum AI की टीम ने जाकर चित्रक्षर नामक एक विशाल डिजिटल लाइब्रेरी बनाई। केवल टेक्स्ट के बजाय, यह लाइब्रेरी मल्टीमॉडल (multimodal) है, जिसका अर्थ है कि इसमें शब्द और चित्र दोनों आपस में मिले हुए हैं, ठीक वैसे ही जैसे एक वास्तविक समाचार पत्र या ब्लॉग पोस्ट होता है।

उन्होंने इस लाइब्रेरी से दो मुख्य "किताबें" बनाईं:

  • चित्रक्षर-IL (कहानी की किताब): यह 50 मिलियन वेब पेजों का एक विशाल संग्रह है। कल्पना कीजिए कि आप एक पेज खोलते हैं और एक पैराग्राफ देखते हैं, फिर एक चित्र, फिर एक और पैराग्राफ, फिर एक चार्ट। इंसान वास्तव में इसी तरह पढ़ते हैं। यह 11 प्रमुख भारतीय भाषाओं (जैसे हिंदी, तमिल, बंगाली, आदि) को कवर करता है।
  • चित्रक्षर-Cap (फ्लैशकार्ड्स): यह 44 मिलियन चित्र-और-विवरण के जोड़ों का एक सेट है। इसे फ्लैशकार्ड की तरह समझें जहाँ आप गाय का चित्र देखते हैं और टेक्स्ट कहता है "एक खेत में चरती हुई गाय।" यह AI को यह सीखने में मदद करता है कि वह जो देखता है उसका वर्णन कैसे करे।

3. रेसिपी: उन्होंने इसे कैसे बनाया

डेटा इकट्ठा करना केवल कॉपी और पेस्ट करने जितना सरल नहीं था। इंटरनेट अव्यवस्थित है, जैसे कि पुरानी चीजों, टूटे हुए खिलौनों और रैंडम कागजों से भरी एक विशाल अटारी। टीम को इसे साफ करना था।

  • खोज अभियान (The Scavenger Hunt): वे "कॉमन क्रॉल" (पूरे इंटरनेट का एक विशाल संग्रह) में गए और 230 मिलियन वेब लिंक की तलाश की।
  • फ़िल्टर (छलनी): उन्होंने कचरे से सोना अलग करने के लिए एक परिष्कृत छलनी बनाई।
    • द "कचरा" फ़िल्टर: उन्होंने विज्ञापन, "हमारे न्यूज़लेटर को सब्सक्राइब करें" वाले पॉप-अप और टूटे हुए लिंक को हटा दिया।
    • द "गुणवत्ता" फ़िल्टर: उन्होंने जाँच की कि क्या चित्र धुंधले थे या क्या टेक्स्ट केवल निरर्थक (gibberish) था।
    • द "सुरक्षा" फ़िल्टर: उन्होंने सुनिश्चित किया कि वे किसी भी अनुपयुक्त या आपत्तिजनक चीज़ को हटा दें, जिससे यह सुनिश्चित हो सके कि AI सुरक्षित और उपयोगी सामग्री से सीख रहा है।
  • असेंबली: एक बार साफ होने के बाद, उन्होंने टेक्स्ट और छवियों को उसी क्रम में वापस जोड़ दिया जिस क्रम में वे मूल वेबसाइटों पर दिखाई देते थे। यह महत्वपूर्ण है क्योंकि यह AI को सिखाता है कि एक मंदिर की तस्वीर आमतौर पर एक त्योहार की कहानी के साथ आती है, न कि केवल एक रैंडम कैप्शन के साथ।

4. यह क्यों महत्वपूर्ण है: AI को एक "सांस्कृतिक आत्मा" देना

इससे पहले, यदि आप किसी AI से हिंदी में किसी स्थानीय त्योहार को समझाने के लिए कहते, तो वह एक सामान्य, अनुवादित उत्तर दे सकता था। चित्रक्षर के साथ, AI ने लाखों वास्तविक भारतीय कहानियाँ "पढ़ी" हैं और लाखों वास्तविक भारतीय तस्वीरें देखी हैं।

  • यह संदर्भ (Context) को समझता है: यह जानता है कि "दिवाली" के उत्सव की तस्वीर केवल "रोशनी" नहीं है; यह परिवार, मिठाइयों और विशिष्ट सांस्कृतिक माहौल के बारे में है।
  • यह भाषा बोलता है: यह 11 अलग-अलग भाषाओं की बारीकियों को सीखता है, न कि केवल अंग्रेजी।
  • यह समावेशी है: यह ऐसा AI बनाने में मदद करता है जो "अगली एक अरब" आबादी के लिए काम करता है, न कि केवल पश्चिम के तकनीकी-कुशल लोगों के लिए।

निचोड़

चित्रक्षर को एक पुल की तरह समझें। एक तरफ भारत का कच्चा, अराजक इंटरनेट है। दूसरी तरफ आर्टिफिशियल इंटेलिजेंस का भविष्य है। यह डेटासेट वह पुल है जो AI को अंततः पार करने, भारतीय संस्कृति को गहराई से समझने और वास्तविक समझ के साथ अपनी भाषाओं में लोगों से बात करने की अनुमति देता है, न कि केवल शब्दों का अनुवाद करने की।

यह एक ऐसे AI को बनाने की दिशा में एक बड़ी छलांग है जो एक विदेशी रोबोट के बजाय एक मददगार पड़ोसी की तरह महसूस होता है जो वास्तव में आपके समुदाय को जानता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →