Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages
تقدم هذه الورقة "Chitrakshara"، وهي سلسلة من مجموعات البيانات الضخمة متعددة اللغات ومتعددة الوسائط التي تتكون من بيانات وصور ونصوص متداخلة وأزواج من الصور والتعليقات لـ 11 لغة هندية، والمصممة لمعالجة نقص التمثيل في نماذج الرؤية واللغة وتمكين تطوير أنظمة ذكاء اصطناعي أكثر شمولاً من الناحية الثقافية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيف يفهم العالم. في الوقت الحالي، معظم الروبوتات تشبه الطلاب الذين قرأوا فقط كتباً مكتوبة باللغة الإنجليزية وشاهدوا فقط صوراً من المجلات الغربية. إنهم أذكياء، لكنهم لا يفهمون حقاً الثقافة، أو العامية، أو الحياة اليومية للناس في الهند، حيث يتحدث أكثر من مليار شخص عشرات اللغات المختلفة.
يقدم هذا البحث Chitrakshara (والذي يترجم تقريباً إلى "الصورة والنص" باللغة السنسكريتية)، وهو "كتاب مدرسي" ضخم جديد صُمم خصيصاً لتعليم الذكاء الاصطناعي عن الهند.
إليك قصة كيفية بنائهم له، مشروحة ببساطة:
1. المشكلة: الروبوت "المكتفي بالإنجليزية فقط"
فكر في نماذج الذكاء الاصطناعي الحالية كطهاة يعرفون فقط كيفية الطبخ باستخدام مكونات من سوبر ماركت واحد محدد. يمكنهم صنع برجر رائع على الطريقة الإنجليزية، ولكن إذا طلبت منهم طهي "برياني" حار أو "ميسور باك" حلو، فسيكونون تائهين لأنهم لم يروا تلك المكونات من قبل.
معظم بيانات تدريب الذكاء الاصطناعي هي باللغة الإنجليزية. وحتى عندما يحاول الباحثون إضافة لغات أخرى، فإنهم غالباً ما يقومون فقط بترجمة المقالات الإنجليزية. هذا يشبه إعطاء روبوت وصفة للبرجر وتسميتها "برياني". سيتعلم الروبوت الكلمات، لكنه سيفتقد "النكهة" و"الثقافة".
2. الحل: مكتبة رقمية ضخمة
قام الفريق في Krutium AI بإنشاء مكتبة رقمية عملاقة تسمى Chitrakshara. بدلاً من النصوص فقط، فإن هذه المكتبة "متعددة الوسائط" (multimodal)، مما يعني أنها تحتوي على كلمات وصور مختلطة معاً، تماماً مثل جريدة حقيقية أو تدوينة.
لقد أنشأوا "كتابين" رئيسيين من هذه المكتبة:
- Chitrakshara-IL (كتاب القصص): هذا عبارة عن مجموعة ضخمة من 50 مليون صفحة ويب. تخيل فتح صفحة ورؤية فقرة نصية، ثم صورة، ثم فقرة أخرى، ثم رسماً بيانياً. هذه هي الطريقة التي يقرأ بها البشر فعلياً. وهي تغطي 11 لغة هندية رئيسية (مثل الهندية، والتاميلية، والبنغالية، إلخ).
- Chitrakshara-Cap (البطاقات التعليمية): هذه مجموعة من 44 مليون زوج من (الصورة والوصف). فكر في الأمر كبطاقة تعليمية ترى فيها صورة بقرة ونص يقول "بقرة ترعى في حقل". هذا يساعد الذكاء الاصطناعي على تعلم كيفية وصف ما يراه.
3. الوصفة: كيف صنعوه
لم يكن جمع هذه البيانات مجرد عملية نسخ ولصق بسيطة. الإنترنت فوضوي، مثل علية ضخمة مليئة بالصناديق القديمة، والألعاب المكسورة، والأوراق العشوائية. كان على الفريق تنظيفها.
- رحلة البحث عن الكنز: قاموا بالبحث في "Common Crawl" (أرشيف ضخم للإنترنت بأكرة) وبحثوا عن 230 مليون رابط ويب.
- المصفاة (المنخل): بنوا مصفاة متطورة لفصل الذهب عن التراب.
- فلتر "النفايات": تخلصوا من الإعلانات، ونوافذ "اشترك في نشرتنا الإخبارية" المنبثقة، والروابط المعطلة.
- فلتر "الجودة": تحققوا مما إذا كانت الصور ضبابية أو إذا كان النص مجرد كلام غير مفهوم.
- فلتر "الأمان": تأكدوا من إزالة أي شيء غير لائق أو مسيء، لضمان أن يتعلم الذكاء الاصطناعي من محتوى آمن ومفيد.
- التجميع: بمجرد تنظيف البيانات، قاموا بإعادة دمج النصوص والصور معاً بالترتيب الذي ظهرت به في مواقع الويب الأصلية. هذا أمر بالغ الأهمية لأنه يعلم الذكاء الاصطناست أن صورة معبد عادة ما تأتي مع قصة عن مهرجان، وليس مجرد وصف عشوائي.
4. لماذا هذا مهم: منح الذكاء الاصطناعي "روحاً ثقافية"
قبل هذا، إذا سألت ذكاءً اصطناعياً باللغة الهندية عن مهرجان محلي، فقد يعطيك إجابة عامة ومترجمة. مع Chitrakshara، يكون لدى الذكاء الاصطناعي قد "قرأ" ملايين القصص الهندية الحقيقية ورأى ملايين الصور الهندية الحقيقية.
- يفهم السياق: يعرف أن صورة احتفال "ديوالي" ليست مجرد "أضواء"؛ بل تتعلق بالعائلة، والحلويات، والأجواء الثقافية المحددة.
- يتحدث اللغة: يتعلم الفروق الدقيقة لـ 11 لغة مختلفة، وليس الإنجليزية فقط.
- شامل: يساعد في بناء ذكاء اصطناعي يعمل لصالح "المليار التالي" من الناس، وليس فقط للنخبة التقنية في الغرب.
الخلاصة
فكر في Chitrakshara كجسر. على أحد الجانبين، يوجد الإنترنت الهندي الخام والفوضوي. وعلى الجانب الآخر، يوجد مستقبل الذكاء الاصطناعي. هذه المجموعة من البيانات هي الجسر الذي يسم يسمح للذكاء الاصطناعي أخيراً بالعبور، وفهم الثقافة الهندية بعمق، والتحدث إلى الناس بلغاتهم الخاصة بفهم حقيقي، بدلاً من مجرد ترجمة الكلمات.
إنها قفزة هائلة نحو جعل الذكاء الاصطناعي يبدو أقل شبهاً بروبوت أجنبي وأكثر شبهاً بجار متعاون يعرف حقاً مجتمعك.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.