← Últimos artículos
💬 NLP

Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages

Este artículo presenta Chitrakshara, una serie de conjuntos de datos multilingües y multimodales a gran escala que cubre 11 idiomas indios mediante la recopilación y curación de datos de Common Crawl, con el objetivo de mejorar la representación de estas lenguas en los modelos de visión y lenguaje.

Autores originales: Shaharukh Khan, Ali Faraz, Abhinav Ravi, Mohd Nauman, Mohd Sarfraz, Akshat Patidar, Raja Kolla, Chandra Khatri, Shubham Agarwal

Publicado 2026-03-26
📖 4 min de lectura☕ Lectura para el café

Autores originales: Shaharukh Khan, Ali Faraz, Abhinav Ravi, Mohd Nauman, Mohd Sarfraz, Akshat Patidar, Raja Kolla, Chandra Khatri, Shubham Agarwal

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que la Inteligencia Artificial (IA) es como un niño prodigio que quiere aprender a ver el mundo y entenderlo. Hasta ahora, la mayoría de estos "niños" solo han estudiado en escuelas donde todo está en inglés y con fotos de occidente. Si le preguntas sobre la cultura india, sus festivales o sus noticias locales, el niño se queda confundido porque nunca ha visto esos ejemplos.

El artículo que presentas, "Chitrakshara", es como la construcción de una nueva biblioteca gigante y multicultural específicamente diseñada para enseñar a estas IAs sobre la India y sus 11 idiomas principales.

Aquí te explico cómo funciona, usando analogías sencillas:

1. ¿Qué es "Chitrakshara"?

La palabra viene de dos raíces: "Chitra" (imagen) y "Akshara" (texto).
Imagina que la IA actual es como alguien que solo lee libros de texto sin ilustraciones. Chitrakshara es un libro de cuentos ilustrado gigante donde las imágenes y las palabras están mezcladas en el orden natural en que las leemos (no primero todas las fotos y luego todos los textos).

El proyecto crea dos tipos de "libros":

  • Chitrakshara-IL (El Gran Libro de Lectura): Contiene 50 millones de documentos (como páginas web enteras) con 193 millones de imágenes y 30 mil millones de palabras. Es como tener una enciclopedia infinita donde las fotos y los textos están entrelazados, tal como aparecen en internet real.
  • Chitrakshara-Cap (El Álbum de Fotos con Descripciones): Contiene 44 millones de pares de "foto + descripción". Es como un álbum de fotos donde cada imagen tiene una etiqueta explicativa en su idioma nativo.

2. ¿Cómo lo hicieron? (El proceso de "Cosecha")

Piensa en internet como un océano gigante lleno de información. La mayoría de los barcos (los datos actuales) solo pescan en la zona de habla inglesa. Los creadores de Chitrakshara querían pescar en las aguas de los idiomas indios (Hindi, Bengali, Tamil, etc.), que estaban casi vacías.

Su proceso fue como una gran operación de limpieza y selección:

  1. El Gran Cernido (Recopilación): Bajaron 95 "cubos" de datos de internet (Common Crawl) que abarcan 10 años. Era como recoger arena de la playa para encontrar conchas.
  2. El Filtro de Calidad (Limpieza): Internet está lleno de "basura": anuncios, menús de navegación, botones de "suscríbete" y textos repetidos. Usaron un tamiz inteligente (un algoritmo) para quitar todo eso, dejando solo el contenido real: la historia, la noticia y la foto importante.
    • Analogía: Es como si tuvieras un plato de arroz con piedras y hojas secas, y usaran un colador especial para dejar solo el arroz limpio y listo para cocinar.
  3. La Selección de Idiomas: Aseguraron de que el arroz fuera de los 11 sabores (idiomas) indios deseados, eliminando todo lo que no fuera relevante o estuviera en inglés.
  4. El Empaquetado: Finalmente, organizaron todo para que la IA pueda "comer" la información en el orden correcto: ver una foto, leer el título, ver otra foto, leer el párrafo siguiente, etc.

3. ¿Por qué es tan importante? (El "Por qué")

Antes de este proyecto, las IAs eran como turistas que solo hablan inglés viajando por la India. Podían ver los monumentos, pero no entendían las señales, las conversaciones locales ni la cultura profunda.

  • Diversidad Cultural: Al entrenar con Chitrakshara, la IA aprende que una "foto de un festival" en India no es igual a una en Nueva York. Aprende los matices, los colores y las palabras específicas.
  • Mejor Razonamiento: Al usar datos "entrelazados" (texto e imagen mezclados), la IA aprende a razonar mejor. Es la diferencia entre memorizar un diccionario y leer una novela completa con ilustraciones; entiendes el contexto.
  • Inclusión: Ahora, personas que hablan Tamil, Marathi o Gujarati podrán usar asistentes de IA que realmente los entiendan, en lugar de tener que traducir todo al inglés primero.

4. El Resultado

El equipo ha creado un superalimento para la Inteligencia Artificial.

  • Datos: 193 millones de imágenes, 30 mil millones de palabras.
  • Idiomas: 11 lenguas indias principales.
  • Objetivo: Crear "Vision-Language Models" (VLMs) que sean inclusivos, capaces de entender la realidad de miles de millones de personas que antes eran ignoradas por la tecnología.

En resumen: Chitrakshara es el puente que conecta la inteligencia artificial con la rica y diversa realidad de la India, asegurando que la tecnología del futuro no solo hable inglés, sino que también entienda y respete las voces de cientos de millones de personas más.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →