← 最新の論文
💬 NLP

Chitrakshara: A Large Multilingual Multimodal Dataset for Indian languages

本論文は、英語中心の既存モデルの課題を克服し、11 のインド言語を網羅する大規模なマルチモーダルデータセット「Chitrakshara」シリーズ(193M 画像を含む事前学習用データと 44M 画像 - テキスト対を含むキャプションデータ)の構築と、その収集・処理パイプライン、および品質と多様性の分析を報告しています。

原著者: Shaharukh Khan, Ali Faraz, Abhinav Ravi, Mohd Nauman, Mohd Sarfraz, Akshat Patidar, Raja Kolla, Chandra Khatri, Shubham Agarwal

公開日 2026-03-26
📖 1 分で読めます☕ さくっと読める

原著者: Shaharukh Khan, Ali Faraz, Abhinav Ravi, Mohd Nauman, Mohd Sarfraz, Akshat Patidar, Raja Kolla, Chandra Khatri, Shubham Agarwal

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「インドの言語と文化を深く理解できる、新しい AI のための巨大な教科書」**を作ったというお話しです。

タイトルは**「Chitrakshara(チトラークシャラ)」
これはサンスクリット語で、「Chitra(絵・画像)」と「Akshara(文字・テキスト)」を合わせた言葉で、
「絵と文字が混ざり合った本」**という意味です。

以下に、難しい専門用語を使わず、身近な例え話を使って解説します。


1. なぜこの「教科書」が必要だったの?

これまでの AI(特に画像を見て言葉を話す AI)は、**「英語の教科書」**ばかりで勉強していました。

  • 現状の問題点: 英語の教科書はすごく厚くて素晴らしいのですが、インドの 11 の言語(ヒンディー語、ベンガル語、タミル語など)や、インド特有の文化、習慣、風景がほとんど載っていません。
  • 結果: AI は「英語の絵本」は読めますが、「インドの村の祭りの写真」を見せると「何だこれ?」と困惑したり、間違った説明をしてしまったりします。

そこで、**「インドの言語と文化に特化した、世界最大級の新しい教科書」**を作ろうというのが、このプロジェクトの目的です。

2. この「教科書」の中身はどんな感じ?

このプロジェクトでは、2 つの大きな「教科書」を作りました。

① 「Chitrakshara-IL」:物語の本(交差型データ)

  • どんなもの?
    普通の辞書のように「画像」と「説明文」が 1 対 1 で並んでいるのではなく、「新聞記事」や「ブログ」のように、文章の中に画像が挟まっている状態です。
  • 例え話:
    料理のレシピ本を想像してください。
    • 普通のデータ:「卵の画像」→「卵」という文字。
    • このデータ:「まず卵を割ります(画像)→次にフライパンに入れます(画像)→最後に塩を振ります」というように、文章の流れの中で画像が自然に混ざっている状態です。
  • 規模:
    • 画像:約 1 億 9300 万枚
    • 文字:約 300 億文字
    • 言語:ヒンディー語、ベンガル語、タミル語など 11 言語
    • 出所:インターネット上の膨大な情報(Common Crawl)から集めました。

② 「Chitrakshara-Cap」:写真集と解説(画像・キャプション対)

  • どんなもの?
    画像と、その画像の説明(キャプション)がセットになったデータです。
  • 例え話:
    美術館の展示カードのように、「この絵は〇〇です」という説明が添えられた写真集です。
  • 規模:
    • 画像と説明のセット:約 4400 万組

3. どのようにして作ったの?(お掃除と選別のプロセス)

インターネットからデータを集めるのは、**「巨大なゴミ捨て場から、最高級の宝石だけを集める」**ような作業です。

  1. 集める(採掘): 2013 年から 2023 年までの 10 年間のインターネットの記録(Common Crawl)から、インドの言語が使われている 2 億 3000 万件のページを掘り起こしました。
  2. 粗選別(ゴミ出し):
    • 広告や「続きを読む」ボタン、メニューバーなど、本題に関係ない「ノイズ」を徹底的に削除しました。
    • 画像が小さすぎるものや、ただの「プレースホルダー(枠だけ)」の画像は捨てました。
    • 不適切な画像(NSFW)が含まれるページは、そのページごと削除しました。
  3. 磨き上げ(整理):
    • 文章が短すぎるものや、意味の通じないものを除き、**「インドの文化や生活がリアルに反映された、質の高いページ」**だけを選び抜きました。
    • 最終的に、約 5000 万のドキュメントと 1 億 9300 万の画像が残りました。

4. この「教科書」がもたらす未来

このデータを使って AI を勉強させると、どんな良いことがあるのでしょうか?

  • 文化の理解: AI が「インドの結婚式」や「お祭り」の写真を見たとき、単なる「人々が集まっている」ではなく、「これは特定の宗教的な行事だ」と理解できるようになります。
  • 多様な言語: 英語だけでなく、インドの 11 の言語で、自然な会話ができるようになります。
  • 公平性: これまで「英語中心」だった AI の世界に、**「インドの視点」**を大きく取り入れることができます。

まとめ

この論文は、**「英語一辺倒だった AI の世界に、インドの多彩な文化と言語という『新しい色』を塗り足すための、巨大なパレット(Chitrakshara)を作った」**という報告です。

これにより、インドの人々にとって、より親しみやすく、文化を理解してくれる AI が生まれることが期待されています。まるで、世界中の AI が、インドの街角を歩き回り、現地の言葉で会話できるようになるようなイメージです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →