On the missing data layer and a potential solution
本論文は、ラテンアメリカのAIインフラストラクチャにおける、発見の困難さと供給不足を特徴とする統一されたデータセット層の決定的な欠如を特定し、データセットの発見、メタデータ管理、貢献、ライセンス供与、および再利用を可能にするための、特定のオントロジーに基づいたタスク優先型のデータインフラストラクチャである「DataHub」を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
足りない材料:ローカルな脳のために
完璧なケーキを焼こうとしている場面を想像してみてください。しかし、見つけたレシピはどれも、見たこともない材料を使い、設定温度の異なるオーブンを使う、別のキッチン向けに書かれたものばかりです。これが、現在のラテンアメリカにおける人工知能(AI)の状況です。なぜこれが重要なのかを理解するために、2つのシンプルな概念を見てみましょう。第一に、AIモデルは「非常に賢い学生」のようなものです。彼らは膨大な量の情報(データ)を読み込むことで、問題の解き方を学びます。第二に、ベンチマークは「標準化されたテスト」のようなものです。これは、学生が本当に知識を持っているのか、それとも単に推測しているだけなのかを確認するために課される試験です。
現在、ラテンアメリカにおけるほとんどのAI「学生」は、他国の教師によって、他国の言語で書かれた教科書を使って教えられています。これらの学生は、数学やコーディングといった一般的なタスクには優れていますが、地元のスラングを理解したり、地元の植物を認識したり、地元の法律を把握したりといった、自分の近所特りの事柄を求められると、つまずいてしまうことがよくあります。大きな問いは、単に「より賢くなること」ではありません。ある地域が、その人々を真に理解する独自の「脳」を構築できるのか、それとも、自分たちの特定のニーズを顧みない、外部で作られた脳に永遠に依存し続けなければならないのか、ということです。
AIという家の欠けている2つの層
SURUSチームによる新しい論文によると、ラテンアメリカのAIという家には、2つの重要な階層が欠けています。それは、データセット層とベンチマーク層です。データセット層を「AIが学習するために読む本の図書室」だとすれば、ベンチマーク層は「AIが本当に賢いかどうかをチェックする試験センター」です。これらがなければ、この地域は独自のAIを構築することも、また、利用している海外のAIが果たしてうまく機能しているのかを適切に判断することさえもできません。
著者らは、この欠如が2種類のトラブルを引き起こすと主張しています。ビジネスにおいて、問題はブラジルの農場にある害虫を特定しようとして、ヨーロッパの畑向けのガイドブックを使っているようなものです。タスク(虫を見つけること)は同じですが、虫の種類が異なります。間違ったデータを使用すると、AIは実際に収穫を台無しにする害虫を見逃してしまう可能性があります。政府や公的機関にとって、問題はより深刻です。それは「アイデンティティ」の問題です。もしAIが外国の物語や価値観に基づいて訓練されているなら、地元の市民を、その人々の実生活にそぐわない方法で描写してしまうかもしれません。それは、言葉は通じるものの、地元の文化を理解していない市長がいるようなものです。礼儀正しいかもしれませんが、統治はうまくいかないでしょう。
大いなるデータのスカベンジャー・ハント(宝探し)
論文は、ラテンアメリカのデータは消えてしまったのではなく、ただ「迷子」になっているのだと指摘しています。データはインターネット上に、パズルのピースのようにバラバラに隠されています。あるものは研究論文の中に、あるものはHugging Faceのようなプラットフォームの中に、そしてあるものは民間企業のアーカイブの中に閉じ込められています。それらを見つけ出すための単一の地図は存在しません。たとえすべてを見つけ出せたとしても、米国や欧州が保有している量と比較すれば、単純に量が足りないのです。
これが悪循環を生んでいます。データを共有してもクレジット(評価)が得られる簡単な場所がないため、人々は共有しません。人々が共有しないため、他の人々を呼び込むための大規模なコレクションも生まれません。著者らは、このループを打破するために設計された中央集権的なライブラリであるDataHubという解決策を提案しています。これは単なるリストではありません。貢献者に報酬を与えるシステムです。もしデータセットを寄贈すれば、可視性と認知が得られるため、データを公開する価値が生まれます。
図書室の新しい整理術
この論文の中で最も独創的な部分の一つは、この新しい図書室をどのように整理すべきかという提案です。データを「見た目(画像やテキストなど)」や「対象とするモデル」によって分類するのではなく、**「AIが何をすべきか」**によって分類することを提案しています。
本が「色やサイズ」ではなく、「その本がどのような仕事に役立つか」によって分類されている図書室を想像してみてください。著者らは、3段階の梯子を提案しています。
- タスク(Task): その仕事は何ですか?(例:「音声の書き起こし」)
- ドメイン(Domain): 具体的な分野は何ですか?(例:「医療」対「法律」)
- 言語と地域(Language & Region): 誰が話していますか?(例:「リオプラテンセ・スペイン語」対「コロンビア・スペイン語」)
これが重要なのは、ブエノスアイレスの医師には、ボゴタの弁護士とは異なる種類の医療書き起こしAIが必要だからです。一般的なAIは言葉自体は正しく捉えるかもしれませんが、特定の医学用語や地元のアクセントを見逃すかもしれません。このようにデータを整理することで、DataHubは構築されるAIが正確に特定のニーズに調整され、より高いパフォーマンスを発揮し、「ローカル」であることを実感できるようにします。
開かれた扉とインセンティブ
論文は、これがどのように構築されるべきかについて強い姿勢を示しています。それは、**「設計段階からオープンであること(Open by design)」**です。追いつこうとしている地域にとって、コラボレーションこそが勝利への唯一の道であると著者らは信じています。データを閉ざされた扉の背後に隠しても、何の助けにもなりません。共有することで、誰もがより速く学ぶことができます。しかし、人々が単に善意だけで共有してくれるわけではないことも、彼らは理解しています。システムは「インセンティブ駆動型」である必要があります。つまり、貢献者が、自分の仕事に対する認知や、所属機関の名前がデータに紐付けられるといったメリットを実感できる必要があるのです。
前方への道のり
著者らは、これはあくまで始まりであり、「キックスタート」であって完成品ではないことを明確にしています。依然として大きな障害があることも認めています。ラテンアメリカの国々によってプライバシーやデータに関する法律は異なり、データのラベル付けやライセンスに関する合意されたルールもまだ存在しません。彼らはこれらの問題を解決したと主張しているのではなく、企業、大学、政府といったあらゆる人々に対し、共に解決策を見つけ出すよう呼びかけているのです。
論文は、次のような行動喚起で締めくくられています。ラテンアメリカのAIのためのデータセット層は、この地域によって、この地域のために構築されなければ、決して構築されることはない。DataHubは、その第一歩であり、データを持つあらゆる人々に対し、参加し、共有し、ラテンアメリカが人工知能の世界で独自の声を上げる未来を築くための、生きた招待状なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。