Mi:dm 2.0 Korea-centric Bilingual Language Models
KTは、包括的なデータパイプラインと文化的適合性を活用することで、韓国固有のベンチマークにおいて最先端の性能を達成しつつ、MITライセンスの下で研究および商業利用の両方をサポートする、115億および23億のパラメータ・バリアントを備えたバイリンガル大規模言語モデルファミリーであるMi:dm 2.0を発表しました。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ロボットに韓国語を教えるだけでなく、韓国文化の「魂」を理解させようとしていると想像してみてください。それが、KT(韓国テレコム)のチームが新しい創造物、Mi:dm 2.0で成し遂げたことです。
既存のほとんどのAIモデルを、フレーズブックを暗記した「観光客」だと考えてみてください。彼らは韓国語で「こんにちは」や「ありがとう」と言うことはできますが、「なぜお辞儀をするのか」、上司に対してと友人に使うべき適切な礼儀レベルの違い、あるいはジョークに含まれる深い歴史的背景などを理解していないかもしれません。しかし、Mi:dm 2.0は**「地元住民」**として設計されています。単に言葉を話すだけでなく、韓国社会の一員として考え、推論し、感じることができるのです。
以下に、簡単な比喩を用いて、彼らがどのようにこれを構築したかの内訳を説明します。
1. 問題点:「観光客」対「地元住民」
著者たちは、多くのAIモデルが韓国語を話せる一方で、不自然に聞こえたり、文化的なニュ Nuance(ニュアンス)を見逃したりしていることに気づきました。それは、地元の市場で食べ物を注文しようとして、現地の習慣を知らないために、うっかりシェフの気分を害してしまう観光客のようなものです。既存のモデルは、データが少なすぎるか、質が低いか、あるいは韓国の生活特有の「雰囲気」を捉えきれていないデータで学習されていました。
2. 解決策:「文化的ダイエット」
これを修正するために、チームは単にAIに大量のデータを与えたのではなく、より質の高いデータを与えました。彼らはトレーニングデータを、グルメ料理を準備するシェフのように扱いました。
- 材料(データ): 彼らは単にインターネットから何でもかき集めたわけではありません。厳格な「品質管理」パイプラインを構築しました。壊れた文章、失礼なコメント、混乱を招くテキストを排除し、明確で高品質かつ文化的に関連性の高い物語、ニュース、書籍だけを残す「ふるい」をイメージしてください。
- 合成サプリメント: 高品質な韓国語のデータは希少であるため(特定の珍しいスパイスを見つけるようなものです)、彼らは「合成」データを作成しました。既存の知識を取り込み、それを新しい形式に書き換えました。例えば、乾燥した百科事典の項目を教科書のレッスンに変えたり、ニュース記事を会話形式に変えたりすることで、AIが多様なソースから学習できるようにしました。
- バランスの取れたメニュー: 彼らは、AIが「人文科学」(歴史、文学)を食べすぎており、「STEM」(科学、数学)が足りないことに気づきました。そこで、AIが偏った食事で体調を崩さないよう、バランスの取れたものにするために、意図的に追加の「STEM料理」を用意しました。
3. 2つのモデル:「マスターシェフ」と「ポケットナイフ」
彼らは異なるニーズに合わせて、このAIの2つのバージョンをリリースしました。
- Mi:dm 2.0 Base (11.5 Billion Parameters): これは**「マスターシェフ」**だと考えてください。大規模で強力であり、深い推論、長い物語の執筆、あるいは難しい数学の問題の解決といった複雑なタスクをこなします。これは、80億パラメータのより小さなモデルをベースに、基本的な構造を変えずに、より深く「引き伸ばす」(層を追加する)ことで、より賢くしたものを作り上げています。
- Mi:dm 2.0 Mini (2.3 Billion Parameters): これは**「ポケットナイフ」**です。小さく軽量で、電力制限のあるデバイス(スマートフォンやノートパソコンなど)で動作するように設計されています。彼らはマスターシェフの知識を「剪定(せんてい)」し、巨大なキッチンを必要とせずに素晴らしい仕事ができるよう、最も重要なスキルを保持させました。
4. トレーニング:「読書」から「会話」へ
- 事前学習(図書館での読書): まず、AIは数百万の文書を読み、言語、事実、論理の基礎を学びました。
- 事後学習(徒弟制度): 読書の後、AIは専門的な徒弟制度に入りました。彼らは特定のスキルを教え込みました。
- 指示への追従: 単にAIが「こうしたいだろう」と思うことではなく、「はい、承知いたしました」と言い、あなたの依頼通りに実行することを学びました。
- 安全性: 何を「言ってはいけないか」を学びました。有害なトピック(ヘイトスピーチや違法行為など)を認識し、丁寧に拒否するように教えられ、責任ある大人として振る舞うようにしました。
- ツールの使用: リアルタイムの回答を得るために、計算機や検索エンジンなどの外部ツールを使用する方法を教えました。
5. 結果:「ローカルテスト」への合格
チームは、特別な韓国語テスト(文化的なIQテストのようなもの)を用いて、他の有名なAIモデルとMi:dm 2.0を比較テストしました。
- 判定: Mi:dm 2.0は単に合格しただけでなく、テストを完璧にこなしました。韓国の歴史、文化、および複雑な社会的状況の理解において、他のモデルよりも高いスコアを記録しました。
- 「干し草の中の針」: AIが膨大な文書の中から極めて小さな情報を見つけ出せるかどうかをテストしました(干し草の中から針を見つけるようなものです)。Mi-dm 2.0はこのテストにおいて非常に優れており、途中で迷うことなく、長く詳細な会話を扱えることを証明しました。
- 安全性: AIに意地悪なことや危険なことを言わせようとする巧妙な質問で罠を仕掛けましたが、Mi:dm 2.0は競合他社よりもしっかりと持ちこたえ、強い「道徳的コンパス」を持っていることを示しました。
まとめ
Mi:dm 2.0は、特に**韓国中心(Korea-centric)**になるよう設計されたバイリンガル(韓国語・英語)AIです。単に韓国語を話す一般的なロボットではなく、韓国社会のニュアンス、ユーモア、価値観を理解するために、高品質で文化的に豊かなデータによる食事を与えられて育ちました。複雑なタスクのための強力な脳(Base)が必要な場合でも、日常業務のための機敏な助手(Mini)が必要な場合でも、このAIは機械というよりも、知識豊富な地元の友人のように感じられるよう設計されています。
注:論文には、これらのモデルは研究および商業利用のためにMITライセンスの下でリリースされることが記載されており、開発者は、安全性を追求してはいるものの、完璧なAIは存在せず、間違いを犯す可能性があることを認めています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。