Phoenix-VL 1.5 Medium Technical Report
Phoenix-VL 1.5 Medium は、広範なローカライズされた事前学習とアライメントを通じてシンガポール向けに特別に適応された 1230 億パラメータのネイティブなマルチモーダルかつ多言語基盤モデルであり、地域ベンチマークにおいて最先端のパフォーマンスを達成しつつ、汎用知能において世界的な競争力を維持しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、Phoenix-VL 1.5 Mediumの技術報告書を、創造的な比喩を用いてシンプルで日常的な言葉に翻訳した解説です。
大きなアイデア:「ローカル専門家」スーパーブレイン
想像してください。科学、数学、そして世界史についてすべてを知っている、世界的に活躍する天才教授がいます。これが研究者たちが出発点としたMistral Medium 3.1モデルです。このモデルは驚くほど賢いのですが、もしシンガポールの特定の地域法や、トア・パヨ地区にある有名な公園の名前について尋ねると、間違えて推測したり、一般的な答えしか返せなかったりするかもしれません。
Phoenix-VL 1.5 Mediumとは、その世界的な教授を、厳格な 12 ヶ月の「シンガポール没入型ブートキャンプ」へ送り込んだ結果として生まれたものです。その目的は、主権型 AI(ソブリン AI)を作ることでした。これはシンガポールに帰属するデジタル脳であり、その独自の文化や法律を理解し、インターネット(外部世界と通信する「エアギャップ」システムのように)を参照する必要なく安全に機能できるものです。
訓練レシピ:どのようにして作られたか
研究者たちは単にモデルに山ほどの本を投げつけたわけではありません。この新しい AI を焼き上げるために、特定の 4 段階の調理レシピを用いました。
ベース層(継続的事前学習):
これはモデルに、巨大で専門的な図書館を与え続けるようなものです。彼らは1 兆トークン(トークンとは単語や単語の一部のようなもの)のデータを与えました。これは単なるランダムなインターネットのテキストではなく、シンガポールの法律、地域言語(マレー語、タミル語、中国語など)、そしてローカル文化に重点を置いた厳選された組み合わせでした。- 比喩: 教授が、世界の知識を維持しつつ、1 年間シンガポールのすべての新聞、政府官報、そして地元の小説を読み漁る様子を想像してください。
長文読解の拡張(ロングコンテキスト):
彼らはモデルに、一度に膨大な量の情報を記憶させることを教えました。その「短期記憶」を131,072 トークン(厚手の小説ほどのサイズ)まで拡張しました。- 比喩: 教授はもはや、500 ページの法律文書を一気に読み通し、400 ページに到達した際にも 1 ページ目の詳細を忘れることなく記憶できるのです。
微調整(指示とドメイン訓練):
ここでモデルは、どのように振る舞うかを学びました。シンガポールの政府政策に関する質問への答え方や、「トア・パヨのドラゴン公園」といった具体的なローカルな場所を、単なる一般的な「公園」としてではなく描写する方法などの、具体的な例を示されました。- 比喩: 教授はもはや「カスタマーサービスとローカルエチケット」の授業を受けています。シンガポール人が法律について尋ねた際には、曖昧な推測ではなく、正確な答えが必要だと学びました。また、地元のランドマークの写真を見て、それを正確に描写する方法も学びました。
仕上げ(オンライン直接選好最適化):
最終的に、人間の教師がモデルの回答をレビューし、ランク付けしました。モデルがあまりにもおしゃべりだったり、幻覚(事実を捏造すること)を起こしたり、失礼だったりした場合、教師が修正しました。- 比喩: 最終的な「本番前のリハーサル」です。教授が質問への回答を練習し、審査員のパネルがフィードバックを与えることで、ステージに上がる前に、親切で誠実かつ安全であることを確認します。
何が特別なのか?
この論文は、この新しいモデルの 3 つの主なスーパーパワーを強調しています。
- ローカルな伝説: シンガポール向けに特別に設計されたテスト(16 の政府省庁のすべての名前を知っていること、またはローカルの安全規制を理解することなど)において、Phoenix-VL 1.5 Medium は、はるかに大きくて有名なモデルたちを打ち負かしました。
- 結果: ローカル知識においては、4000 億パラメータを持つモデル(Llama 4 Maverick など)よりも高いスコアを記録しました。これは、単に脳を大きくするよりも、深いローカル訓練の方が重要であることを証明しています。
- 世界を忘れていない: ある特定のトピックについて教えると、他のすべてを忘れてしまうのではないかという一般的な懸念があります。しかし、この論文は Phoenix-VL 1.5 Medium が一般的な知性を維持したと主張しています。数学、コーディング、一般的な推論においても、他のトップクラスのモデルと同等に優れています。
- 見て理解する: テキストのみを読む古いモデルとは異なり、これは「マルチモーダル」です。シンガポールの街並みの写真や複雑なチャートを見て、それをローカルな文脈で説明することができます。
安全性:「誠実さ」フィルター
研究者たちは、シンガポールの規則に合わせた特別な安全性フレームワークを構築しました。
- 「捏造しない」ルール: 法的または政府の文脈において、事実を捏造することは危険です。モデルは推測するのではなく、「知らない」と言うように訓練されました。
- 「悪意ある行為者」禁止ルール: このモデルは「ジャイルブレイク」(AI に悪いことをさせるために人々が使うトリック)に対して耐性があり、自身の秘密の指示を漏らすことはありません。
- 比喩: これは、何を言ってよくて、何を拒否しなければならないかを正確に知っている、非常に規律正しい公務員のようなものです。法律を誤って破ったり、誤情報を広めたりすることのないよう保証します。
結論
Phoenix-VL 1.5 Mediumは、1230 億パラメータの AI モデルであり、世界最大のモデルでなくても、最も賢いローカル専門家になれることを証明しています。データを慎重に選定し、シンガポールの独自の法律、言語、文化に特化して訓練することで、創造者たちは以下のモデルを構築しました。
- シンガポールについて深く精通しており(巨人たちよりも優れている)。
- 一般的な知性において世界的に競争力がある。
- インターネットを必要とせず、政府および民間セクターで安全かつセキュアに使用できる。
これは「主権的資産」であり、つまりシンガポールのニーズのために特別に作られたデジタルツールであり、国家によって所有・管理されていることを意味します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。