← 最新の論文
🤖 machine learning

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

Nemotron 3 Nano Omni は、音声、テキスト、画像、動画をネイティブにサポートする新しいオープンソースのマルチモーダルモデルであり、30B-A3B バックボーンとトークン削減技術を通じて精度、エージェント機能、効率的な推論を向上させ、さらなる研究を支援するためにチェックポイントとコードを公開しています。

原著者: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg
公開日 2026-04-29
📖 1 分で読めます☕ さくっと読める

原著者: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg Heinrich, Guo Chen, Lukas Voegtle, Philipp Fischer, Timo Roman, Karan Sapra, Collin McCarthy, Shaokun Zhang, Fuxiao Liu, Hanrong Ye, Yi Dong, Mingjie Liu, Yifan Peng, Piotr Zelasko, Zhehuai Chen, Nithin Rao Koluguri, Nune Tadevosyan, Lilit Grigoryan, Ehsan Hosseini Asl, Pritam Biswas, Leili Tavabi, Yuanhang Su, Zhiding Yu, Peter Jin, Alexandre Milesi, Netanel Haber, Yao Xu, Sarah Amiraslani, Nabin Mulepati, Eric Tramel, Jaehun Jung, Ximing Lu, Brandon Cui, Jin Xu, Zhiqi Li, Shihao Wang, Yuanguo Kuang, Shaokun Zhang, Huck Yang, Boyi Li, Hongxu Yin, Song Han, Pavlo Molchanov, Adi Renduchintala, Charles Wang, David Mosallanezhad, Soumye Singhal, Luis Vega, Katherine Cheung, Sreyan Ghosh, Yian Zhang, Alexander Bukharin, Venkat Srinivasan, Johnny Greco, Andre Manoel, Maarten Van Segbroeck, Suseella Panguliri, Rohit Watve, Divyanshu Kakwani, Shubham Pachori, Jeffrey Glick, Radha Sri-Tharan, Aileen Zaman, Khanh Nguyen, Shi Chen, Jiaheng Fang, Qing Miao, Wenfei Zhou, Yu Wang, Zaid Pervaiz Bhat, Varun Praveen, Arihant Jain, Ramanathan Arunachalam, Tomasz Kornuta, Ashton Sharabiani, Amy Shen, Wei Huang, Yi-Fu Wu, Ali Roshan Ghias, Huiying Li, Brian Yu, Nima Tajbakhsh, Chen Cui, Wenwen Gao, Li Ding, Terry Kong, Manoj Kilaru, Anahita Bhiwandiwalla, Marek Wawrzos, Daniel Korzekwa, Pablo Ribalta, Grzegorz Chlebus, Besmira Nushi, Ewa Dobrowolska, Maciej Jakub Mikulski, Kunal Dhawan, Steve Huang, Jagadeesh Balam, Yongqiang Wang, Nikolay Karpov, Valentin Mendelev, George Zelenfroynd, Meline Mkrtchyan, Qing Miao, Omri Almog, Bhavesh Pawar, Rameshwar Shivbhakta, Sudeep Sabnis, Ashrton Sharabiani, Negar Habibi, Geethapriya Venkataramani, Pamela Peng, Prerit Rodney, Serge Panev, Richard Mazzarese, Nicky Liu, Michael Fukuyama, Andrii Skliar, Roger Waleffe, Duncan Riach, Yunheng Zou, Jian Hu, Hao Zhang, Binfeng Xu, Yuhao Yang, Zuhair Ahmed, Alexandre Milesi, Carlo del Mundo, Chad Voegele, Zhiyu Cheng, Nave Assaf, Andrii Skliar, Daniel Afrimi, Natan Bagrov, Ran Zilberstein, Ofri Masad, Eugene Khvedchenia, Natan Bagrov, Borys Tymchenko, Tomer Asida, Daniel Afrimi, Parth Mannan, Victor Cui, Michael Evans, Katherine Luna, Jie Lou, Pinky Xu, Guyue Huang, Negar Habibi, Michael Boone, Pradeep Thalasta, Adeola Adesoba, Dina Yared, Christopher Parisien, Leon Derczynski, Shaona Ghosh, Wes Feely, Micah Schaffer, Radha Sri-Tharan, Jeffrey Glick, Barnaby Simkin, George Zelenfroynd, Tomasz Grzegorzek, Rishabh Garg, Aastha Jhunjhunwala, Sergei Kolchenko, Farzan Memarian, Haran Kumar, Shiv Kumar, Isabel Hulseman, Anjali Shah, Kari Briski, Padmavathy Subramanian, Joey Conway, Udi Karpas, Jane Polak Scowcroft, Annie Surla, Shilpa Ammireddy, Ellie Evans, Jesse Oliver, Tom Balough, Chia-Chih Chen, Sandip Bhaskar, Alejandra Rico, Bardiya Sadeghi, Seph Mard, Katherine Cheung, Meredith Price, Laya Sleiman, Saori Kaji, Wesley Helmholz, Wendy Quan, Michael Lightstone, Jonathan Cohen, Jian Zhang, Oleksii Kuchaiev, Boris Ginsburg, Jan Kautz, Eileen Long, Mohammad Shoeybi, Mostofa Patwary, Oluwatobi Olabiyi, Andrew Tao, Bryan Catanzaro, Udi Karpas

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

超知能の助手を想像してみてください。その助手は生涯にわたって本を読み、画像を見て過ごしてきました。テキストや画像については抜群に得意ですが、もし会話したり、音付きの動画を見せたりすると、困惑してしまいます。

Nemotron 3 Nano Omniは、NVIDIA が発表したこの助手の最新バージョンです。まるでその助手に耳とビデオカメラを与え、さらに情報を処理する速度と効率を格段に向上させたようなものです。

以下に、この新モデルを特別なものにしている要素を、日常の比喩を用いて分かりやすく解説します。

1. 「オールインワン」アップグレード

以前、この助手(Nemotron Nano V2)はテキストの読解と静止画の閲覧しかできませんでした。新しいNemotron 3 Nano Omniは「オムニモーダル」であり、これはすべてを同時に処理できる、つまりテキスト、画像、動画、音声をすべて扱えるという、少し仰々しい表現です。

  • 比喩: 旧モデルは本しか読めない図書館司書だとしたら、新モデルは本を読み、映画を見、ポッドキャストを聴き、それらすべてがどのように関連しているかを説明できる図書館司書です。

2. 「脳」と「感覚」

このモデルは、Nemotron 3 Nano 30B-A3Bと呼ばれる非常に効率的な「脳」を基盤としています。この脳は「Mixture of Experts(MoE)」と呼ばれるもので、特定の課題を解決するために必要な専門家だけが目を覚ますチームのような仕組みであり、エネルギーを節約します。

  • 感覚: 新しい入力に対応するため、2 つの新しい「センサー」が取り付けられました。
    • 視覚: 画像や動画を見るためのハイテクカメラシステム(C-RADIOv4-H)。
    • 聴覚: 音声、音楽、環境音を理解する高度な耳(Parakeet-TDT)。

3. 見る・聞くための賢い方法

論文では、このモデルが膨大なデータに圧倒されないようにするための 3 つの巧妙な工夫が強調されています。

  • 動的解像度(可変レンズ): 詳細を失う原因となる、すべての写真を小さな固定された正方形に圧縮するのではなく、カメラがズームイン・ズームアウトするように視野を調整し、画像の自然な形状を維持します。
  • 動画圧縮(タイムラプス): 動画を見る際、フレームが同一であればすべてのフレームを個別に見るのではなく、「3D 畳み込み」という工夫を用いてフレームのペアを結合し、処理が必要な「フレーム」の数を事実上半分に減らします。
  • 音声チャンク(音の抜粋): 2 時間のポッドキャストを巨大なノイズの塊として聴くのではなく、30 秒のクリップに分割し、会話の流れを理解しやすくします。

4. 「トレーニングキャンプ」(学習の仕組み)

カメラを接続するだけで、モデルがすぐに映画を理解できるわけではありません。チームは学生が進級するように、段階的なトレーニングレシピを使用しました。

  • ステージ 0-1: まず、モデルに画像とテキストを同時に理解することを教えました。
  • ステージ 2-3: 次に、音声を聴き、発話することを教えました。
  • ステージ 4-6: 最後に、すべてを統合しました。長い文書、数時間の動画、複雑な対話を含む膨大なデータ(4,660 億以上の「トークン」または単語)を学習させました。
  • 「強化学習」フェーズ: 初期トレーニングの後、「試行・失敗・成功」のゲームを行いました。モデルに課題を与え、答えが正しいか確認し、論理的に思考したことで報酬を与えました。これは、コーチがアスリートの試合映像をレビューして戦略を改善させることに似ています。

5. 速度と効率

論文における最大の主張の一つは、このモデルが驚くほど高速であるという点です。

  • 比喩: 同サイズの他のモデルが渋滞に巻き込まれるスポーツカーだとすれば、Nemotron 3 Nano Omni は高速鉄道です。不要なステップをスキップする特別な技術を用いることで、競合他社よりもはるかに高速に長い動画や巨大な文書を処理できます。
  • 結果: NVIDIA の最新チップ(B200)上では、同様のモデルよりも3 倍から 9 倍速くテキスト出力を生成でき、かつメモリ使用量は少なくて済みます。

6. 実際に行えること(論文に基づく)

論文ではこのモデルを特定の課題でテストし、以下の分野で非常に高い性能を発揮しました。

  • 文書の読解: 複雑なチャート、表、長いレポート(財務報告書など)を、以前のバージョンよりもよく理解できます。
  • 動画の理解: 音声付きの長い動画を見て、何が起きたか、なぜ起きたか、出来事の順序について質問に答えることができます。
  • コンピュータ制御: コンピュータの画面(GUI)を見て、フライトの予約やフォームの記入などのタスクを完了させるためにどのボタンをクリックすべきかを判断できます。
  • 音声対話: 会話を続け、アクセントを理解し、聞いた内容に基づいて質問に答えることができます。

7. 誰でも利用可能

最後に、論文は NVIDIA が「設計図」と「トレーニング資料」を共有することを発表しています。モデルは異なるサイズ(標準、圧縮、超圧縮)でリリースされ、さらにそれを構築するために使用されたデータやコードの一部も共有されています。これは、レシピと材料を世界中に提供し、他の科学者たちが自分たちのバージョンを構築したり、改良したりできるようにするのと同じです。

まとめ: Nemotron 3 Nano Omni は、読み、見て、聴くことを同時にこなす、より高速で賢く、多感覚的な助手です。複雑で長いタスクを処理する際に、行き詰まることがないように設計されています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →