← 最新论文
🤖 machine learning

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

Nemotron 3 Nano Omni 是一款新的开源多模态模型,原生支持音频、文本、图像和视频输入,通过 30B-A3B 骨干网络和令牌减少技术,在提升准确率、代理能力和推理效率的同时,已发布检查点和代码以支持进一步研究。

原作者: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg
发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg Heinrich, Guo Chen, Lukas Voegtle, Philipp Fischer, Timo Roman, Karan Sapra, Collin McCarthy, Shaokun Zhang, Fuxiao Liu, Hanrong Ye, Yi Dong, Mingjie Liu, Yifan Peng, Piotr Zelasko, Zhehuai Chen, Nithin Rao Koluguri, Nune Tadevosyan, Lilit Grigoryan, Ehsan Hosseini Asl, Pritam Biswas, Leili Tavabi, Yuanhang Su, Zhiding Yu, Peter Jin, Alexandre Milesi, Netanel Haber, Yao Xu, Sarah Amiraslani, Nabin Mulepati, Eric Tramel, Jaehun Jung, Ximing Lu, Brandon Cui, Jin Xu, Zhiqi Li, Shihao Wang, Yuanguo Kuang, Shaokun Zhang, Huck Yang, Boyi Li, Hongxu Yin, Song Han, Pavlo Molchanov, Adi Renduchintala, Charles Wang, David Mosallanezhad, Soumye Singhal, Luis Vega, Katherine Cheung, Sreyan Ghosh, Yian Zhang, Alexander Bukharin, Venkat Srinivasan, Johnny Greco, Andre Manoel, Maarten Van Segbroeck, Suseella Panguliri, Rohit Watve, Divyanshu Kakwani, Shubham Pachori, Jeffrey Glick, Radha Sri-Tharan, Aileen Zaman, Khanh Nguyen, Shi Chen, Jiaheng Fang, Qing Miao, Wenfei Zhou, Yu Wang, Zaid Pervaiz Bhat, Varun Praveen, Arihant Jain, Ramanathan Arunachalam, Tomasz Kornuta, Ashton Sharabiani, Amy Shen, Wei Huang, Yi-Fu Wu, Ali Roshan Ghias, Huiying Li, Brian Yu, Nima Tajbakhsh, Chen Cui, Wenwen Gao, Li Ding, Terry Kong, Manoj Kilaru, Anahita Bhiwandiwalla, Marek Wawrzos, Daniel Korzekwa, Pablo Ribalta, Grzegorz Chlebus, Besmira Nushi, Ewa Dobrowolska, Maciej Jakub Mikulski, Kunal Dhawan, Steve Huang, Jagadeesh Balam, Yongqiang Wang, Nikolay Karpov, Valentin Mendelev, George Zelenfroynd, Meline Mkrtchyan, Qing Miao, Omri Almog, Bhavesh Pawar, Rameshwar Shivbhakta, Sudeep Sabnis, Ashrton Sharabiani, Negar Habibi, Geethapriya Venkataramani, Pamela Peng, Prerit Rodney, Serge Panev, Richard Mazzarese, Nicky Liu, Michael Fukuyama, Andrii Skliar, Roger Waleffe, Duncan Riach, Yunheng Zou, Jian Hu, Hao Zhang, Binfeng Xu, Yuhao Yang, Zuhair Ahmed, Alexandre Milesi, Carlo del Mundo, Chad Voegele, Zhiyu Cheng, Nave Assaf, Andrii Skliar, Daniel Afrimi, Natan Bagrov, Ran Zilberstein, Ofri Masad, Eugene Khvedchenia, Natan Bagrov, Borys Tymchenko, Tomer Asida, Daniel Afrimi, Parth Mannan, Victor Cui, Michael Evans, Katherine Luna, Jie Lou, Pinky Xu, Guyue Huang, Negar Habibi, Michael Boone, Pradeep Thalasta, Adeola Adesoba, Dina Yared, Christopher Parisien, Leon Derczynski, Shaona Ghosh, Wes Feely, Micah Schaffer, Radha Sri-Tharan, Jeffrey Glick, Barnaby Simkin, George Zelenfroynd, Tomasz Grzegorzek, Rishabh Garg, Aastha Jhunjhunwala, Sergei Kolchenko, Farzan Memarian, Haran Kumar, Shiv Kumar, Isabel Hulseman, Anjali Shah, Kari Briski, Padmavathy Subramanian, Joey Conway, Udi Karpas, Jane Polak Scowcroft, Annie Surla, Shilpa Ammireddy, Ellie Evans, Jesse Oliver, Tom Balough, Chia-Chih Chen, Sandip Bhaskar, Alejandra Rico, Bardiya Sadeghi, Seph Mard, Katherine Cheung, Meredith Price, Laya Sleiman, Saori Kaji, Wesley Helmholz, Wendy Quan, Michael Lightstone, Jonathan Cohen, Jian Zhang, Oleksii Kuchaiev, Boris Ginsburg, Jan Kautz, Eileen Long, Mohammad Shoeybi, Mostofa Patwary, Oluwatobi Olabiyi, Andrew Tao, Bryan Catanzaro, Udi Karpas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一位超级聪明的助手,他一生都在阅读书籍和观看图片。他精通文本和图像,但如果你试图与他交谈,或向他展示一段带声音的视频,他会感到困惑。

Nemotron 3 Nano Omni 是英伟达(NVIDIA)推出的这位助手的新版本。这相当于给这位助手配上了一对耳朵和一台摄像机,同时教会他们以更快、更高效的方式处理信息。

以下是使用日常类比对该新模型独特之处的简明解析:

1. “全能”升级

在此之前,这位助手(Nemotron Nano V2)只能阅读文本和查看静态图片。新的Nemotron 3 Nano Omni是“全模态”的,用一种花哨的说法就是它能同时处理一切:文本、图像、视频和音频

  • 类比:把旧模型想象成一位只能读书的图书管理员。新模型则是一位既能读书、又能看电影、还能听播客,并能告诉你这些事物之间如何关联的图书管理员。

2. “大脑”与“感官”

该模型基于一个名为Nemotron 3 Nano 30B-A3B的高效“大脑”构建。这是一个“混合专家”(MoE)架构,就像一支专家团队,只有合适的专家会被唤醒来解决特定问题,从而节省能量。

  • 感官:为了处理新的输入,他们附加了两个新的“传感器”:
    • 视觉:一套高科技摄像系统(C-RADIOv4-H),用于查看图像和视频。
    • 听觉:一只精密的“耳朵”(Parakeet-TDT),用于理解语音、音乐和环境声音。

3. 更聪明的观看与聆听方式

该论文强调了模型为避免被过多数据淹没而使用的三种巧妙技巧:

  • 动态分辨率(灵活的镜头):模型不像旧方法那样将每张照片压缩成一个固定的微小方块(这会丢失细节),而是像相机变焦一样调整视角,以保持图像的自然形状。
  • 视频压缩(延时摄影):在观看视频时,如果连续帧完全相同,模型不会查看每一帧。它使用"3D 卷积”技巧合并成对的帧,实际上将其需要处理的“帧”数量减少了一半。
  • 音频片段(声音剪辑):它不是将长达 2 小时的播客作为一个巨大的噪音块来聆听,而是将音频切分为 30 秒的片段,使其更容易理解对话的流向。

4. “训练营”(它是如何学习的)

你不能只是插上摄像头就指望模型立即理解电影。团队采用了一种分阶段训练食谱,就像学生循序渐进地升学:

  • 阶段 0-1:首先,他们教导模型同时理解图片和文本。
  • 阶段 2-3:接着,他们教导它聆听音频并说话。
  • 阶段 4-6:最后,他们将所有内容整合在一起。他们向模型输入了海量数据(超过 4660 亿个“词元”或单词),其中包括长文档、数小时的视频和复杂的对话。
  • “强化学习”阶段:在初步训练之后,他们玩了一场“尝试、失败、成功”的游戏。他们向模型提出问题,检查它是否答对,并奖励其逻辑思考。这类似于教练与运动员一起回顾比赛录像,以改进他们的策略。

5. 速度与效率

该论文中最大的主张之一是,该模型的速度极快。

  • 类比:如果其他类似规模的模型像是一辆容易陷入交通堵塞的跑车,那么 Nemotron 3 Nano Omni 就是一列高速列车。它使用特殊技术跳过不必要的步骤,使其能够比竞争对手更快地处理长视频和大型文档。
  • 结果:在英伟达最新的芯片(B200)上,它在生成文本输出时比类似模型快3 到 9 倍,同时占用更少的内存。

6. 它实际能做什么(基于论文)

论文在该模型上测试了特定挑战,它在以下方面表现优异:

  • 阅读文档:它比之前的版本更能理解复杂的图表、表格和长篇报告(如金融论文)。
  • 理解视频:它可以观看带声音的长视频,并回答关于发生了什么、为何发生以及事件顺序的问题。
  • 计算机控制:它可以查看电脑屏幕(GUI),并找出需要点击哪些按钮来完成任务(如预订航班或填写表格)。
  • 语音交互:它可以进行对话,理解口音,并根据所听到的内容回答问题。

7. 向所有人开放

最后,论文宣布英伟达正在分享“蓝图”和“训练材料”。他们发布了不同尺寸的模型(标准版、压缩版和超压缩版),甚至分享了他们用于构建该模型的部分数据和代码。这就像将整个世界的食谱和食材都提供出来,以便其他科学家可以构建自己的版本或对其进行改进。

总结:Nemotron 3 Nano Omni 是一个更快、更智能、具备多感官能力的助手,能够同时阅读、观看和聆听,旨在处理漫长而复杂的任务而不会陷入困境。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →