想象一位超级聪明的助手,他一生都在阅读书籍和观看图片。他精通文本和图像,但如果你试图与他交谈,或向他展示一段带声音的视频,他会感到困惑。
Nemotron 3 Nano Omni 是英伟达(NVIDIA)推出的这位助手的新版本。这相当于给这位助手配上了一对耳朵和一台摄像机,同时教会他们以更快、更高效的方式处理信息。
以下是使用日常类比对该新模型独特之处的简明解析:
1. “全能”升级
在此之前,这位助手(Nemotron Nano V2)只能阅读文本和查看静态图片。新的Nemotron 3 Nano Omni是“全模态”的,用一种花哨的说法就是它能同时处理一切:文本、图像、视频和音频。
- 类比:把旧模型想象成一位只能读书的图书管理员。新模型则是一位既能读书、又能看电影、还能听播客,并能告诉你这些事物之间如何关联的图书管理员。
2. “大脑”与“感官”
该模型基于一个名为Nemotron 3 Nano 30B-A3B的高效“大脑”构建。这是一个“混合专家”(MoE)架构,就像一支专家团队,只有合适的专家会被唤醒来解决特定问题,从而节省能量。
- 感官:为了处理新的输入,他们附加了两个新的“传感器”:
- 视觉:一套高科技摄像系统(C-RADIOv4-H),用于查看图像和视频。
- 听觉:一只精密的“耳朵”(Parakeet-TDT),用于理解语音、音乐和环境声音。
3. 更聪明的观看与聆听方式
该论文强调了模型为避免被过多数据淹没而使用的三种巧妙技巧:
- 动态分辨率(灵活的镜头):模型不像旧方法那样将每张照片压缩成一个固定的微小方块(这会丢失细节),而是像相机变焦一样调整视角,以保持图像的自然形状。
- 视频压缩(延时摄影):在观看视频时,如果连续帧完全相同,模型不会查看每一帧。它使用"3D 卷积”技巧合并成对的帧,实际上将其需要处理的“帧”数量减少了一半。
- 音频片段(声音剪辑):它不是将长达 2 小时的播客作为一个巨大的噪音块来聆听,而是将音频切分为 30 秒的片段,使其更容易理解对话的流向。
4. “训练营”(它是如何学习的)
你不能只是插上摄像头就指望模型立即理解电影。团队采用了一种分阶段训练食谱,就像学生循序渐进地升学:
- 阶段 0-1:首先,他们教导模型同时理解图片和文本。
- 阶段 2-3:接着,他们教导它聆听音频并说话。
- 阶段 4-6:最后,他们将所有内容整合在一起。他们向模型输入了海量数据(超过 4660 亿个“词元”或单词),其中包括长文档、数小时的视频和复杂的对话。
- “强化学习”阶段:在初步训练之后,他们玩了一场“尝试、失败、成功”的游戏。他们向模型提出问题,检查它是否答对,并奖励其逻辑思考。这类似于教练与运动员一起回顾比赛录像,以改进他们的策略。
5. 速度与效率
该论文中最大的主张之一是,该模型的速度极快。
- 类比:如果其他类似规模的模型像是一辆容易陷入交通堵塞的跑车,那么 Nemotron 3 Nano Omni 就是一列高速列车。它使用特殊技术跳过不必要的步骤,使其能够比竞争对手更快地处理长视频和大型文档。
- 结果:在英伟达最新的芯片(B200)上,它在生成文本输出时比类似模型快3 到 9 倍,同时占用更少的内存。
6. 它实际能做什么(基于论文)
论文在该模型上测试了特定挑战,它在以下方面表现优异:
- 阅读文档:它比之前的版本更能理解复杂的图表、表格和长篇报告(如金融论文)。
- 理解视频:它可以观看带声音的长视频,并回答关于发生了什么、为何发生以及事件顺序的问题。
- 计算机控制:它可以查看电脑屏幕(GUI),并找出需要点击哪些按钮来完成任务(如预订航班或填写表格)。
- 语音交互:它可以进行对话,理解口音,并根据所听到的内容回答问题。
7. 向所有人开放
最后,论文宣布英伟达正在分享“蓝图”和“训练材料”。他们发布了不同尺寸的模型(标准版、压缩版和超压缩版),甚至分享了他们用于构建该模型的部分数据和代码。这就像将整个世界的食谱和食材都提供出来,以便其他科学家可以构建自己的版本或对其进行改进。
总结:Nemotron 3 Nano Omni 是一个更快、更智能、具备多感官能力的助手,能够同时阅读、观看和聆听,旨在处理漫长而复杂的任务而不会陷入困境。
技术摘要:Nemotron 3 Nano Omni
1. 问题陈述
多模态人工智能领域正在快速发展,然而现有模型在平衡效率、原生音频支持与长上下文推理方面仍面临重大挑战。以往的迭代版本往往将音频视为次要考虑,或依赖庞大且稠密的架构,导致推理延迟高且吞吐量受限。此外,处理包含音频的长视频和文档需要巨大的 token 数量,从而带来高昂的计算成本。因此,亟需一种全模态模型(文本、图像、视频、音频),能够:
- 在不降低性能的前提下,原生处理音频及其他模态。
- 在所有模态上保持高水平的推理能力。
- 实现卓越的推理效率(低延迟、高吞吐量),适用于现实世界的智能体应用。
- 支持超长上下文(高达 256K tokens),以应对复杂文档和视频分析。
2. 方法论
2.1 模型架构
Nemotron 3 Nano Omni 基于混合专家(MoE)混合骨干网络构建,具体采用Nemotron 3 Nano 30B-A3B(总参数量 30B,激活参数 3B)。该架构遵循编码器 - 投影器 - 解码器设计:
- LLM 骨干网络:30B-A3B MoE 模型提供核心推理与语言能力。
- 视觉编码器:采用高性能视觉基础模型C-RADIOv4-H1。
- 音频编码器:使用基于 FastConformer 的Parakeet-TDT-0.6B-v2编码器,用于语音与音频理解。
- 连接器:特定模态的多层感知机(MLP)投影器将视觉和音频 token 与 LLM 的嵌入空间对齐。
关键架构创新:
- 动态图像分辨率:以动态策略取代静态分块,保留原生宽高比,将图像分解为可变大小的 16×16 图块(1,024–13,312 个 token)。
- 时序视频压缩:引入基于Conv3D 的时序压缩,在 ViT 模块之前将每两个连续帧融合为单个“管状块(tubelet)”,将时序 token 数量减少2 倍。
- 音频 Tokenization:音频重采样至 16kHz,通过对数梅尔频谱图编码,并下采样至约 12.5 个 token/秒。
- 上下文长度:支持高达256K tokens,实现对长文档及扩展视频/音频流的分析。
2.2 训练策略
该模型采用多阶段课程学习方法,以确保稳定的跨模态对齐并防止灾难性遗忘:
- 阶段 0(视觉预热):仅训练视觉投影器(16k 上下文)。
- 阶段 1(视觉 SFT):利用高质量合成数据(Qwen3-VL, Kimi-K2.5)进行联合视觉 - 语言微调。
- 阶段 2(音频预热):使用 ASR 数据(Granary v1.1)训练音频投影器。
- 阶段 3(音频编码器与投影器):解冻音频编码器,针对声音、音乐和语音进行联合训练。
- 阶段 4(联合全模态 SFT 16k):在视觉、音频、视频和文本数据的混合集上进行全模型训练。
- 阶段 5(全模态 SFT 48k):将上下文扩展至 48k,重点强调长视频与推理数据。
- 阶段 6(全模态 SFT 256k):将上下文扩展至 256k,专注于超长文档与文本推理。
- 强化学习(RL):通过**混合偏好优化(MPO)和组序列策略优化(GSPO)**在文本、图像、视频和音频模态上进行后训练,以增强推理能力与安全性。
2.3 效率技术
- 高效视频采样(EVS):一种运行时剪枝机制,基于余弦差异丢弃冗余视频 token,进一步减少 ViT 之后的 token 数量。
- 量化:发布BF16、FP8和NVFP4(每权重有效 4.98 位)格式的模型,在最小化精度损失(中位数下降<1%)的同时实现显著的内存节省。
3. 主要贡献
- 原生全模态支持:Nemotron 系列中首个原生支持音频输入(与文本、图像和视频并列)的模型,实现了真正的跨模态推理。
- 最先进的效率:在 NVIDIA B200 GPU 上,其吞吐量比前代(Nemotron Nano V2 VL)高出3 倍,比 Qwen3-Omni 高出7.5 倍,同时保持低延迟。
- 先进的 Token 缩减:结合Conv3D 时序压缩与EVS,将视频输入 token 减少高达70%,大幅降低推理成本。
- 超长上下文:成功扩展至256K 上下文长度,在长文档理解和长视频理解方面优于前代模型。
- 开源发布:向社区提供模型检查点(BF16, FP8, FP4)、训练数据集(约 690 万样本)、数据流水线及代码(Megatron-Bridge, NeMo-RL)。
4. 结果
4.1 性能基准
Nemotron 3 Nano Omni 在多种模态上取得了领先或具有竞争力的结果:
- 文档与 OCR:在OCRBench-V2(88.3)、MMLongBench-DOC(46.1)和ChartQA(89.9)上表现顶尖。
- 视觉推理:在MMMU(55.2)、MathVista-Mini(71.9)和RefCOCO(80.6)上得分强劲。
- 音频与语音:在VoiceBench(平均 89.4)上超越 Qwen3-Omni,并在OpenASR结果(平均 5.95 WER)上具有竞争力。
- 全模态(视频 + 音频):在DailyOmni(74.5)和WorldSense(55.2)上领先,展现出卓越的时序与跨模态对齐能力。
- 文本推理:保留了基础 30B-A3B LLM 的强大推理能力(例如:MMLU-Pro:77.3,GPQA:72.2)。
4.2 效率指标
- 吞吐量:在单张 NVIDIA B200 上,多文档工作负载下达到5,000 输出 token/秒,单流低延迟模式下超过500 token/秒。
- 延迟:结合 Conv3D 和 EVS 后,首 token 时间(TTFT)减少了33%(从约 8 秒降至约 5.3 秒)。
- 量化:NVFP4版本将模型大小从 61.5 GB(BF16)缩减至20.9 GB,且精度下降可忽略不计。
5. 意义
Nemotron 3 Nano Omni 代表了高效、开源且面向智能体的多模态智能的重大飞跃。通过解决模型能力与推理成本之间的权衡,它实现了:
- 现实世界部署:高吞吐量与低延迟使其适用于实时智能体,如自主 GUI 控制器和语音助手。
- 长篇幅分析:256K 上下文与 Token 缩减技术使得分析整本书籍、财务报告及长达一小时的视频成为可能,且无内存瓶颈。
- 社区进步:开源检查点、数据及训练流水线,使业界能够获取最先进的全模态训练方案,推动高效多模态 AI 的进一步研究。
这项工作为开源全模态模型树立了新标准,证明了通过紧凑、高效的架构即可实现跨文本、视觉和音频的高性能推理。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。