← Últimos artigos
🤖 machine learning

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

Nemotron 3 Nano Omni é um novo modelo multimodal de código aberto que suporta nativamente entradas de áudio, texto, imagem e vídeo, oferecendo maior precisão, capacidades agênticas e inferência eficiente por meio de uma arquitetura base 30B-A3B e técnicas de redução de tokens, com checkpoints e código disponibilizados para apoiar pesquisas futuras.

Autores originais: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg
Publicado 2026-04-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taheri, Ilia Karmanov, Guilin Liu, Jarno Seppanen, Arushi Goel, Mike Ranzinger, Greg Heinrich, Guo Chen, Lukas Voegtle, Philipp Fischer, Timo Roman, Karan Sapra, Collin McCarthy, Shaokun Zhang, Fuxiao Liu, Hanrong Ye, Yi Dong, Mingjie Liu, Yifan Peng, Piotr Zelasko, Zhehuai Chen, Nithin Rao Koluguri, Nune Tadevosyan, Lilit Grigoryan, Ehsan Hosseini Asl, Pritam Biswas, Leili Tavabi, Yuanhang Su, Zhiding Yu, Peter Jin, Alexandre Milesi, Netanel Haber, Yao Xu, Sarah Amiraslani, Nabin Mulepati, Eric Tramel, Jaehun Jung, Ximing Lu, Brandon Cui, Jin Xu, Zhiqi Li, Shihao Wang, Yuanguo Kuang, Shaokun Zhang, Huck Yang, Boyi Li, Hongxu Yin, Song Han, Pavlo Molchanov, Adi Renduchintala, Charles Wang, David Mosallanezhad, Soumye Singhal, Luis Vega, Katherine Cheung, Sreyan Ghosh, Yian Zhang, Alexander Bukharin, Venkat Srinivasan, Johnny Greco, Andre Manoel, Maarten Van Segbroeck, Suseella Panguliri, Rohit Watve, Divyanshu Kakwani, Shubham Pachori, Jeffrey Glick, Radha Sri-Tharan, Aileen Zaman, Khanh Nguyen, Shi Chen, Jiaheng Fang, Qing Miao, Wenfei Zhou, Yu Wang, Zaid Pervaiz Bhat, Varun Praveen, Arihant Jain, Ramanathan Arunachalam, Tomasz Kornuta, Ashton Sharabiani, Amy Shen, Wei Huang, Yi-Fu Wu, Ali Roshan Ghias, Huiying Li, Brian Yu, Nima Tajbakhsh, Chen Cui, Wenwen Gao, Li Ding, Terry Kong, Manoj Kilaru, Anahita Bhiwandiwalla, Marek Wawrzos, Daniel Korzekwa, Pablo Ribalta, Grzegorz Chlebus, Besmira Nushi, Ewa Dobrowolska, Maciej Jakub Mikulski, Kunal Dhawan, Steve Huang, Jagadeesh Balam, Yongqiang Wang, Nikolay Karpov, Valentin Mendelev, George Zelenfroynd, Meline Mkrtchyan, Qing Miao, Omri Almog, Bhavesh Pawar, Rameshwar Shivbhakta, Sudeep Sabnis, Ashrton Sharabiani, Negar Habibi, Geethapriya Venkataramani, Pamela Peng, Prerit Rodney, Serge Panev, Richard Mazzarese, Nicky Liu, Michael Fukuyama, Andrii Skliar, Roger Waleffe, Duncan Riach, Yunheng Zou, Jian Hu, Hao Zhang, Binfeng Xu, Yuhao Yang, Zuhair Ahmed, Alexandre Milesi, Carlo del Mundo, Chad Voegele, Zhiyu Cheng, Nave Assaf, Andrii Skliar, Daniel Afrimi, Natan Bagrov, Ran Zilberstein, Ofri Masad, Eugene Khvedchenia, Natan Bagrov, Borys Tymchenko, Tomer Asida, Daniel Afrimi, Parth Mannan, Victor Cui, Michael Evans, Katherine Luna, Jie Lou, Pinky Xu, Guyue Huang, Negar Habibi, Michael Boone, Pradeep Thalasta, Adeola Adesoba, Dina Yared, Christopher Parisien, Leon Derczynski, Shaona Ghosh, Wes Feely, Micah Schaffer, Radha Sri-Tharan, Jeffrey Glick, Barnaby Simkin, George Zelenfroynd, Tomasz Grzegorzek, Rishabh Garg, Aastha Jhunjhunwala, Sergei Kolchenko, Farzan Memarian, Haran Kumar, Shiv Kumar, Isabel Hulseman, Anjali Shah, Kari Briski, Padmavathy Subramanian, Joey Conway, Udi Karpas, Jane Polak Scowcroft, Annie Surla, Shilpa Ammireddy, Ellie Evans, Jesse Oliver, Tom Balough, Chia-Chih Chen, Sandip Bhaskar, Alejandra Rico, Bardiya Sadeghi, Seph Mard, Katherine Cheung, Meredith Price, Laya Sleiman, Saori Kaji, Wesley Helmholz, Wendy Quan, Michael Lightstone, Jonathan Cohen, Jian Zhang, Oleksii Kuchaiev, Boris Ginsburg, Jan Kautz, Eileen Long, Mohammad Shoeybi, Mostofa Patwary, Oluwatobi Olabiyi, Andrew Tao, Bryan Catanzaro, Udi Karpas

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um assistente superinteligente que passou a vida inteira lendo livros e olhando para imagens. Ele é brilhante com texto e imagens, mas, se você tentasse conversar com ele ou mostrar um vídeo com som, ele ficaria confuso.

Nemotron 3 Nano Omni é a nova versão desse assistente da NVIDIA. É como dar a esse assistente um par de orelhas e uma câmera de vídeo, enquanto também se ensina a ele a processar informações muito mais rápido e com maior eficiência.

Aqui está uma explicação simples do que torna este novo modelo especial, usando analogias do dia a dia:

1. A Atualização "Tudo-em-Um"

Antes disso, o assistente (Nemotron Nano V2) só podia ler texto e olhar para imagens estáticas. O novo Nemotron 3 Nano Omni é "omnimodal", o que é uma maneira rebuscada de dizer que ele consegue lidar com tudo ao mesmo tempo: texto, imagens, vídeo e áudio.

  • A Analogia: Pense no modelo antigo como um bibliotecário que só pode ler livros. O novo modelo é um bibliotecário que pode ler livros, assistir filmes, ouvir podcasts e, em seguida, dizer como todas essas coisas se conectam.

2. O "Cérebro" e os "Sentidos"

O modelo é construído sobre um cérebro muito eficiente chamado Nemotron 3 Nano 30B-A3B. Este cérebro é uma "Mistura de Especialistas" (MoE), que é como uma equipe de especialistas onde apenas os especialistas certos acordam para resolver um problema específico, economizando energia.

  • Os Sentidos: Para lidar com as novas entradas, foram anexados dois novos "sensores":
    • Visão: Um sistema de câmera de alta tecnologia (C-RADIOv4-H) que observa imagens e vídeos.
    • Audição: Um ouvido sofisticado (Parakeet-TDT) que entende fala, música e sons ambientais.

3. Maneiras Mais Inteligentes de Olhar e Ouvir

O artigo destaca três truques inteligentes que o modelo usa para não ficar sobrecarregado com muitos dados:

  • Resolução Dinâmica (A Lente Flexível): Em vez de espremer cada foto em um quadrado fixo e minúsculo (o que perde detalhes), o modelo ajusta sua visão como uma câmera fazendo zoom para dentro ou para fora para manter a forma natural da imagem.
  • Compressão de Vídeo (O Time-Lapse): Ao assistir a um vídeo, o modelo não observa cada quadro individual se forem idênticos. Ele usa um truque de "Convolução 3D" para fundir pares de quadros, efetivamente reduzindo pela metade o número de "quadros" que precisa processar.
  • Fragmentos de Áudio (A Pílula Sonora): Em vez de ouvir um podcast de 2 horas como um bloco gigante de ruído, ele divide o áudio em clipes de 30 segundos, tornando mais fácil entender o fluxo da conversa.

4. O "Campo de Treinamento" (Como ele Aprendeu)

Você não pode apenas conectar uma câmera e esperar que o modelo entenda filmes imediatamente. A equipe usou uma receita de treinamento em etapas, como um aluno progredindo na escola:

  • Etapa 0-1: Primeiro, eles ensinaram o modelo a entender imagens e texto juntos.
  • Etapa 2-3: Em seguida, ensinaram-no a ouvir áudio e falar.
  • Etapa 4-6: Finalmente, eles juntaram tudo. Alimentaram-no com quantidades massivas de dados (mais de 466 bilhões de "tokens" ou palavras) que incluíam documentos longos, horas de vídeo e conversas complexas.
  • Fase de "Aprendizado por Reforço": Após o treinamento inicial, eles jogaram um jogo de "Tentar, Falhar, Sucesso". Deram problemas ao modelo, verificaram se ele acertou a resposta e recompensaram-no por pensar logicamente. Isso é semelhante a um treinador revisando gravações de jogos com um atleta para melhorar sua estratégia.

5. Velocidade e Eficiência

Uma das maiores alegações no artigo é que este modelo é incrivelmente rápido.

  • A Analogia: Se outros modelos de tamanho semelhante são como um carro esportivo que fica preso no trânsito, o Nemotron 3 Nano Omni é um trem de alta velocidade. Ele usa técnicas especiais para pular etapas desnecessárias, permitindo que processe vídeos longos e documentos enormes muito mais rápido do que seus concorrentes.
  • O Resultado: Nos chips mais recentes da NVIDIA (B200), ele pode produzir saída de texto 3 a 9 vezes mais rápido do que modelos semelhantes, usando menos memória.

6. O Que Ele Realmente Faz (Baseado no Artigo)

O artigo testou este modelo em desafios específicos, e ele se saiu muito bem em:

  • Leitura de Documentos: Ele consegue entender gráficos complexos, tabelas e relatórios longos (como documentos financeiros) melhor do que versões anteriores.
  • Compreensão de Vídeos: Ele pode assistir a um vídeo longo com som e responder perguntas sobre o que aconteceu, por que aconteceu e a ordem dos eventos.
  • Controle de Computador: Ele pode olhar para uma tela de computador (GUI) e descobrir quais botões clicar para concluir uma tarefa (como reservar um voo ou preencher um formulário).
  • Interação por Voz: Ele pode manter uma conversa, entender sotaques e responder perguntas com base no que ouve.

7. Aberto para Todos

Finalmente, o artigo anuncia que a NVIDIA está compartilhando os "projetos" e os "materiais de treinamento". Eles estão lançando o modelo em diferentes tamanhos (padrão, comprimido e ultra-comprimido) e até compartilhando alguns dos dados e códigos que usaram para construí-lo. Isso é como dar a receita e os ingredientes para o mundo inteiro, para que outros cientistas possam construir suas próprias versões ou melhorá-las.

Em resumo: O Nemotron 3 Nano Omni é um assistente mais rápido, mais inteligente e multissensorial que pode ler, assistir e ouvir simultaneamente, projetado para lidar com tarefas longas e complexas sem ficar sobrecarregado.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →