← Últimos artigos
🤖 machine learning

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

Molt é um framework de código aberto, compacto e nativo de PyTorch, projetado para simplificar a pesquisa em aprendizado por reforço agêntico ao permitir modificações de algoritmos de ponta a ponta sem sacrificar o desempenho, oferecendo paridade estatística com as stacks de última geração baseadas em Megatron enquanto garante consistência de treinamento e clareza de código.

Autores originais: Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang, Hemil Desai, Michael Demoret, Pavlo Molchanov, Jan Kautz, Yi Dong

Publicado 2026-07-27
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang, Hemil Desai, Michael Demoret, Pavlo Molchanov, Jan Kautz, Yi Dong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde os computadores não apenas respondem perguntas, mas realmente partem em aventuras, resolvendo quebra-cabeças, escrevendo código e até jogando jogos para aprender a serem mais inteligentes. Esta é a fronteira emocionante do Aprendizado por Reforço Agêntico (Agentic Reinforcement Learning). Pense nisso como treinar um personagem de videogame não dando a ele um roteiro, mas deixando-o jogar o jogo, cometer erros e aprender com as recompensas que recebe. O objetivo é construir agentes de IA que possam pensar por si mesmos, usar ferramentas e lidar com tarefas complexas de múltiplas etapas.

No entanto, construir esses agentes inteligentes é atualmente um pouco como tentar consertar um carro de corrida enquanto ele está dirigindo a 200 milhas por hora. As ferramentas de software que os pesquisadores usam para treinar esses agentes são massivas, complicadas e construídas para enormes fábricas de escala industrial. Se um pesquisador quiser testar uma nova ideia — como mudar a forma como o agente aprende com um erro — ele muitas vezes tem que escavar camadas de código confuso, como se estivesse desembaraçando um enorme novelo de lã. Isso torna o processo lento e frustrante para experimentar. A grande questão é: Podemos construir um sistema de treinamento que seja rápido e poderoso o suficiente para os maiores supercomputadores, mas também simples e limpo o suficiente para um único pesquisador entender e alterar em uma tarde?

Este artigo apresenta o Molt, um novo framework de treinamento projetado para resolver exatamente esse problema. Os autores, uma equipe da NVIDIA, argumentam que você não precisa de uma máquina massiva e complexa para treinar IAs poderosas; você só precisa de uma mais limpa e legível. Eles construíram o Molt para ser um framework "nativo de PyTorch", o que significa que ele fala a mesma língua das ferramentas de codificação de IA mais populares, mantendo tudo em um só lugar.

O principal achado do artigo é que o Molt é incrivelmente eficiente. Ele é pequeno o suficiente para que um pesquisador humano (ou até mesmo um assistente de codificação de IA) possa ler todo o código-fonte e entender como o agente aprende do início ao fim. Apesar de ser muito menor e mais simples do que outros sistemas, os autores mediram seu desempenho e descobriram que ele é estatisticamente comparável aos sistemas mais avançados e pesados usados hoje. Em um teste direto, o Molt treinou um modelo de IA tão rápido quanto um concorrente complexo, provando que você não precisa sacrificar a velocidade pela simplicidade.

O artigo argumenta explicitamente contra a ideia de que a complexidade "hiperscale" é necessária para uma boa pesquisa. Eles rejeitam a noção de que os pesquisadores devem herdar milhares de linhas de código confuso apenas para realizar um experimento. Em vez disso, eles mostram que, ao manter o código limpo e focado no algoritmo central, você pode alcançar os mesmos resultados. Eles também refutam a ideia de que o "token drift" (onde o computador gera uma palavra, mas depois conta uma versão diferente dela durante o treinamento) é aceitável; o Molt garante que a IA seja treinada exatamente nos mesmos tokens que ela gerou, evitando erros ocultos.

Em resumo, o Molt é um loop de treinamento "enxuto" que permite aos pesquisadores agir rápido sem quebrar as coisas. Ele utiliza uma configuração inteligente onde a IA gera respostas, envia-as através de uma fila simples e treina imediatamente, tudo isso enquanto mantém um registro perfeito de cada etapa. Os autores mediram isso em um modelo massivo de 35 bilhões de parâmetros e até mostraram que funciona em um modelo de 700 bilhões de parâmetros, sugerindo que essa abordagem simples pode escalar para os maiores desafios da IA sem precisar se tornar complicada.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →