← Últimos artigos
💬 NLP

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing

O UltraX é um framework de chamada de função que aprimora o refinamento de dados de pré-treinamento em larga escala ao introduzir edição programática adaptativa com capacidades de inserção, exclusão e modificação, superando assim as limitações de eficiência e confiabilidade das abordagens existentes baseadas em regras e em LLMs para alcançar eficiência de dados e desempenho de modelo superiores.

Autores originais: Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

Publicado 2026-07-10
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô superinteligente a falar como um humano. Por muito tempo, o ingrediente secreto era apenas mais dados. Você jogava uma montanha de livros, sites e artigos sobre o robô, esperando que ele aprendesse tudo pelo puro volume. Mas agora, batemos em um muro. Raspamos quase todos os bits úteis de texto da internet. A regra do "mais é melhor" está começando a perder força, como uma bateria ficando sem carga.

Então, o que fazemos? Paramos de acumular e começamos a limpar.

Conheça o UltraX, uma nova ferramenta projetada para agir como um editor microscópico e superveloz para os livros de treinamento do robô. Mas aqui está o toque especial: em vez de apenas deletar frases ruins ou reescrever parágrafos inteiros (o que é lento e arriscado), o UltraX usa um truque inteligente chamado chamada de função (function calling).

O "Mestre de Lego" vs. A "Equipe de Demolição"

Pense nos métodos antigos de limpeza de dados como uma equipe de demolição.

  • Métodos baseados em regras são como trabalhadores com um martelo e uma lista de verificação. Eles destroem qualquer coisa que pareça um anúncio ou um símbolo estranho. Mas eles são desajeitados; às vezes derrubam uma escultura bela (informação valiosa) só porque ela parecia um pouco com uma pilha de tijolos.
  • Grandes editores de IA são como artistas que reescrevem toda a história para torná-la perfeita. Mas eles são lentos, caros e, às vezes, mudam tanto o enredo que a história deixa de fazer sentido.

O UltraX é diferente. Ele é como um mestre de Lego com um conjunto específico de ferramentas. Em vez de reescrever o livro inteiro, ele dá ao robô uma pequena lista de instruções:

  1. Delete esta linha específica de lixo (como um anúncio).
  2. Substitua este erro de digitação estranho pela palavra correta.
  3. Insira uma peça de informação que falta e que se perdeu na bagunça.

O artigo argumenta explicitamente contra a ideia de que você precisa reescrever textos inteiros para consertá-los. Ele mostra que apenas deletar coisas (como outras ferramentas fazem) não é suficiente porque você pode acabar jogando fora coisas boas por acidente. Também argumenta que tentar gerar parágrafos inteiros novos é muito lento e pouco confiável para a escala massiva de dados necessária para treinar esses robôs. O UltraX prova que edições precisas e cirúrgicas são a chave.

Como Funciona: A "Receita" e o "Chef"

O processo acontece em dois atos principais:

Ato 1: O Treinamento (Ensinando o Chef)
Primeiro, os pesquisadores precisavam ensinar seu pequeno modelo "refinador" a ser um bom editor. Eles não apenas adivinharam; eles usaram um "chef inteligente" (uma IA poderosa) para escrever versões perfeitas e limpas de páginas da web bagunçadas. Então, usaram um truque de mapeamento especial para transformar essas versões limpas em uma receita de instruções (como "remova a linha 5", "corrija a palavra 12"). Eles filtraram as receitas confusas e ensinaram seu pequeno modelo a seguir essas instruções perfeitamente.

Ato 2: A Limpeza (A Escala)
Agora, eles pegam esse "refinador" treinado e o soltam em bilhões de páginas da web. Ele lê um trecho de texto, prevê a lista exata de movimentos de Lego necessários para consertá-lo e, então, um programa de computador executa esses movimentos instantaneamente. Como o modelo só precisa gerar uma lista curta de comandos (como "deletar linha 3") em vez de escrever uma história inteira nova, ele é incrivelmente rápido e não se cansa.

Os Resultados: Mais Rápido, Mais Inteligente e Mais Eficiente

Os pesquisadores testaram isso treinando um robô de 1 bilhão de parâmetros do zero usando diferentes tipos de dados limpos. Aqui está o que eles descobriram:

  • Melhores Pontuações: Em um teste de 10 habilidades diferentes (como responder perguntas de ciências ou entender piadas), o robô treinado com dados do UltraX obteve pontuações mais altas do que robôs treinados com dados brutos ou dados limpos por outros métodos. De fato, o UltraX foi o melhor desempenho em todos os cinco tipos diferentes de dados da internet que eles testaram.
  • O Impulso de "2%": Em vários conjuntos de dados, o UltraX deu uma melhoria relativa de mais de 2%. No mundo da IA, esse é um salto enorme.
  • Fazer Mais com Menos: Esta é a parte mais legal. O robô treinado com o UltraX atingiu o mesmo nível de alto desempenho usando menos tokens de treinamento (menos palavras) do que os outros. Isso sugere que o UltraX torna os dados "mais densos" com informações úteis, para que o robô aprenda mais rápido.

O Que Eles Não Fizeram (E o Que Não Têm Certeza)

É importante conhecer os limites desta história. O artigo não afirma que isso resolve tudo para sempre.

  • Eles testaram isso apenas em dados da web em inglês. Eles admitem que ainda não tentaram isso em chinês ou outros idiomas, onde o "ruído" pode parecer totalmente diferente.
  • Eles treinaram um modelo de 1 bilhão de parâmetros. Eles ainda não provaram se isso funciona exatamente da mesma forma em modelos massivos de trilhões de parâmetros que estão por vir.
  • Eles sugerem que os ganhos vêm do equilíbrio entre a remoção de ruído e a manutenção de boas informações, mas não afirmam ter uma fórmula perfeita para cada tipo de bagunça da internet.

A Conclusão

O UltraX sugere que o futuro de ensinar IA não é encontrar mais dados, mas sim ser mais inteligente com os dados que já temos. Ao usar uma abordagem precisa, baseada em instruções, que pode deletar, corrigir e inserir partes específicas de um texto, ele limpa a biblioteca do robô de forma mais rápida e melhor do que os métodos antigos. É uma mudança de "jogar tudo contra a parede" para "remover cirurgicamente o lixo", e os resultados mostram que uma limpeza inteligente e estratégica vai longe.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →