← Últimos artigos
💬 NLP

Spokes: Optimizing for Diverse Pretraining Data Selection

O artigo introduz o SPOKES, um framework de diversificação probabilística que otimiza diretamente a diversidade de dados usando o escore G-Vendi e o gradiente descendente exponencializado, demonstrando que a seleção conjunta de dados de pré-treinamento para qualidade e diversidade supera significativamente os baselines existentes e a amostragem aleatória no desempenho downstream.

Autores originais: Clarence Lee, Yejin Choi, Luke Zettlemoyer, Pang Wei Koh, Hai Leong Chieu

Publicado 2026-06-16
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Clarence Lee, Yejin Choi, Luke Zettlemoyer, Pang Wei Koh, Hai Leong Chieu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um chef tentando criar um banquete perfeito e massivo (um modelo de IA pré-treinado) usando uma quantidade limitada de ingredientes (dados). Você tem um armazém cheio de milhões de receitas, mas só pode cozinhar com um número específico delas.

A grande questão é: Quais receitas você deve escolher?

A maioria dos chefs (pesquisadores de IA) tem duas formas principais de escolher:

  1. Pegar um punhado ao acaso: Você pode obter uma boa mistura, mas pode acabar pegando acidentalmente 50 receitas que têm exatamente o mesmo gosto de "frango apimentado". Isso é entediante e repetitivo.
  2. Escolher apenas as receitas "melhores" avaliadas: Você filtra as ruins, mas pode acabar com 50 receitas que são todas "alta gastronomia francesa". Você perde a variedade. Faltará comida de rua, sobremesas ou sopas. Falta diversidade.

Este artigo apresenta uma nova ferramenta chamada SPOKES (que significa um método para otimizar a diversidade de dados). Veja como funciona, explicado de forma simples:

O Problema: "Diversidade" é Difícil de Medir

Os autores dizem que a "diversidade" é como os raios de uma roda. Se todos os raios estiverem agrupados em um único ponto, a roda ficará desequilibrada e não rolará bem. Você quer que os raios (seus dados) estejam espalhados uniformemente por todo o círculo.

O problema é que você não consegue olhar para apenas uma receita para ver se ela é diversa. Você tem que olhar como cada receita interage com cada outra receita. Se você tentar verificar todas as combinações possíveis de receitas para encontrar a roda perfeita, levaria mais tempo do que a existência do universo. É difícil demais de calcular.

A Solução: SPOKES

Em vez de adivinhar ou usar regras simples (como "agrupar por tópico"), o SPOKES usa um truque matemático inteligente para otimizar diretamente a diversidade.

1. A Bússola de "Gradiente"
Em vez de apenas ler o texto das receitas (o que é como olhar para a capa de um livro), o SPOKES observa como a receita muda o cérebro do chef. Em termos de IA, isso é chamado de "gradiente".

  • Imagine duas receitas: uma de bolo e uma de pizza.
  • Se você ensinar a receita do bolo ao chef, o cérebro dele se desloca em uma direção.
  • Se você ensinar a receita da pizza, o cérebro dele se desloca em uma direção completamente diferente.
  • O SPOKES mede esses "deslocamentos cerebrais". Ele quer escolher receitas que empurrem o cérebro do chef em tantas direções diferentes quanto possível, garantindo que o chef aprenda uma ampla gama de habilidades.

2. A Analogia dos "Raios" (Spokes)
O método trata os dados como os raios de uma roda. Ele usa uma pontuação matemática chamada escore G-Vendi para medir o quão uniformemente os raios estão espalhados.

  • Amostragem Aleatória: Os raios são bagunçados e agrupados.
  • SPOKES: Ele rearranja os raios para que fiquem perfeitamente espaçados, como uma roda de bicicleta perfeita.

3. O Equilíbrio entre "Qualidade" e "Diversidade"
Às vezes, você quer apenas as receitas de maior qualidade (Filtragem de Qualidade). Às vezes, você quer a maior variedade possível (Diversidade). O SPOKES permite que você misture esses dois objetivos.

  • Você pode dizer ao SPOKES: "Eu quero 90% de variedade e 10% de qualidade", ou "Eu quero um equilíbrio perfeito de ambos".
  • O artigo descobriu que os melhores resultados vieram de equilibrar ambos. É como ter um menu que possui tanto os pratos mais bem avaliados quanto uma enorme variedade de culinárias, em vez de apenas os melhores pratos franceses.

O Que Eles Descobriram?

Os autores testaram isso em duas "bibliotecas" massivas de textos da internet (chamadas DCLM e FineWeb).

  • Melhor Variedade: Quando usaram o SPOKES para selecionar 500.000 documentos, a "pontuação de diversidade" saltou 489 pontos em comparação com a escolha aleatória. Métodos existentes (como apenas remover duplicatas) conseguiram apenas um salto ínfimo de 7 pontos.
  • IA Mais Inteligente: Quando treinaram um modelo de IA pequeno (LLaMA-1B) com os dados selecionados pelo SPOKES, o modelo ficou mais inteligente.
    • No conjunto de dados DCLM, o desempenho melhorou em 1,5 pontos.
    • No conjunto de dados FineWeb, o desempenho melhorou em 1,4 pontos.
  • A Surpresa: Mesmo quando o SPOKES escolheu dados que tinham pontuações de "qualidade" ligeiramente menores (de acordo com filtros padrão), a IA teve um desempenho melhor. Isso prova que a variedade é tão importante quanto a qualidade. Um conjunto diverso de receitas "razoáveis" ensinou mais ao chef do que um conjunto de receitas "perfeitas", porém repetitivas.

A Conclusão

O SPOKES é uma nova maneira de selecionar dados de treinamento para IA. Em vez de apenas escolher os dados "melhores" ou "aleatórios", ele garante matematicamente que os dados estejam espalhados como os raios de uma roda. Isso cria um modelo de IA mais equilibrado, diverso e, consequentemente, mais inteligente, mesmo quando você tem uma quantidade limitada de dados para trabalhar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →