Compute Optimal Tokenization
Este artigo demonstra que, em configurações de modelos de linguagem otimizadas para computação, a contagem de parâmetros escala proporcionalmente ao tamanho dos dados medido em bytes e não em tokens, revelando que a taxa de compressão de tokens ótima difere do BPE padrão e diminui à medida que a computação aumenta.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está construindo a biblioteca definitiva de conhecimento. Você tem uma quantia fixa de dinheiro (seu orçamento de computação) para construir essa biblioteca. Você tem duas escolhas principais:
- Comprar um prédio massivo com milhões de prateleiras vazias (Tamanho do Modelo).
- Comprar uma enorme pilha de livros para preencher essas prateleiras (Dados de Treinamento).
Por anos, especialistas disseram aos bibliotecários: "Para obter a melhor biblioteca, compre 20 livros para cada prateleira que você construir." Mas esse conselho tinha um defeito oculto: assumia que todos os livros tinham o mesmo tamanho. Na realidade, alguns livros são enciclopédias grossas, enquanto outros são panfletos finos.
Este artigo, intitulado "Tokenização Otimizada por Computação", argumenta que temos medido nossos livros na unidade errada. Em vez de contar "livros" (tokens), devemos contar "páginas" (bytes).
Aqui está a análise de suas descobertas usando analogias simples:
1. O Problema do "Tamanho do Livro" (Taxa de Compressão)
No mundo da IA, o texto é dividido em pedaços chamados tokens.
- Baixa Compressão: Imagine cortar uma frase em letras individuais. Você obtém uma enorme pilha de retalhos minúsculos (muitos tokens).
- Alta Compressão: Imagine agrupar palavras inteiras ou até frases em pedaços únicos. Você obtém uma pilha menor de pedaços grandes (menos tokens).
O artigo pergunta: Importa o tamanho dos nossos pedaços?
A resposta é sim. O tamanho do pedaço (chamado de taxa de compressão) altera a eficiência com que podemos construir nossa biblioteca.
2. Encontrando o Ponto Ideal: A Regra "Bytes vs. Tokens"
Os pesquisadores treinaram quase 1.000 modelos de IA diferentes, ajustando o tamanho dos pedaços e o tamanho do modelo. Eles descobriram uma nova regra para o equilíbrio perfeito:
- A Velha Regra: "Compre 20 tokens por parâmetro." (Isso só funciona se seus tokens tiverem um tamanho específico, como os tokens BPE padrão).
- A Nova Regra: "Compre 60 bytes de texto por parâmetro."
A Analogia:
Pense no seu modelo de IA como um chef e nos dados como ingredientes.
- Se você der ao chef ingredientes pré-picados minúsculos (alta compressão), ele pode cozinhar muitas refeições rapidamente.
- Se você der a ele vegetais inteiros (baixa compressão), ele terá que picá-los primeiro, o que leva tempo.
- O artigo descobriu que, não importa como você pica os vegetais, o chef se sai melhor quando tem um peso específico de ingredientes (60 bytes) para cada unidade de sua habilidade (parâmetro). Não importa se esse peso são 20 pedaços grandes ou 100 migalhas minúsculas; o que importa é o peso total.
3. A Taxa de Compressão "Dourada" (Goldilocks)
Você pode pensar: "Se eu fizer os pedaços maiores, economizo mais tempo, então devo torná-los o maiores possíveis!"
O artigo diz: Não tão rápido.
Eles descobriram que existe uma zona Dourada para o tamanho dos pedaços.
- Muito pequeno: O modelo fica sobrecarregado com muitos pedaços minúsculos de dados.
- Muito grande: O modelo perde muitos detalhes porque os pedaços são muito grosseiros.
- Justo na medida: Existe uma taxa de compressão específica que produz o modelo mais inteligente para um determinado orçamento.
A Reviravolta: À medida que você obtém mais dinheiro (mais poder de computação), o tamanho "Justo na medida" na verdade fica menor.
- Analogia: Se você tem uma cozinha pequena, pode querer vegetais pré-picados para economizar tempo. Mas se você tem uma cozinha profissional massiva com equipe ilimitada, pode preferir vegetais inteiros porque pode processá-los com tanta eficiência que o detalhe extra vale o esforço.
4. Um Tamanho Não Serve para Todos (A Língua Importa)
Os pesquisadores testaram isso em diferentes idiomas (inglês, hindi, árabe, russo, etc.). Eles descobriram que o tamanho "Justo na medida" do pedaço depende do idioma.
- A Analogia: Imagine fazer malas para viagens diferentes.
- Para uma viagem a um país onde as pessoas falam uma língua com palavras muito compactas (como o inglês), você pode empacotar itens ligeiramente maiores.
- Para uma viagem a um país onde as palavras são mais longas ou usam scripts diferentes (como hindi ou árabe), a maneira "ótima" de empacotar muda.
- O artigo descobriu que ferramentas populares de IA (como Llama 3 ou Qwen) frequentemente usam um método de empacotamento "tamanho único". Isso funciona razoavelmente bem para o inglês, mas muitas vezes está demais comprimido para alguns idiomas e pouco comprimido para outros. Eles estão essencialmente empacotando itens do tamanho errado para a viagem específica.
Resumo das Principais Conclusões
- Pare de contar tokens, comece a contar bytes. Ao planejar quanto dados alimentar uma IA, meça o tamanho bruto do texto (bytes), não o número de pedaços (tokens). A proporção deve ser de aproximadamente 60 bytes de texto para cada 1 milhão de parâmetros no modelo.
- Existe um tamanho de pedaço perfeito. Tornar os tokens muito grandes ou muito pequenos prejudica o desempenho. Existe um "ponto ideal" específico para a compressão.
- O ponto ideal muda. À medida que você obtém computadores mais poderosos, você deve na verdade usar pedaços ligeiramente menores (compressão menor) para obter os melhores resultados.
- A língua importa. O tamanho de pedaço perfeito é diferente para o hindi do que para o inglês. Os modelos de IA atuais frequentemente usam uma configuração genérica que não é ótima para todos os idiomas.
Em resumo: Para construir a IA mais inteligente possível, não siga apenas a antiga regra de "20 tokens por parâmetro". Em vez disso, combine o peso do texto com o tamanho do cérebro e ajuste o tamanho dos pedaços de texto com base na quantidade de poder de computação que você tem e em qual idioma você está ensinando a ela.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.