← Últimos artigos
💬 NLP

Tokenisation via Convex Relaxations

Este artigo apresenta o ConvexTok, um algoritmo de tokenização inovador que formula a construção de vocabulário como um programa linear solucionável por meio de otimização convexa, superando assim os métodos gananciosos tradicionais em métricas intrínsecas e eficiência de modelos de linguagem, ao mesmo tempo que fornece um limite certificado de sua proximidade à otimalidade.

Autores originais: Jan Tempus, Philip Whittington, Craig W. Schmidt, Dennis Komm, Tiago Pimentel

Publicado 2026-05-22
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jan Tempus, Philip Whittington, Craig W. Schmidt, Dennis Komm, Tiago Pimentel

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: Encaixotar uma Mala

Imagine que você está tentando encaixotar uma biblioteca massiva de livros em uma única mala (a memória do computador) para enviá-la a um amigo. Para fazer isso de forma eficiente, você precisa de um tokenizador.

No mundo da IA, um tokenizador é como um conjunto de carimbos personalizados. Em vez de enviar cada letra individual de cada livro (o que é lento e volumoso), o tokenizador agrupa letras em "blocos" ou "tokens" (como palavras inteiras ou frases comuns) e envia esses em vez disso. O objetivo é tornar a mala o menor possível (alta compressão) enquanto ainda é possível reconstruir os livros perfeitamente quando chegarem.

O Problema: O Empacotador "Avarento"

Atualmente, a maioria dos modelos de IA usa um método chamado BPE (Codificação de Pares de Bytes). Pense no BPE como um empacotador avarento.

  • Como funciona: O empacotador olha para os livros, encontra as duas letras mais comuns que aparecem uma ao lado da outra (como "t" e "h"), cola-as juntas em um novo carimbo ("th") e repete esse processo uma e outra vez.
  • O defeito: Como o empacotador só olha para o próximo passo imediato (localmente ótimo), ele pode colar duas letras que parecem úteis agora, mas acabam criando uma forma estranha e ineficiente mais tarde que não se encaixa bem na mala. Eles tomam uma série de pequenas decisões boas que levam a um resultado geral ruim. Eles nunca dão um passo atrás para ver a "visão geral".

A Solução: A Abordagem do "Arquiteto" (ConvexTok)

Os autores deste artigo, Jan Tempus e colegas, decidiram parar de usar o empacotador avarento. Em vez disso, eles construíram um Arquiteto.

Eles perceberam que encontrar a maneira perfeita de encaixotar a mala é um problema matemático tão difícil que os computadores geralmente desistem dele (é "NP-difícil"). No entanto, eles encontraram um truque inteligente: Relaxação Convexa.

  • A Analogia: Imagine tentar encontrar o ponto mais baixo em uma cadeia de montanhas para construir uma casa. O empacotador avarento apenas caminha morro abaixo até atingir um pequeno vale e para ali, pensando que é o fundo.
  • O Truque do Arquiteto: Os autores suavizaram as montanhas acidentadas em uma tigela perfeita e lisa (uma forma "convexa"). Nessa tigela lisa, é matematicamente fácil encontrar o ponto absolutamente mais baixo.
  • O Resultado: Eles resolveram essa versão suave e fácil do problema usando uma ferramenta chamada Programação Linear (PL). Isso lhes deu um "projeto" para a embalagem perfeita.

O Obstáculo: Do Projeto à Realidade

O projeto que eles obtiveram da tigela lisa tinha um problema: sugeria o uso de "meios-carimbos". Por exemplo, poderia dizer: "Use 0,7 do carimbo 'th' e 0,3 do carimbo 'ing'". Você não pode realmente imprimir um meio-carimbo.

Para corrigir isso, eles inventaram três maneiras de arredondar esses números para carimbos inteiros (como arredondar 0,7 para cima até 1):

  1. Determinístico (Det): Basta escolher os KK principais carimbos com as maiores pontuações.
  2. Viciado (Bias): Escolha carimbos que sejam curtos e eficientes, mesmo que sua pontuação seja ligeiramente menor.
  3. Integral (Int): Escolha apenas carimbos dos quais o projeto tinha 99% de certeza.

O Que Eles Encontraram (Os Resultados)

A equipe testou seu novo método ConvexTok contra o método BPE avarento padrão. Eis o que aconteceu:

  1. Melhor Embalagem: As malas do ConvexTok foram consistentemente menores (melhor compressão) do que as malas do BPE. Isso significa que os modelos de IA podiam ler a mesma quantidade de texto usando menos "tokens".
  2. A Garantia "Quase Perfeita": Uma das coisas mais legais sobre a matemática deles é que ela fornece um "limite inferior". Pense nisso como um certificado que diz: "Sabemos que o tamanho da mala perfeita é pelo menos tão pequeno quanto isso". Eles descobriram que suas malas ConvexTok estavam dentro de 1% desse tamanho teórico perfeito. Em outras palavras, eles são quase tão bons quanto matematicamente possível.
  3. Desempenho da IA: Quando treinaram modelos de IA usando essas novas malas:
    • Os modelos foram ligeiramente melhores em entender texto (medido por "bits por byte").
    • Em tarefas de raciocínio complexo (como responder a quebra-cabeças de lógica), os resultados foram mistos. Às vezes o ConvexTok foi melhor, às vezes o BPE foi melhor, mas o ConvexTok nunca foi significativamente pior.
  4. Estabilidade: O método BPE avarento é muito estável; se você der a ele livros ligeiramente diferentes, ele faz os mesmos carimbos. O novo método ConvexTok é um pouco mais sensível aos livros específicos que vê, o que significa que os carimbos podem mudar ligeiramente se você alterar os dados de treinamento.

Resumo

O artigo argumenta que temos usado um método "avarento" para ensinar IA a ler há muito tempo. Ao usar matemática avançada (otimização convexa) para olhar para o problema inteiro de uma vez, eles criaram um novo tokenizador chamado ConvexTok.

É como mudar de uma pessoa que cegamente cola as letras mais comuns juntas, para um arquiteto que projeta todo o layout da mala de uma só vez. O resultado é uma maneira mais eficiente de comprimir texto, aproximando-nos do limite teórico de quão pequenas podemos tornar essas "malas" de IA.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →