The Tokenizer Tax Across 25 European Languages: Domain Invariance, Cross-Lingual Few-Shot Effects, and the Ukrainian Penalty
Este artigo quantifica um "imposto de tokenizador" em 25 línguas europeias, revelando que as línguas não inglesas, particularmente o ucraniano e aquelas com morfologia complexa, sofrem de rácios token-palavra significativamente mais elevados devido à sub-representação nos dados de pré-treinamento, ao mesmo tempo que demonstra que essas classificações de fertilidade permanecem consistentes entre domínios e que os efeitos de poucos exemplos são intrínsecos ao modelo e não dependentes da língua.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está pagando por uma corrida de táxi. Em inglês, o táxi cobra por "parada" (uma palavra). Mas em ucraniano, o motorista insiste em cobrar por "passo" (um pequeno pedaço de uma palavra). Como as palavras ucranianas são frequentemente mais longas e complexas, o motorista dá muitos mais passos para chegar ao mesmo destino. Você acaba pagando o dobro pelo mesmo trajeto exato, mesmo que a distância não tenha mudado.
Este artigo, escrito por Volodymyr Ovcharov, trata exatamente desse "imposto" oculto sobre idiomas que não são o inglês ao usar IA. Aqui está a análise do que eles descobriram, usando analogias simples:
1. O Imposto do "Passo" (Fertilidade do Tokenizador)
Os modelos de IA não leem palavras inteiras como os humanos. Eles dividem o texto em pequenos pedaços chamados tokens.
- A Analogia: Pense em uma palavra como um pão.
- Inglês: A IA corta o pão em fatias grandes e grossas. Você precisa apenas de 1,2 fatias para representar uma palavra.
- Ucraniano: A IA usa uma faca cega e corta o mesmo pão em pedaços minúsculos e esfarelados. São necessárias 2,7 fatias para representar uma palavra.
- O Custo: Como as empresas de IA cobram por "fatia" (token), falar ucraniano custa aproximadamente 2,2 vezes mais do que falar inglês para a mesma quantidade de texto.
- A Hierarquia: O artigo mediu 25 línguas europeias.
- O Grupo Barato: Inglês, espanhol e francês (1,2 a 1,7 fatias por palavra).
- O Grupo Intermediário: Alemão e holandês (1,7 a 1,9 fatias).
- O Grupo Caro: Línguas eslavas como polonês e tcheco (2,2 a 2,5 fatias).
- O Mais Caro: Ucraniano, grego e maltês (cerca de 3,1 fatias).
2. A "Penalidade Ucraniana"
Os pesquisadores descobriram algo surpreendente sobre o ucraniano. Embora o ucraniano, o polonês e o tcheco sejam todos primos eslavos com estruturas de palavras semelhantes, o ucraniano é significativamente mais caro de processar.
- A Analogia: Imagine duas fábricas idênticas. Uma (polonesa) tem um suprimento bem estocado de tijolos pré-cortados porque constrói há muito tempo. A outra (ucraniana) precisa cortar cada tijolo a partir de pedra bruta porque foi ignorada no passado.
- A Causa: O artigo mostra que o ucraniano possui 2 a 6 vezes menos dados de treinamento na "biblioteca" da IA em comparação com o polonês ou o tcheco. Como a IA não viu palavras ucranianas com tanta frequência, ela não sabe agrupá-las de forma eficiente. Ela continua dividindo-as em pedaços minúsculos e ineficientes.
3. A Faca "Tamanho Único"
O artigo testou se esse "imposto" muda dependendo do que você está falando (por exemplo, contratos jurídicos versus notícias versus Wikipedia).
- A Descoberta: Não importa. A classificação de qual IA é "barata" e qual é "cara" permanece exatamente a mesma, seja você falando sobre futebol, direito ou história.
- A Conclusão: Se você testar uma IA em um tipo de texto, saberá exatamente quanto ela custará para qualquer outro tipo de texto. Você não precisa retestá-la a cada vez.
4. O "Truque de Mágica" (Aprendizado com Poucos Exemplos)
A IA às vezes pode aprender uma nova tarefa apenas vendo alguns exemplos (como mostrar a ela uma pergunta e resposta de amostra). Os pesquisadores testaram se esse "truque de mágica" funcionava de forma diferente para diferentes idiomas.
- A Descoberta: O truque não é sobre o idioma; é sobre a personalidade da IA (seu design).
- Algumas IAs (como a "Nemotron") ficam mais inteligentes quando mostram exemplos, não importa se o texto é ucraniano, polonês ou russo.
- Outras IAs (como a "Maverick") ficam na verdade menos inteligentes quando mostram exemplos, novamente, independentemente do idioma.
- A Lição: Não culpe o idioma pela confusão da IA. Culpe o design da IA. Se uma IA falha com exemplos em inglês, provavelmente falhará com exemplos em ucraniano também.
5. Por Que Algumas IAs Cortam Melhor
Os pesquisadores olharam sob o capô para ver como diferentes IAs cortam as palavras.
- Os Bons Cortadores: Algumas IAs (como a Gemma 2) cortam palavras ucranianas nas fronteiras naturais de "morfemas" (as partes significativas de uma palavra, como raízes e terminações). Isso é eficiente.
- Os Maus Cortadores: Outras IAs (como a Qwen3) cortam palavras em pontos aleatórios, às vezes dividindo uma única parte significativa ao meio. É como cortar um sanduíche bem no meio de uma picles em vez de entre as fatias de pão.
- A Surpresa: Ter um dicionário maior (vocabulário) não garante um corte melhor. Algumas IAs com dicionários enormes ainda cortam palavras ucranianas em pedaços minúsculos e ineficientes porque simplesmente não tinham exemplos suficientes em ucraniano em seus dados de treinamento para aprender os cortes corretos.
Resumo das Recomendações
O artigo sugere três regras simples para qualquer pessoa usando IA com ucraniano ou idiomas semelhantes:
- Espere o Imposto: Orante o fato de que o ucraniano custará cerca do dobro do que o inglês.
- Teste Uma Vez: Você só precisa medir o "imposto" uma vez; ele se aplica a todos os tópicos.
- Tenha Cuidado com Exemplos: Não assuma que mostrar exemplos a uma IA ajudará. Para alguns modelos, isso pode na verdade prejudicar o desempenho, e isso acontece em todos os idiomas.
A Conclusão: O mundo da IA atualmente é construído com um viés em inglês. Até que as "bibliotecas" de dados de treinamento sejam equilibradas, idiomas como o ucraniano pagarão um "imposto de passo" oculto apenas para serem compreendidos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.