← Últimos artigos
💬 NLP

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

Este artigo apresenta a Estimativa de Densidade Guiada por Quantis (QGDE), um método que aproveita as distribuições estáveis de razão de IDs de tokens em tokenizadores BPE liberados para estimar com precisão as razões de composição de corpora de pré-treinamento ocultos tanto ao nível de token quanto de categoria.

Autores originais: Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

Publicado 2026-08-12
📖 3 min de leitura☕ Leitura rápida

Autores originais: Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você acabou de comprar um robô chef novinho em folha e superinteligente. Ele consegue escrever poesia, resolver problemas matemáticos e até programar videogames. Mas há um porém: o livro de receitas que ele usou para aprender a cozinhar está trancado em um cofre. Você pode ver os pratos finais do robô e até pode ver a lista de ingredientes que ele pode ter usado, mas não tem ideia de qual era a mistura real de ingredientes. Foi 90% massa de pizza e 10% temperos? Ou talvez 50% chocolate e 50% brócolis? No mundo da Inteligência Artificial, esse "livro de receitas" é chamado de corpus de pré-treinamento, e a "lista de ingredientes" é o vocabulário do tokenizador.

Quando as empresas lançam um novo modelo de IA, elas frequentemente compartilham os pesos finais (o cérebro do robô) e a lista de vocabulário (o dicionário de ingredientes), mas mantêm a receita exata em segredo. Isso é um problema porque saber o que a IA "comeu" nos ajuda a entender por que ela é boa em algumas coisas e ruim em outras. Durante anos, cientistas tentaram adivinhar a receita observando o comportamento do robô ou as regras que ele usava para picar as palavras em pedaços. Mas esses palpites eram frequentemente muito grosseiros, como dizer "provavelmente ela comeu muita fruta" sem saber se eram maçãs ou bananas. A grande questão era: será que podemos olhar apenas para o dicionário de ingredientes e descobrir a proporção exata de cada ingrediente que o robô consumiu?

Este artigo diz: "Sim, nós podemos, e aqui está o como". Os pesquisadores descobriram que a maneira como as palavras são picadas e numeradas nesses dicionários não é aleatória; ela segue um padrão oculto e estável, muito parecido com a forma como a frequência das palavras em qualquer idioma segue uma curva previsível. Eles perceberam que, se você conhece o padrão de uma receita "conhecida" (um corpus ao qual temos acesso), você pode transferir esse padrão para adivinhar a receita de uma outra "oculta". Eles construíram uma ferramenta inteligente chamada QGDE (Estimativa de Densidade Guiada por Quantis). Pense nisso como um detetive que não olha apenas para uma pista, mas usa um conjunto inteiro de cenários "e se" (tendências de quantis) e os pesa com base em quão lotado é o bairro das pistas (ponderação de densidade local).

Os resultados são surpreendentemente precisos. Em seus testes, o QGDE conseguiu adivinhar a proporção de palavras específicas com uma taxa de erro minúscula de apenas 3,00%. Quando eles agruparam essas palavras em categorias maiores, como "Web", "Matemática" ou "Código", o erro foi de apenas 3,08%. Este é um enorme avanço em relação aos métodos anteriores, que eram como tentar prever o tempo olhando para uma única nuvem. O artigo também testou isso em um modelo de IA real e lançado, o SmolLM, onde a receita real era conhecida. Mesmo lá, o QGDE superou outros métodos, provando que o dicionário de ingredientes realmente guarda o segredo da receita. No entanto, os autores fazem questão de notar que, embora isso funcione bem em suas simulações e no SmolLM, ainda não podemos testá-lo em gigantes como o ChatGPT ou o Qwen porque suas receitas de treinamento completas permanecem trancadas. Mas, por enquanto, isso sugere que, na próxima vez que você vir a lista de vocabulário de uma IA, você poderá estar olhando para um mapa de sua dieta oculta.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →