← Últimos artigos
💬 NLP

Stochasticity in Tokenisation Improves Robustness

O artigo demonstra que o pré-treinamento e o ajuste fino de modelos de linguagem com tokenização estocástica uniformemente amostrada melhoram significativamente a robustez contra perturbações adversariais e aleatórias, mantendo a precisão e sem aumentar o custo de inferência.

Autores originais: Sophie Steger, Rui Li, Sofiane Ennadir, Anya Sims, Arno Solin, Franz Pernkopf, Martin Trapp

Publicado 2026-04-20
📖 4 min de leitura☕ Leitura rápida

Autores originais: Sophie Steger, Rui Li, Sofiane Ennadir, Anya Sims, Arno Solin, Franz Pernkopf, Martin Trapp

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô superinteligente a ler e entender o mundo. Para fazer isso, você precisa ensinar o robô a "quebrar" as palavras em pedacinhos menores, chamados tokens. É como se o robô não lesse "casa", mas sim "ca" e "sa".

O problema é que, até agora, os robôs eram ensinados a quebrar as palavras sempre da mesma maneira exata. Se você escrevesse "casa" de um jeito diferente (talvez com um espaço extra ou juntando as letras de forma estranha), o robô ficava confuso e podia até começar a dizer bobagens. Era como se ele só soubesse ler um tipo de letra manuscrita específica e, se você mudasse a caneta, ele não reconhecesse mais a palavra.

Os autores deste artigo descobriram uma solução brilhante: ensinar o robô a ler de várias formas diferentes ao mesmo tempo.

Aqui está a explicação simples, usando analogias do dia a dia:

1. O Problema: O Robô "Rígido"

Pense no robô como um músico que aprendeu a tocar uma música apenas em uma única partitura. Se alguém mudar uma nota ou a velocidade, ele trava.
No mundo dos computadores, isso acontece com a tokenização (a forma como o texto é dividido). Se um "hacker" ou um erro de digitação mudar levemente como uma palavra é dividida (o que chamam de "tokenização não canônica"), o modelo de Inteligência Artificial (IA) pode falhar miseravelmente. Ele é frágil, como um castelo de cartas.

2. A Solução: A "Variedade de Treinamento"

Os pesquisadores propuseram algo simples, mas poderoso: treinar o robô com "tokenização estocástica".
Em linguagem simples, isso significa: "Durante o treinamento, não mostre a palavra 'casa' sempre como 'ca-sa'. Às vezes mostre como 'c-a-s-a', outras vezes como 'cas-a', e assim por diante."

É como se você estivesse treinando um atleta para correr em diferentes terrenos:

  • Treino Antigo (Canônico): O atleta só corre na pista de atletismo perfeita.
  • Treino Novo (Estocástico): O atleta corre na pista, na areia, na grama e em trilhas de terra.

Quando chega o dia da prova (o teste real), e o atleta encontra um terreno difícil (uma palavra escrita de forma estranha ou um ataque malicioso), ele não entra em pânico. Ele já sabe lidar com isso porque foi treinado para ser flexível.

3. O Que Eles Descobriram?

Os autores testaram isso em vários modelos (como o Llama) e descobriram três coisas principais:

  • Robustez contra "Golpes": Se alguém tentar enganar o robô mudando a forma como as palavras são divididas (um ataque), o robô treinado com essa "variedade" continua funcionando bem. Ele não quebra.
  • Sem Custo Extra: O melhor de tudo é que, depois de treinado, o robô não fica mais lento ou gasta mais energia. Ele só se torna mais inteligente e resistente. É como um músculo que fica forte sem pesar mais no corpo.
  • A Importância da "Aleatoriedade Justa": Eles perceberam que não basta apenas mudar as palavras aleatoriamente. O jeito que você escolhe essas variações importa. Se você escolher as variações de um jeito "viciado" (sempre as mesmas), o robô ainda pode falhar. Eles criaram métodos novos (chamados STOCHASTOK-UNI e UNIFORM-K) que garantem que o robô veja todas as possibilidades possíveis de forma justa, como um sorteio onde todas as bolas têm a mesma chance de sair.

4. A Analogia Final: O Tradutor Poliglota

Imagine que você tem um tradutor que só conhece o inglês escrito em fonte Arial. Se você mandar um texto em fonte Comic Sans ou com erros de digitação, ele falha.
Agora, imagine que você treina esse tradutor lendo livros em fontes diferentes, com erros propositais, manuscritos e até gírias.
Quando você finalmente pedir para ele traduzir um texto estranho, ele não vai travar. Ele vai entender o significado, não apenas a forma exata das letras.

Conclusão

Este artigo diz que, para criar IAs mais seguras e confiáveis, precisamos parar de ensiná-las a serem perfeitas em apenas uma forma de ler. Precisamos ensiná-las a serem adaptáveis. Ao introduzir um pouco de "caos" e "variedade" durante o aprendizado, tornamos a IA muito mais forte contra erros e ataques, sem torná-la mais lenta. É um passo importante para garantir que, no futuro, nossas IAs não sejam frágeis como vidro, mas resilientes como borracha.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →