← Últimos artigos
💬 NLP

How Lossless Is Lossless Speculative Decoding? The Role of Numerical Precision in Orthrus

Este artigo demonstra que, embora o Orthrus alcance uma decodificação especulativa sem perdas com correspondência exata de trajetória em FP32, sua suposta ausência de perdas degrada-se significamente sob precisão BF16, destacando que a precisão numérica impacta criticamente a equivalência de trajetória mesmo quando o desempenho da tarefa a jusante permanece inalterado.

Autores originais: Ilya Koziev, Leonid Sinev, Ivan Oseledets

Publicado 2026-09-15
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ilya Koziev, Leonid Sinev, Ivan Oseledets

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os computadores modernos que escrevem texto, conhecidos como modelos de linguagem, tornaram-se uma força dominante na forma como geramos informações. Esses sistemas funcionam prevendo a próxima palavra em uma frase com base nas palavras que vieram antes dela, um passo de cada vez. Este método é confiável, mas inerentemente lento, porque o computador deve terminar de calcular a primeira palavra antes que possa sequer começar a pensar na segunda. À medida que esses modelos crescem e as conversas se tornam mais longas, esse processo passo a passo torna-se um gargalo, tornando a tecnologia cara e lenta para usar. Para acelerar as coisas, pesquisadores desenvolveram uma técnica chamada decodificação especulativa. Essa abordagem tenta adivinhar várias palavras futuras de uma só vez, como um leitor folheando rapidamente um livro, e então verifica se esses palpites estão corretos. Se os palpites estiverem certos, o computador economiza um tempo tremendo.

Um sistema recente, chamado Orthrus, prometeu fazer isso sem perder nenhuma precisão. Ele combina um gerador de texto padrão e lento com um motor de adivinhação paralelo e mais rápido. Os criadores alegaram que um mecanismo de verificação integrado garantiria que o motor rápido produzisse exatamente a mesma sequência de palavras que o motor lento e original, tornando a aceleração verdadeiramente "sem perdas". Sem perdas, neste contexto, significa que o resultado final é idêntico ao que o modelo original, mais lento, teria produzido, até o último caractere. Essa promessa foi significativa porque sugeria que poderíamos ter o melhor dos dois mundos: a velocidade da adivinhação paralela com a confiabilidade perfeita do modelo original.

Uma equipe de pesquisadores decidiu testar essa promessa de forma independente. Eles construíram sua própria versão do sistema Orthrus e compararam sua saída contra o modelo original em uma grande variedade de tarefas, incluindo escrita de código, resolução de problemas matemáticos e composição de poesia. Eles realizaram esses testes usando um nível padrão de precisão numérica que a maioria dos computadores modernos utiliza para eficiência. Quando compararam as sequências de palavras geradas pelo sistema rápido Orthrus contra o sistema lento original, encontraram um resultado surpreendente. Os dois sistemas não concordavam sempre. Na verdade, para o modelo original lançado, as sequências coincidiam perfeitamente apenas cerca de 45 por cento das vezes. Para a versão treinada independentemente pelos próprios pesquisadores, a taxa de correspondência foi ainda menor, em 43 por cento. Isso significa que, em mais da metade dos casos, o sistema rápido tomou um caminho ligeiramente diferente, escolhendendo palavras diferentes das que o modelo original escolheria.

Os pesquisadores investigaram mais a fundo para entender por que isso aconteceu. Eles descobriram que a probabilidade de os sistemas concordarem estava conectada ao quão difícil era o texto para o modelo original prever. Quando o modelo original estava muito confiante na próxima palavra, o sistema rápido geralmente concordava com ele. No entanto, quando o texto era mais complexo ou o modelo estava menos certo, o sistema rápido tinha mais probabilidade de divergir e escolher uma palavra diferente. Isso sugere que a afirmação de "sem perdas" não estava se sustentando sob as condições específicas de cálculos computacionais padrão. Os pesquisadores também observaram que essa divergência não necessariamente tornava o texto pior. Quando testaram os modelos em benchmarks padrão de raciocínio e codificação, o sistema rápido às vezes pontuou ligeiramente acima do lento, mostrando que um caminho diferente não significa sempre um resultado inferior.

Para resolver o mistério de por que os sistemas discordavam, os pesquisadores alteraram a forma como o computador lidava com os números. Eles repetiram todo o experimento usando um nível mais alto de precisão numérica, que permite ao computador armazenar números com muito mais exatidão. Quando fizeram essa mudança, o resultado mudou completamente. Sob este cálculo mais preciso, o sistema rápido Orthus coincidiu com o modelo lento original perfeitamente todas as vezes, em todos os 1.190 comandos de teste. Essa descoberta revelou que os desacordos anteriores não foram causados por uma falha no design do próprio sistema Orthrus, mas pelos pequenos erros de arredondamento que ocorrem quando os computadores usam matemática padrão e menos precisa.

O estudo conclui que a promessa de uma aceleração "sem perdas" depende inteiramente da precisão numérica usada pelo computador. Embora o sistema Orthrus funcione conforme o pretendido na teoria, a realidade prática de executar o sistema em hardware padrão introduz pequenos erros que podem alterar o resultado final. Os pesquisadores argumentam que, quando cientistas afirmam que um sistema é sem perdas, eles devem especificar o nível de precisão numérica que está sendo usado, porque um sistema que é perfeitamente preciso em um cenário pode produzir resultados diferentes em outro. Este trabalho esclarece que, embora possamos tornar os modelos de linguagem muito mais rápidos, garantir que produzam exatamente a mesma saída que o original requer atenção cuidadosa à matemática subjacente, não apenas à arquitetura do modelo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →