← Últimos artigos
💬 NLP

AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding

O AngelSpec introduz um framework de treinamento unificado que coespecializa estruturas de rascunho distintas (MTP para chat e block-diffusion para código/matemática) e otimiza dinamicamente os recursos de verificação de inferência para alcançar melhorias significativas de throughput e taxas de aceitação mais altas através de diversos fluxos de trabalho do mundo real.

Autores originais: Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin, Jiebin Zhang, Tianyu Liu, Runzhi Fan, Guoliang Zhao, Ruobing Xie, Kai Zhang, Song Liu, Guanghua Yu, Jianchen Zhu

Publicado 2026-07-29
📖 4 min de leitura☕ Leitura rápida

Autores originais: Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin, Jiebin Zhang, Tianyu Liu, Runzhi Fan, Guoliang Zhao, Ruobing Xie, Kai Zhang, Song Liu, Guanghua Yu, Jianchen Zhu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô superinteligente a escrever histórias, resolver problemas matemáticos ou escrever códigos de computador. Este robô, conhecido como um Grande Modelo de Linguagem (LLM), é incrivelmente talentoso, mas tem uma peculiaridade muito específica: ele pensa uma palavra por vez. Para escrever uma frase, ele deve parar, pensar e gerar a primeira palavra, depois parar novamente para pensar na segunda palavra, e assim por diante. É como um chef que só consegue picar um vegetal, então deve esperar toda a cozinha esfriar antes de picar o próximo. À medida que o robô fica mais inteligente e os pedidos se tornam mais complexos, esse processo "um por um" torna-se dolorosamente lento, como observar a tinta secar em câmera lenta.

Para acelerar as coisas, cientistas inventaram um truque chamado "decodificação especulativa". Pense nisso como um esforço de equipe. Você tem um robô de "rascunho" minúsculo e rápido que adivinha as próximas palavras de uma frase, e um robô "alvo" gigante e lento que verifica se esses palpites estão corretos. Se o robô grande concordar, a equipe pode escrever várias palavras de uma vez, em vez de apenas uma. É como um corredor rápido adivinhando o caminho à frente para um caminhante pesado; se o palpite estiver certo, eles avançam juntos, economizando uma quantidade massiva de tempo. No entanto, há uma pegadinha: o corredor rápido nem sempre está certo. Se ele adivinhar palavras demais erradas, o robô grande terá que perder tempo corrigindo-as, e todo o processo ficará mais lento. A grande questão para os cientistas é: como fazemos o corredor rápido adivinhar melhor e como sabemos quando parar de adivinhar para não perder tempo?

É aqui que um novo projeto chamado AngelSpec entra em cena. Os pesquisadores da Tencent perceberam que uma estratégia de "único corredor rápido" não funciona para todas as situações. Assim como um velocista pode ser ótimo em uma corrida curta, mas terrível em uma maratona, diferentes tipos de texto exigem diferentes estratégias de adivinhação. Por exemplo, escrever uma mensagem de chat casual é caótico e cheio de surpresas (alta entropia), enquanto escrever uma prova matemática ou um programa de computador é muito estruturado e previsível. O artigo argumenta que tentar usar um robô de adivinhação "universal" para tudo é um erro. Em vez disso, eles construíram um sistema que utiliza dois tipos diferentes de adivinhadores dependendo da tarefa, e um gerente inteligente que decide exatamente quanto tempo gastar verificando esses palpites com base no quão ocupado o sistema está.

A equipe introduziu um novo método chamado DFly para as tarefas estruturadas, como codificação e matemática. Imagine o DFly como uma equipe de detetives que não apenas adivinha a próxima pista uma por uma, mas olha para o quebra-cabeça inteiro de uma vez para ver o padrão. Eles usam um "cérebro híbrido" especial que olha para o panorama geral e depois refina seus palpites com base no que veio imediatamente antes. Isso permite que eles prevejam longas cadeias de código ou passos matemáticos com alta precisão. Para as tarefas de chat mais bagunçadas e criativas, eles mantêm um método mais simples e rápido chamado MTP (Multi-Token Prediction), que é ótimo para explosões conversacionais rápidas.

Mas ter um bom adivinhador não é suficiente; você também precisa de um gerente inteligente. O artigo apresenta um recurso chamado D-cut, que atua como um controlador de tráfego. Em um servidor ocupado, às vezes o processo de "verificação" fica congestionado. O D-cut observa a confiança dos palpites em tempo real. Se um palpite parece duvidoso, o D-cut o interrompe precocemente para economizar tempo. Se o sistema está funcionando suavemente e os palpites parecem sólidos, ele deixa a equipe continuar por mais tempo. É como um maestro que acelera a orquestra quando a música é fácil e a desacelera quando as notas ficam complicadas, garantindo que toda a performance permaneça rápida sem travar.

Os resultados desta abordagem são impressionantes. Quando testaram seu novo sistema no modelo Hy3-A21B, descobriram que ele podia processar texto muito mais rápido do que antes. Especificamente, o sistema alcançou uma aceleração de 1,98 a 2,40 vezes em comparação com o antigo método de "uma palavra por vez". Melhor ainda, foi 10,5% a 11,8% mais rápido do que o método anterior mais conhecido, o DFlash. Os pesquisadores mostraram que, ao adaptar a estratégia de adivinhação ao tipo específico de texto (chat vs. código) e ao usar o gerente inteligente para se ajustar à carga de trabalho, eles poderiam obter o máximo de seu poder de computação. Eles até lançaram todo o seu conjunto de ferramentas, chamado AngelSpec, para o público, para que outros cientistas possam usar esses truques para tornar seus próprios modelos de IA mais rápidos e eficientes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →