Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning
Este artigo apresenta o DASD-4B-Thinking, um modelo de raciocínio leve e de código aberto que alcança o estado da arte em desempenho ao abordar limitações críticas na destilação atual em nível de sequência por meio de um novo pipeline de treinamento que alinha melhor as distribuições professor-aluno e mitiga o viés de exposição, tudo isso utilizando significativamente menos amostras de treinamento.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um professor brilhante e de classe mundial (o Professor) que consegue resolver problemas matemáticos incrivelmente difíceis, escrever códigos complexos e responder a perguntas científicas complicadas. Agora, imagine que você tem um aluno pequeno, mas brilhante (o Aluno) que quer aprender com o professor, mas não possui o mesmo poder cerebral ou memória.
O objetivo deste artigo é ensinar o pequeno aluno a pensar como o grande professor, mesmo sendo muito menor. A equipe da Alibaba Cloud criou uma nova maneira de fazer isso chamada DASD-4B-Thinking.
Aqui está como eles fizeram isso, explicado através de analogias simples:
O Jeito Antigo: Apenas Copiando o Dever de Casa
Anteriormente, os pesquisadores tentavam ensinar o aluno dando a eles as respostas prontas do dever de casa do professor. O aluno apenas memorizava essas respostas.
- O Problema: Às vezes, as respostas do professor eram perfeitas demais e raras, e às vezes eram bagunçadas. Se o aluno apenas escolhesse aleatoriamente o dever de casa para copiar, ele poderia perder as lições mais importantes ou se confundir com as bagunçadas. Além disso, o aluno só aprendia a copiar quando o professor estava parado logo ao lado dele (olhando para a resposta), mas no mundo real, o aluno tem que resolver problemas sozinho. Isso é como um aluno que só consegue escrever uma redação se o professor sussurrar a próxima palavra para ele; quando tentam escrever sozinhos, eles travam.
O Novo Jeito: Um Campo de Treinamento Mais Inteligente
Os autores perceberam que precisavam de um plano de treinamento melhor. Eles introduziram três principais "superpoderes" para corrigir os problemas antigos:
1. A Estratégia de "Aquecimento" e "Sprint" (Aprendizado com Programação de Temperatura)
Imagine que o professor está dando uma aula.
- O Erro Antigo: O professor às vezes dava à classe respostas muito fáceis e óbvias, e outras vezes dava respostas selvagens, confusas ou raras. O aluno ficava confuso tentando aprender com as selvagens antes de entender o básico.
- A Nova Correção: A equipe criou um cronograma de duas etapas.
- Etapa 1 (Aquecimento): Primeiro, eles deram ao aluno as respostas mais claras e confiantes do professor (temperatura baixa). Isso ajudou o aluno a construir uma base sólida e aprender os padrões básicos rapidamente.
- Etapa 2 (Sprint): Uma vez que o aluno estivesse confiante, eles introduziram respostas mais diversas e complicadas (temperatura alta). Isso expôs o aluno a uma variedade mais ampla de estilos de resolução de problemas, tornando-o mais flexível e robusto.
- Resultado: O aluno aprendeu o básico primeiro e depois expandiu seus horizontes, em vez de ficar sobrecarregado imediatamente.
2. O Filtro "Encontre a Diferença" (Amostragem Consciente de Divergência)
Quando o professor e o aluno olham para um problema, eles às vezes pensam de forma diferente.
- O Erro Antigo: O aluno era forçado a copiar todas as respostas que o professor dava, mesmo que o aluno já estivesse confiante de uma maneira diferente (errada). Isso confundia o cério do aluno.
- A Nova Correção: A equipe construiu um filtro que olha para as respostas e pergunta: "Onde o professor acha que esta é uma ótima ideia, mas o aluno acha que é uma ideia ruim?"
- Eles focaram o treinamento nesses momentos específicos. Estas são as lições de "alto valor", onde o aluno tem mais probabilidade de aprender algo novo e corrigir seus erros.
- Eles ignoraram as respostas onde o aluno e o professor já concordavam (porque o aluno já sabia aquilo) ou onde o aluno estava confiantemente errado de uma forma que não poderia ser corrigida facilmente.
- Resultado: O aluno gastou seu tempo de estudo apenas nas lições que realmente precisavam ser aprendidas, tornando seu tempo de estudo muito mais eficiente.
3. O Treino de "Simulação" (Destilação de Política Mista)
Isso corrige o problema do aluno precisar que o professor sussurre a próxima palavra.
- O Erro Antigo: O aluno praticava copiando as respostas completas do professor. Mas, no teste real, o professor não está lá. O aluno começava a escrever, travava e então entrava em pânico porque nunca tinha praticado terminar uma frase sozinho.
- A Nova Correção: Eles criaram um "treino de simulação".
- Eles deixaram o aluno tentar resolver um problema por conta própria.
- Se o aluno começasse a sair do caminho ou travasse, eles paravam o aluno no meio da frase.
- Então, o professor entrava para terminar a frase corretamente.
- O aluno então aprendia com essa resposta "metade escrita, metade corrigida".
- Resultado: O aluno aprendeu como se recuperar de seus próprios erros e terminar o trabalho sem ajuda, tornando-se muito mais confiável no mundo real.
Os Resultados Incríveis
Ao usar este campo de treinamento inteligente, a equipe criou um modelo minúsculo (apenas 4 Bilhões de parâmetros, o que é muito pequeno no mundo da IA) que pode pensar tão bem quanto, ou até melhor que, modelos muito maiores (alguns com 32 Bilhões de parâmetros).
- Eficiência: Eles alcançaram esses resultados usando apenas 448.000 exemplos de treinamento. Outras equipes costumam usar milhões ou até dezenas de milhões de exemplos para obter resultados semelhantes. É como obter um doutorado com uma fração do tempo de estudo.
- Desempenho: Em competições matemáticas difíceis (como a AIME), desafios de codificação e questões científicas, este modelo pequeno venceu muitos dos "gigantes" na área.
Resumo
O artigo mostra que você não precisa de uma quantidade massiva de dados ou de um computador gigante para criar uma IA inteligente. Em vez disso, você precisa de uma maneira mais inteligente de ensinar. Ao ensinar o aluno em etapas, focando nas lições certas e praticando como terminar tarefas por conta própria, uma pequena IA pode se tornar uma campeã de raciocínio.
A equipe compartilhou seu "livro didático" (o conjunto de dados) e o "aluno graduado" (o modelo) com o mundo para que outros possam aprender com seu método.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.