Teaching Language Models to Think in Code
O artigo apresenta o ThinC, um framework que desloca o raciocínio de modelos de linguagem de uma intercalação de linguagem natural e código para um paradigma centrado em código, onde o próprio código atua como o principal raciocinador, alcançando desempenho de última geração em benchmarks de matemática de nível competitivo por meio da destilação de trajetórias de código e do emprego de ajuste fino supervisionado seguido por aprendizado por reforço.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando resolver um quebra-cabeça matemático muito complicado. Você tem duas maneiras de fazê-lo:
- O Jeito Antigo (Raciocínio Intercalado): Você fala consigo mesmo em inglês, planejando os passos. "Certo, primeiro preciso multiplicar 500 por 0,12..." Então, você fica um pouco inseguro, então pede a uma calculadora (a ferramenta de código) para verificar seu trabalho. Mas aqui está a pegadinha: se você cometeu um erro no seu raciocínio em inglês (como dizer que 500 vezes 0,12 é 50 em vez de 60), você pode acidentalmente digitar esse número errado na calculadora. A calculadora apenas faz o que você manda; ela não sabe que você cometeu um erro. Ela calcula com base no seu número errado, e você obtém uma resposta errada.
- O Jeito Novo (THINC): Você tira um pequeno momento para planejar sua estratégia em inglês ("Preciso encontrar a área desta forma"), e então entrega imediatamente todo o trabalho para um programador robô. O robô escreve código, executa-o, vê o resultado, escreve mais código com base nesse resultado e continua até que a resposta apareça. Você não faz nenhuma matemática na cabeça ou em frases em inglês; o robô faz todo o trabalho pesado.
Este artigo apresenta o THINC (Pensando em Código), uma nova maneira de ensinar modelos de IA a resolver problemas matemáticos, permitindo que o próprio código seja o pensador, em vez de ser apenas uma ferramenta que a IA usa para verificar seu trabalho.
O Problema com o Jeito Antigo
Os autores afirmam que os modelos de IA atuais que misturam raciocínio em inglês com código (chamados de Raciocínio Integrado a Ferramentas) têm três falhas principais, que eles chamam de "limitações estruturais":
- O Verificador "Post-Hoc": A IA frequentemente escreve toda a solução em inglês primeiro, e depois executa o código apenas para dizer: "Sim, está certo". O código não está realmente fazendo o pensamento; é apenas um selo de aprovação no final.
- O "Erro Silencioso": Se a IA comete um erro matemático em seus pensamentos em inglês (como calcular 12% de 500 como 50 em vez de 60), ela pode copiar esse número errado para o código. O código então calcula com o número errado, e a IA nunca percebe. O erro é "silencioso" porque o código apenas segue ordens.
- O "Trabalho Duplo": A IA frequentemente escreve uma longa explicação em inglês de como resolver o problema, e depois escreve código que faz exatamente a mesma coisa. É como escrever uma receita em inglês e depois escrever a mesma receita exata em francês, apenas para provar que você sabe cozinhar. É redundante e confuso.
A Solução THINC
O THINC muda as regras do jogo. Em vez de a IA falar sobre a matemática, a IA fala na matemática (via código).
- O Plano: A IA começa com uma única frase curta em inglês para definir a estratégia (por exemplo, "Vou iterar sobre números para encontrar a resposta").
- O Trabalho: Após essa única frase, tudo acontece em blocos de código. A IA escreve um trecho de código, executa-o, vê a saída e, em seguida, escreve o próximo trecho de código com base nessa saída.
- O Resultado: A resposta final vem diretamente da calculadora do computador (o interpretador), e não de um palpite da IA em inglês.
Como Eles Ensinaram a IA
Os pesquisadores não apenas disseram à IA para fazer isso; eles a ensinaram através de um processo de três etapas:
- Destilação (O Professor): Eles pegaram um modelo de IA muito inteligente e grande e pediram que ele resolvesse problemas matemáticos usando esse novo estilo "Código Primeiro". Eles coletaram 12.200 exemplos dessas soluções perfeitas "Código Primeiro".
- Ajuste Fino Supervisionado (O Aluno): Eles ensinaram dois modelos de IA menores (um com 1,7 bilhão de "células cerebrais" e outro com 4 bilhões) a imitar esses exemplos. Isso ensinou aos modelos o hábito de pensar em código.
- Aprendizado por Reforço (O Treinador): Eles deixaram os modelos praticarem em milhares de problemas matemáticos. Se o modelo obtivesse a resposta correta, recebia uma "recompensa". Se falhasse, aprendia a tentar uma estratégia de código diferente. Isso tornou os modelos muito mais inteligentes e confiáveis.
Os Resultados: Modelos Pequenos, Grandes Vitórias
O artigo testou esses novos modelos em concursos matemáticos muito difíceis e de nível competitivo (como AIME e HMMT).
- Derrotando os Gigantes: O pequeno modelo THINC de 4 bilhões de parâmetros obteve 78,1% em média. Isso é melhor que o modelo de 1,7B, melhor que outros modelos "Integrados a Ferramentas" e até melhor que um modelo massivo de 235 bilhões de parâmetros que pensa apenas em inglês!
- Confiabilidade: Em 99,2% dos casos, a resposta final foi extraída diretamente da saída do código do computador. A IA não chutou; ela calculou.
- Recuperando-se: Se o código cometesse um erro e travasse (um erro), o modelo THINC era surpreendentemente bom em corrigi-lo no próximo bloco de código, sem precisar "falar" para sair da situação. Outros modelos que misturam inglês e código tendem a desmoronar quando encontram um erro de código.
A Conclusão
O artigo afirma que, ao forçar a IA a parar de "falar" sobre a matemática e começar a "fazer" a matemática em código, os modelos tornam-se mais precisos, cometem menos erros aritméticos bobos e resolvem problemas difíceis com mais eficiência. É como trocar um humano tentando fazer divisão longa na cabeça por um humano que sabe programar uma calculadora para fazer isso por ele, passo a passo, sem nunca cometer um erro de cálculo mental.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.