← Últimos artigos
💬 NLP

DEL: Digit Entropy Loss for Numerical Learning of Large Language Models

Este artigo apresenta a Perda de Entropia de Dígitos (DEL), um novo objetivo de treinamento que reformula a otimização de entropia não supervisionada em um framework supervisionado e livre de distâncias para melhorar a precisão de modelos de linguagem grandes na previsão de números inteiros e de ponto flutuante em tarefas de raciocínio matemático e geração de código.

Autores originais: Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

Publicado 2026-05-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô muito inteligente, mas ligeiramente confuso, a fazer matemática. O robô é ótimo em escrever histórias e conversar, mas, quando se trata de números, frequentemente erra os dígitos. Ele pode dizer "12" quando a resposta é "13", ou pode chutar "14" em vez de "12".

Este artigo, do Laboratório de Computação Visual da Universidade Politécnica de Hong Kong, apresenta uma nova maneira de ensinar esse robô a lidar melhor com números. Eles chamam seu novo método de Perda de Entropia de Dígitos (DEL).

Aqui está a história de como eles corrigiram as habilidades matemáticas do robô, usando analogias simples:

1. O Problema: O Hábito de "Melhor Adivinhação" do Robô

Tradicionalmente, ao treinar esses robôs de IA (chamados Modelos de Linguagem de Grande Porte), usamos um método chamado Estimação de Máxima Verossimilhança (MLE).

  • A Analogia: Imagine que o robô está fazendo uma prova de múltipla escolha. O MLE diz ao robô: "Apenas escolha a resposta que você acha mais provável."
  • O Defeito: O robô é muito educado. Ele pensa: "Bem, '12' é a melhor resposta, mas '13' e '11' são mais ou menos próximas, então vou dar um pouquinho de probabilidade para elas também."
  • O Resultado: O robô torna-se indeciso. Ele fica oscilando entre números, levando a erros como dizer "12,4" quando a resposta deve ser um número inteiro, ou simplesmente escolher o dígito errado porque não estava confiante o suficiente.

2. As Correções Antigas: A Armadilha da "Distância"

Os pesquisadores tentaram corrigir isso adicionando um sistema de "penalidade".

  • A Analogia: Eles disseram ao robô: "Se a resposta é 5 e você chuta 4, está tudo bem, é perto. Mas se você chutar 9, isso é terrível!" Eles criaram um mapa onde os números estão dispostos em uma linha, e o robô é punido com base na distância entre sua aposta e a verdade.
  • O Problema: O artigo argumenta que esse "mapa de distância" é artificial. No mundo real, os números não são apenas pontos em uma linha; são símbolos com seus próprios significados. Às vezes, o robô aprende que o número "2" se parece mais com a letra "Z" do que com o número "3". Forçar o robô a seguir uma regra rígida de distância o confunde e torna suas apostas ou muito rígidas (afinadas) ou muito vagas (achatadas).

3. A Nova Solução: O "Treinador de Confiança" (DEL)

Os autores propõem a Perda de Entropia de Dígitos (DEL). Em vez de medir quão longe o robô está da resposta, eles focam em quão certo o robô está.

  • A Analogia: Imagine um treinador que não se importa com a distância entre sua aposta e o alvo. Em vez disso, o treinador diz: "Não me importo se você está perto ou longe. Eu só quero que você tenha 100% de certeza da sua resposta. Se você tem 90% de certeza de '5' e 10% de certeza de '6', você está sendo indeciso. Quero que você tenha 100% de certeza de '5' e 0% de certeza de tudo o mais."
  • Como funciona:
    1. Certeza Supervisionada: Eles ensinam o robô a tratar cada dígito como uma simples pergunta de "Sim/Não". "Este dígito é um 5? Sim ou Não?" Isso força o robô a tomar uma decisão nítida e clara, em vez de uma aposta difusa.
    2. Sem Regras de Distância: Eles descartam o "mapa de distância". Eles permitem que o robô aprenda a relação natural entre os números com base nos dados que viu, em vez de impor uma regra feita por humanos.
    3. Lidando com Decimais: Métodos anteriores tratavam números inteiros (como 10) e decimais (como 10,5) de forma diferente, causando um "precipício" onde o robô tropeçava. O DEL trata o número inteiro e a parte decimal como um fluxo contínuo e suave, como uma única linha numérica longa, em vez de duas ilhas separadas.

4. Os Resultados: Matemática Mais Nítida

Os pesquisadores testaram esse novo "Treinador de Confiança" em quatro tipos diferentes de robôs de IA (CodeLlama, Mistral, DeepSeek e Qwen-2.5) usando sete benchmarks matemáticos diferentes.

  • O Resultado: Os robôs treinados com DEL cometeram menos erros. Eles não apenas acertaram a resposta certa com mais frequência; quando erraram, a resposta errada estava muito mais próxima da correta (por exemplo, chutando 12 em vez de 13, em vez de 50).
  • A Prova Visual: Nos exemplos do artigo, você pode ver que os métodos antigos frequentemente acertavam a lógica, mas erravam o número final (como calcular o custo total de uma viagem de compras, mas errar o valor final em dólares). O método DEL acertou tanto a lógica quanto o número final.

Resumo

Em resumo, este artigo diz: Pare de ensinar robôs de IA a adivinhar quão "perto" um número está. Em vez disso, ensine-os a ter certeza absoluta sobre o dígito exato que estão prevendo. Ao remover regras artificiais de distância e focar em construir previsões nítidas e confiantes, os robôs ficaram muito melhores em matemática e geração de código.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →