← Últimos artigos
📊 statistics

Model selection with proper scoring rules on data sets of time series

Este artigo investiga como a assimetria da distribuição de pontuação causa resultados conflitantes de seleção de modelos entre as estatísticas de média, mediana e baseadas em ranking em dados de séries temporais, demonstrando que, embora esses critérios convirjam com grandes conjuntos de teste, a pontuação média é unicamente confiável para identificar o modelo verdadeiro em conjuntos de teste curtos, conforme evidenciado pela análise de séries temporais intermitentes, incluindo a competição M5.

Autores originais: Giorgio Corani, Stefano Damato, Dario Azzimonti, Lorenzo Zambon

Publicado 2026-06-24
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Giorgio Corani, Stefano Damato, Dario Azzimonti, Lorenzo Zambon

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um treinador tentando escolher o melhor jogador para o seu time. Você tem uma enorme lista de jogadores (série temporal) e quer ver quem tem o melhor desempenho em média. Para julgá-los, você usa uma "ficha de pontuação" (uma regra de pontuação adequada) que atribui um número de penalidade para cada erro cometido. Quanto menor o número, melhor o jogador.

Este artigo trata de como ler essa ficha de pontuação quando você tem muitos jogadores e muitos jogos para analisar. Os autores descobriram que a maneira como costumamos somar as pontuações pode, às vezes, nos enganar, levando-nos a escolher o jogador errado, especialmente quando os jogos são curtos ou quando os erros são raros, mas enormes.

Aqui está a decomposição usando analogias simples:

1. O Problema: Duas Maneiras de Contar

Quando você tem um time de jogadores, não pode apenas olhar para um jogo. Você precisa combinar seus resultados. O artigo diz que existem duas maneiras principais de como os treinadores costumam fazer isso:

  • Método A: A "Penalidade Média" (Pontuação Escalonada Média). Você pega cada ponto de penalidade que um jogador recebeu, soma todos eles e divide pelo número de jogos. Isso mostra o custo médio dos erros deles.
  • Método B: O "Registro de Vitórias e Derrotas" (Ranking Médio). Você não olha para os pontos. Em vez disso, você apenas pergunta: "Em quantos jogos o Jogador A venceu o Jogador B?". Você conta as vitórias. Se o Jogador A venceu mais jogos, ele recebe o primeiro lugar.

2. A Armadilha: O Desvio do "Grande Erro"

A Analogia:
Imagine um jogo onde você geralmente comete pequenos erros (como tropeçar nos próprios cadarços), mas ocasionalmente, você comete um erro massivo e catastrófico (como cair de um penhasco).

  • A "Penalidade Média" (Método A) vê a queda no penhasco. Ela soma todos os pequenos tropeços e a grande queda, resultando em uma penalidade média alta. Ela sabe que você é perigoso.
  • O "Registro de Vitórias e Derrotas" (Método B) analisa os jogos individualmente. Em 99 de 100 jogos, você apenas tropeçou nos cadarços, o que é uma penalidade minúscula. No outro 1 jogo, você caiu de um penhasco.
    • Se você estiver jogando contra um rival que nunca cai de penhascos, mas tropeça um pouco mais frequentemente, o Método B pode dizer: "Ei, você venceu 99 jogos! Você é o campeão!".
    • Mas o Método A diz: "Espere, aquela única queda no penhasco custou toda a sua temporada. Sua penalidade média é, na verdade, pior".

O artigo argumenta que o Método B (Ranking Médio) é perigoso porque ignora o tamanho dos erros. Ele só se importa com quem venceu mais rodadas individuais. Se as "quedas no penhasco" (erros enormes) forem raras, o Método B frequentemente as ignora, especialmente se você não tiver assistido jogos suficientes (conjuntos de teste curtos).

3. A Solução: Assistir Mais Jogos

Os autores realizaram simulações para ver o que acontece conforme você assiste a mais jogos (aumentando o tamanho do conjunto de teste).

  • Conjuntos de Teste Curtos (Poucos Jogos): O Método B é pouco confiável. Ele frequentemente escolhe o jogador "sortudo" que evita os grandes erros apenas por acaso, mesmo que o desempenho médio dele seja pior.
  • Conjques de Teste Longos (Muitos Jogos): À medida que você assiste a mais e mais jogos, as "quedas no penhasco" eventualmente acontecem vezes o suficiente para que o Método B comece a ver a verdade. Os dois métodos começam a concordar.

A Descoberta Principal: Se você tem apenas um histórico curto de dados (um conjunto de teste curto), o Método A (Penalidade Média) é o único que consistentemente escolhe o melhor modelo. O Método B é facilmente enganado pela "sorte" de evitar erros enormes e raros.

4. O Teste no Mundo Real: A Competição M5

Os autores testaram isso com dados reais da famosa "Competição de Previsão M5", que envolve a previsão de vendas para milhares de produtos (alguns dos quais são "intermitentes", o que significa que vendem muito raramente).

Eles compararam dois modelos matemáticos:

  1. O Modelo de Poisson: Um modelo mais simples.
  2. O Modelo Binomial Negativo: Um modelo mais complexo, conhecido por ser melhor em lidar com "picos" de demanda.

O que aconteceu?

  • Ao usar o Método B (Ranking Médio) em dados curtos, ele frequentemente escolheu o modelo Poisson. Ele pensou que o modelo mais simples era melhor porque "venceu" mais rodadas individuais.
  • Ao usar o Método A (Penalidade Média), ele consistentemente escolheu o modelo Binomial Negativo, identificando corretamente que este é o que lida melhor com os grandes picos.

Os autores concluíram que o "Método da Penalidade Média" estava certo. O "Registro de Vitórias e Derrotas" foi enganado porque os conjuntos de teste eram curtos demais para capturar os erros massivos e raros que o modelo mais simples falhou em prever.

5. Importa como medimos a penalidade?

O artigo também verificou se mudar a "régua" (fator de escala) usada para medir as penalidades alterava os resultados.

  • Boa Notícia: O método da "Penalidade Média" é muito robusto. Quer você meça a penalidade em dólares, em porcentagem ou contra uma linha de base, ele quase sempre escolhe o mesmo vencedor.
  • Má Notícia: O método do "Registro de Vitórias e Derrotas" é frágil. Ele pode oscilar dependendo de como você mede as coisas e de quanto dado você possui.

A Conclusão Final

Se você está tentando escolher o melhor modelo de previsão:

  1. Não conte apenas as vitórias. (Não dependa exclusivamente do Ranking Médio).
  2. Observe o custo médio dos erros. (Use a Pontuação Escalonada Média).
  3. Tenha cuidado com dados curtos. Se você não tem histórico suficiente, o método de "Vitórias e Derrotas" provavelmente o enganará, levando-o a escolher um modelo que parece bom no papel, mas que falha quando um evento raro e grande acontece.

O artigo essencialmente diz: "Não deixe um jogador que teve sorte ao evitar um grande desastre enganá-lo para que pense que ele é o melhor jogador. Olhe para o desempenho médio total dele."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →