← Últimos artigos
🤖 machine learning

A More Accurate Algorithm Comparison through A/B Testing using Offline Evaluation Methods

Este artigo desafia a visão convencional de que o teste A/B é sempre superior à avaliação offline ao revelar que o teste A/B pode sofrer de taxas de erro de seleção mais altas devido à falta de correlação positiva, e propõe um novo estimador que induz intencionalmente essa correlação por meio de uma comparação em etapas com um algoritmo hipotético intermediário para reduzir significativamente os dados necessários para a seleção precisa de algoritmos.

Autores originais: Koki Konishi, Masataka Ushiku, Yuta Saito

Publicado 2026-07-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Koki Konishi, Masataka Ushiku, Yuta Saito

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: Escolhendo a Melhor Receita

Imagine que você administra um restaurante e quer decidir entre duas novas receitas de sopa: a Receita A e a Receita B. Você quer saber qual delas os clientes gostam mais para poder servi-la a todos.

Normalmente, o "Padrão de Ouro" (a melhor maneira de fazer isso) é o Teste A/B. Você serve a Receita A para metade dos seus clientes e a Receita B para a outra metade, e depois conta os elogios. Este é considerado o método mais preciso porque você está testando com dados reais e frescos.

No entanto, há um porém:

  1. É caro e arriscado: Se a Receita B for terrível, você pode estragar a experiência gastronômica de metade dos seus clientes e perder dinheiro enquanto descobre isso.
  2. Precisa de muitos dados: Para ter 100% de certeza, você precisa servir milhares de tigelas.

Por causa disso, muitos restaurantes tentam a Avaliação Offline primeiro. Isso é como pedir ao seu chef principal para provar a sopa baseando-se em um livro de receitas (dados históricos) sem realmente servi-la aos clientes. É seguro e barato, mas geralmente é menos preciso do do teste de degustação real.

A Descoberta Surpreendente

Os autores deste artigo realizaram um teste e descobriram algo muito estranho e contraintuitivo:

Às vezes, o método "seguro" (Avaliação Offline) é, na verdade, melhor em escolher o vencedor do que o "Padrão de Ouro" (Teste A/B).

Em seu experimento, o método padrão de teste A/B (que eles chamam de AVG) cometeu erros cerca de 27% das vezes, enquanto o método offline cometeu erros apenas 9% das vezes.

Por que o "Padrão de Ouro" falhou?
Imagine que você está julgando dois corredores, Alice e Bob.

  • O método de Teste A/B (AVG) envia Alice para uma pista em Nova York e Bob para uma pista em Londres. Eles correm separadamente. Você mede seus tempos de forma independente. Como eles estão em lugares diferentes, seus tempos não têm conexão entre si. Se a Alice tiver um dia ruim e o Bob tiver um dia excelente, você pode pensar erroneamente que o Bob é mais rápido, mesmo que a Alice seja, na verdade, a melhor corredora.
  • O método Offline (IPS) faz com que tanto a Alice quanto o Bob corram na mesma pista ao mesmo tempo. Como eles estão correndo sob as mesmas condições (mesmo clima, mesma qualidade da pista), seus tempos são correlacionados. Se a pista estiver lamacenta, ambos correm mais devagar. Se estiver ensolarado, ambos correm mais rápido. Essa "condição compartilhada" cancela o ruído, tornando mais fácil ver quem é realmente mais rápido.

O artigo argumenta que o teste A/B falha porque trata os dois algoritmos como se estivessem em mundos completamente separados, perdendo o benefício de compará-los lado a lado.

A Solução: O "Intermediário" (MID)

Os autores propõem um novo método chamado MID (Middle-In-Difference ou Diferença pelo Meio). Eles querem a segurança do teste A/B (usando dados reais), mas a precisão do método offline (comparando as coisas lado a lado).

Aqui está como eles fazem isso, usando uma analogia de Cabo de Guerra:

  1. A Configuração: Você tem o Time A (Algoritmo A) e o Time B (Algoritmo B). Você quer saber quem é mais forte.
  2. O Problema: Se você apenas puxá-los diretamente um contra o outro, a corda pode ficar muito longa e instável (alta variância).
  3. O Truque (O Algoritmo do Meio): Os autores inventam um hipotético "Time do Meio" (Time M). Este time é uma mistura perfeita do Time A e do Time B.
  4. A Corrida Passo a Passo:
    • Primeiro, você faz o Time A correr contra o Time M. Você usa os dados do lado do Time A do teste A/B. Como eles estão correndo contra um oponente semelhante (o Time M), os resultados são estáveis.
    • Segundo, você faz o Time B correr contra o Time M. Você usa os dados do lado do Time B do teste A/B.
    • Finalmente, você soma os dois resultados para ver quem é mais forte entre o A e o B.

Por que isso funciona:
Ao introduzir o "Time do Meio", você força as duas comparações a compartilharem um ponto de referência comum. Assim como o método offline, isso cria uma correlação positiva. Embora o Time A e o Time B estejam em grupos diferentes, ambos estão sendo medidos contra o mesmo "Time do Meio". Isso cancela o ruído aleatório e torna a decisão final muito mais precisa.

Os Resultados

Os autores testaram isso com dados reais de um aplicativo de recomendação de vídeos (como TikTok ou YouTube).

  • Eficiência: O novo método MID foi capaz de escolher o melhor algoritmo com metade (ou até um quarto) da quantidade de dados exigida pelo método padrão de teste A/B.
  • Estabilidade: Quando os dois algoritmos eram muito diferentes entre si (o que geralmente quebra os métodos offline), o MID ainda funcionava perfeitamente.
  • Precisão: Ele cometeu menos erros do que tanto o teste A/B padrão quanto o método offline.

Resumo

O artigo diz: "Descobrimos que a maneira padrão de fazer testes A/B é, na verdade, um pouco desajeitada porque não compara as duas opções de forma justa, lado a lado. Inventamos um novo truque usando um 'Algoritmo do Meio' para forçar uma comparação justa. Esse novo truque nos permite encontrar o vencedor mais rápido, com menos dados e com menos erros."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →