← Últimos artigos
📊 statistics

Data-Driven Dynamic Assortment in Online Platforms: Learning about Two Sides

Este artigo introduz um algoritmo baseado em dados para um problema de sortimento dinâmico de dois lados com parâmetros de escolha desconhecidos em ambos os lados, alcançando um regret polilogarítmico de taxa ótima ao aprender simultaneamente as preferências de clientes e vendedores enquanto maximiza a receita da plataforma.

Autores originais: Rahul Roy, Nur Sunar, Jayashankar M. Swaminathan

Publicado 2026-06-10
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Rahul Roy, Nur Sunar, Jayashankar M. Swaminathan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando um mercado digital movimentado, como uma versão de alta tecnologia de uma feira de produtores ou um aplicativo de namoro. Você tem dois grupos de pessoas: Clientes (que querem comprar serviços) e Vendedores (que querem prestá-los). Seu trabalho é decidir quais Vendedores mostrar para cada Cliente que entra pela porta.

Este artigo aborda um problema muito difícil: você não sabe do que ninguém gosta.

O Problema Central: O Mercado de "Encontros às Cegas"

Na maioria das plataformas online, o sistema tenta adivinhar o que os clientes querem. Mas, no cenário deste artigo, a plataforma é cega de duas maneiras:

  1. Ela não sabe o que os Clientes querem: Alguns clientes amam instaladores de energia solar; outros preferem redatores freelancers. A plataforma não sabe qual tipo de cliente chegará a seguir.
  2. Ela não sabe o que os Vendedores querem: Mesmo que um cliente escolha um vendedor, esse vendedor pode dizer "Não, obrigado". Talvez o vendedor odeie trabalhar com aquele tipo específico de cliente. A plataforma também não conhece essas preferências.

É como uma configuração de encontros às cegas onde o cupido não sabe do que o rapaz gosta, e também não sabe do que a moça gosta. Se o cupido apenas aprender o que o rapaz gosta, mas ignorar o que a moça gosta, eles continuarão marcando encontros ruins.

O Ciclo de Eventos

O artigo descreve um ritmo específico de como este mercado funciona:

  1. A Chegada: Um cliente chega.
  2. O Menu: A plataforma mostra a ele uma pequena lista (um "sortimento") de vendedores.
  3. A Proposta: O cliente escolhe um vendedor da lista (ou nenhum).
  4. A Revisão: O vendedor recebe um lote de propostas. A cada poucos dias (um "ciclo"), o vendedor revisa as propostas e escolhe, no máximo, um cliente para trabalhar.
  5. A Recompensa: A plataforma só é paga (ou obtém um "match") se tanto o cliente escolheu o vendedor quanto o vendedor escolheu o cliente.

O Desafio: Aprender Enquanto Faz

O gerente da plataforma tem que tomar decisões agora sem saber o futuro. Ele tem que descobrir:

  • "De qual tipo de vendedor o Cliente A gosta?"
  • "Quais tipos de clientes o Vendedor B aceita?"

Se a plataforma continuar mostrando sempre os mesmos vendedores populares, ela nunca aprenderá se um novo vendedor é, na verdade, uma ótima combinação para um tipo específico de cliente. Mas se ela mostrar muitos vendedores aleatórios, perderá tempo e dinheiro com combinações ruins. Este é o clássico dilema "Exploração vs. Explotação" (Exploration vs. Exploitation).

A Solução: O Algoritmo de "Aprendizado de Duas Vias"

Os autores criaram um programa de computador inteligente (um algoritmo) chamado TWL-UCB. Pense nele como um cupido super observador que mantém uma "pontuação de confiança" para cada possível combinação.

  1. O Jogo de Adivinhação: O algoritmo começa supondo o quanto os clientes e vendedores gostam um do outro.
  2. O Teste do "E Se": O algoritmo usa um truque matemático chamado "Limite Superior de Confiança" (UCB - Upper Confidence Bound). Imagine que o algoritmo está jogando com cautela, mas também assumindo riscos calculados. Ele pensa: "Estou 90% seguro de que o Cliente A gosta do Vendedor X, mas estou apenas 50% seguro sobre o Vendedor Y. Vamos tentar o Vendedor Y só para ver, porque se eu estiver certo, pode ser uma grande vitória!"
  3. A Verificação Dupla: Diferente dos métodos mais antigos que apenas observavam o que os clientes faziam, este algoritmo observa ambos os lados.
    • Ele atualiza sua suposição sobre o que os clientes gostam toda vez que um cliente faz uma escolha.
    • Ele atualiza sua suposição sobre o que os vendedores gostam toda vez que um vendedor aceita ou rejeita uma proposta.
  4. O Resultado: Com o tempo, o algoritmo torna-se incrivelmente bom em prever a combinação perfeita, minimizando o número de encontros fracassados (arrependimento/regret).

As Grandes Descobertas

Os autores provam três coisas principais usando matemática e simulações computacionais:

1. Ele Melhora Rápido (A Vitória "Polilogarítmica")
Os autores provaram que seu algoritmo aprende de forma tão eficiente que os "erros" que ele comete crescem muito lentamente ao longo do tempo. Em termos matemáticos, o erro cresce como o quadrado de um logaritmo (uma curva muito lenta).

  • Analogia: Imagine um aluno fazendo uma prova. A maioria dos métodos de aprendizado faz com que os erros se acumulem como uma colina íngreme. Este algoritmo faz com que os erros se acumulem como uma inclinação suave. Ele aprende as regras do jogo muito mais rápido do que qualquer outro.

2. Você Não Pode Fazer Muito Melhor (O "Limite Inferior")
Os autores também provaram que nenhum outro método possível poderia aprender significativamente mais rápido do que o deles. Eles mostraram que mesmo um algoritmo "perfeito" ainda cometeria um número semelhante de erros no pior cenário.

  • Analogia: Eles provaram que seu algoritmo é o "Medalhista de Ouro". Você não pode vencer uma corrida mais rápido porque a própria pista é tão rápida quanto isso.

3. Maior Nem Sempre é Melhor (A Surpresa do "Tamanho do Menu")
Eles realizaram simulações para ver o que acontece se a plataforma mostrar uma lista enorme de vendedores (um menu grande) versus uma lista pequena.

  • O Achado: Uma vez que o menu atinge um certo tamanho (cerca de 30 vendedores em sua simulação), torná-lo maior não ajuda muito.
  • Analogia: Pense no menu de um restaurante. Se você tem 5 pratos excelentes, adicionar 50 pratos medíocres não deixa o cliente mais feliz; apenas o confunde. A plataforma obtém o mesmo número de combinações bem-sucedidas com um menu de tamanho médio do que com um menu massivo.

Por Que Isso Importa

Este artigo é o primeiro a resolver o quebra-cabeça de aprender ambos os lados de um mercado simultaneamente, quando você não sabe o que nenhum dos lados quer. Ele mostra que, ao tratar o problema como um desafio de aprendizado de "duas vias" em vez de apenas um desafio de "escolha do cliente", as plataformas podem tomar decisões muito mais inteligentes, rápidas e lucrativas.

Em resumo: Para administrar um mercado de duas vias de sucesso, você não pode apenas adivinhar o que o comprador quer; você tem que aprender o que o vendedor quer também. E se você fizer ambos ao mesmo tempo com a matemática certa, você vence.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →