← Últimos artigos
💬 NLP

MixLM: High-Throughput and Effective LLM Ranking via Text-Embedding Mix-Interaction

O MixLM é um novo framework de ranking para LLM que aumenta significativamente o throughput do sistema ao substituir longos inputs de texto por tokens de embedding compactos por meio de um mecanismo de mix-interação, permitindo a implantação eficiente de tráfego total em aplicações de busca do mundo real enquanto mantém alta relevância.

Autores originais: Guoyao Li, Ran He, Shusen Jing, Kayhan Behdin, Yubo Wang, Sundara Raman Ramachandran, Chanh Nguyen, Jian Sheng, Xiaojing Ma, Chuanrui Zhu, Sriram Vasudevan, Muchen Wu, Sayan Ghosh, Lin Su, Qingquan So
Publicado 2026-02-03
📖 4 min de leitura☕ Leitura rápida

Autores originais: Guoyao Li, Ran He, Shusen Jing, Kayhan Behdin, Yubo Wang, Sundara Raman Ramachandran, Chanh Nguyen, Jian Sheng, Xiaojing Ma, Chuanrui Zhu, Sriram Vasudevan, Muchen Wu, Sayan Ghosh, Lin Su, Qingquan Song, Xiaoqing Wang, Zhipeng Wang, Qing Lan, Yanning Chen, Jingwei Wu, Luke Simon, Wenjing Zhang, Qi Guo, Fedor Borisyuk

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando uma biblioteca gigantesca onde milhões de pessoas pedem recomendações de livros a cada segundo. Você tem um bibliotecário brilhante e superinteligente (o Large Language Model, ou LLM), que consegue ler a descrição inteira de um livro, entender a pergunta do usuário e saber instantaneamente se eles são o par perfeito.

O problema? Este bibliotecário é incrivelmente minucioso. Para dar uma boa resposta, ele precisa ler a descrição inteira do livro para cada um dos livros candidatos. Se um livro tem 2.000 palavras, e você tem 1.000 livros para verificar, o bibliotecário terá que ler 2 milhões de palavras para apenas um pedido de uma pessoa. No mundo real dos servidores de computador, isso demora demais e custa muito dinheiro. A biblioteca fica congestionada, e as pessoas esperam demais.

Conheça o MixLM: O Bibliotecário com "Folha de Consulta".

Os pesquisadores da LinkedIn inventaram uma nova maneira de trabalhar, chamada MixLM. Em vez de fazer o bibliotecário ler a descrição completa do livro toda vez, eles criaram um sistema onde a descrição do livro é pré-processada em uma "folha de consulta" minúscula e supercondensada (alguns números chamados tokens de embedding) antes mesmo de o bibliotecário vê-la.

Veja como funciona, dividido em etapas simples:

1. A "Pré-Leitura" (Estágio Offline)

Imagine que, antes da biblioteca abrir para o dia, uma equipe de assistentes lê cada livro da biblioteca. Em vez de escrever um resumo, eles destilam todo o livro em um único e perfeito "cartão de essência".

  • O Artigo diz: Eles usam um "Encoder LLM" para transformar milhares de palavras de texto do item em um pequeno conjunto de tokens de embedding aprendidos.
  • A Analogia: Esses "cartões de essência" são armazenados em um armário especial de acesso rápido (um cache nearline) bem ao lado da mesa do bibliotecário.

2. O "Mix" (Estágio Online)

Quando um usuário pergunta: "Quero um emprego em ciência de dados", o bibliotecário não precisa ler as descrições completas dos empregos novamente.

  • Ele pega a pergunta do usuário (texto).
  • Ele pega os "cartões de essência" (embeddings) dos principais candidatos a emprego do armário.
  • Ele mistura a pergunta do usuário com esses cartões minúsculos.
  • O Artigo diz: Isso cria uma "representação de interação mista" que combina tokens de texto com tokens de embedding.
  • A Analogia: É como se o bibliotecário estivesse lendo uma nota curta que diz: "Usuário quer Ciência de Dados" + [Cartão para Emprego A] + [Cartão para Emprego B]. O bibliotecário consegue "sentir" instantaneamente a conexão entre o usuário e o emprego sem ter que mergulhar em milhares de palavras.

3. O Resultado: Velocidade e Inteligência

Como o bibliotecário está lendo apenas alguns "cartões" em vez de livros inteiros, ele pode processar solicitações 75 vezes mais rápido do que antes, mantendo-se quase tão inteligente quanto a versão lenta e minuciosa.

  • O Artigo afirma: O MixLM melhora o rendimento (throughput) em 10,0x em comparação com uma abordagem "resumida" e em 75,9x em comparação com a leitura do texto completo.
  • A Analogia: É a diferença entre um bibliotecário que pode verificar 290 livros por hora (o método antigo) versus um que pode verificar 22.000 livros por hora (MixLM), com o mesmo nível de precisão.

Como Eles Ensinaram o Bibliotecário

Você pode se perguntar: "Como o bibliotecário sabe ler esses cartões minúsculos?"
Os pesquisadores usaram um método de treinamento inteligente:

  1. O Professor: Primeiro, eles treinaram um "Super Bibliotecário" que lê livros inteiros e é muito preciso.
  2. O Aluno: Depois, eles treinaram o "Bibliotecário MixLM" para imitar as decisões do Super Bibliotecário, mas usando os cartões minúsculos em vez do texto completo.
  3. O Alinhamento: Eles adicionaram regras especiais (funções de perda/loss functions) para garantir que os "cartões de essência" se encaixem perfeitamente no cérebro do bibliotecário, para que a mistura de texto e cartões pareça natural.

O Impacto no Mundo Real

Quando a LinkedIn colocou este sistema para funcionar em sua funcionalidade de Busca de Empregos:

  • Eles puderam finalmente usar este IA superinteligente para todos (tráfego total), não apenas para alguns usuários sortudos.
  • Como a busca foi mais rápida e inteligente, mais pessoas encontraram empregos de que gostaram.
  • O Artigo afirma: Isso levou a um aumento de 0,47% nos Usuários Ativos Diários (DAU). No mundo de uma plataforma com milhões de usuários, essa pequena porcentagem representa um número enorme de pessoas tendo uma experiência melhor.

Em resumo: O MixLM é como dar a uma IA superinteligente um "marca-texto" que condensa documentos longos em notas pequenas e poderosas. Isso permite que a IA leia mais rápido sem perder sua inteligência, tornando os mecanismos de busca para empregos (e outras coisas) extremamente rápidos e altamente precisos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →